Knowledge-Centric Self-Improvement
知识中心自我提升方法,通过知识库实现任务转移,提升解决率和成本效率。
Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu 等
知识中心自我提升方法,通过知识库实现任务转移,提升解决率和成本效率。
Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu 等
提出基于几何增强的图对比学习预训练框架,有效提升TSP解题性能,1000节点提升6.57%。
David Aguado, Daniel Fuertes, Carlos R. del-Blanco 等
提出TARA框架,通过类型感知修复分配显著提升文本到图像语义准确率。
Haoyue Liu, Xiaoyu Ma, Ye Chen 等
LaT采用预训练大模型作为外部训练器,提升多任务车辆路径问题解的解决质量。
Yang Wang, Ya-Hui Jia, Wei-Neng Chen 等
CoDID通过迭代模式发现和元优化协调机制实现了在隐藏相关性下的解缠学习,准确率提升7.8%。
Rong Hu, Ling Chen
本研究系统评估了基于LoRA的代码代理轨迹数据筛选方法,发现数据量对模型性能影响更大。
Yunze Han
提出多样性导向微调策略(SFT和DPO),提升模型在语义熵检测中的假象识别能力。
Qiuyuan Li, Hongliang Dai, Piji Li
提出TTCov在部署场景中通过测试条件数据筛选提升自主驾驶性能,显著优于基线。
Nadine Chang, Maying Shen, Shizhe Diao 等
提出Plover,基于计划的视觉GUI自动化系统,通过外部化任务计划实现可检视、可修正,提升透明度与控制性。
Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo 等
提出MCPEvol-Bench,通过11个突变算子模拟MCP服务器演化,评估12个LLM模型在动态工具环境中的适应性。
Huanxi Liu, Kun Hu, Jiaqi Liao 等
MathCoPilot结合人机协作,通过动态蓝图和多技能调度提升数学证明效率。
Junjie Zhang, Jiayu Liu, Wenbin Liu 等
深度递归Transformer实现每个token的固定点收敛,平均深度减少38%。
Joe Logan
提出pairwise validator替代单一奖励,提升自我进化代理性能,匹配或超越全奖励基线。
Minghao Liu, Yu Wang, Jiayun Wang 等
提出ASOC,结合LLM驱动的自主代理,强调工程原则与系统可信性。
Amin Beheshti, Rong N. Chang, Boualem Benatallah 等
提出基于环境扩展的自我演化医疗智能体架构,增强其在临床环境中的自主性和可靠性。
Chunzheng Zhu, Lei Tian, Bohan Tan 等
提出E-P-R框架诊断AI代理在多步行动中对冲突记忆的利用,揭示“合规陷阱”。
Yixiong Chen, Xinyi Bai, Alan Yuille
提出Agentic-DPO,通过专家轨迹实现无环境交互的偏好引导强化训练,显著提升模型性能。
Yixiong Chen, Alan Yuille
提出Who&When Pro,基于误差注入的自动失败归因,构建12326条多模态高质量标注。
Jiale Liu, Huajun Xi, Shaokun Zhang 等
提出长远终端基准Long-Horizon-Terminal-Bench,涵盖46个长流程任务,强调密集奖励与部分信用,评估模型长时表现。
Zongxia Li, Zhongzhi Li, Yucheng Shi 等
提出自我修补技术揭示大模型微调中记忆知识未能有效迁移的机制,达成58-75%的性能恢复。
Lu Dai, Ziyang Rao, Yili Wang 等