FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
FT-Dojo通过FT-Agent实现自动化LLM微调,在13个任务中表现优异。
Qizheng Li, Yifei Zhang, Xiao Yang 等
FT-Dojo通过FT-Agent实现自动化LLM微调,在13个任务中表现优异。
Qizheng Li, Yifei Zhang, Xiao Yang 等
提出Gome,基于梯度优化的MLE智能体,在MLE-Bench达35.1%的获奖率,超越树搜索方法。
Yifei Zhang, Xu Yang, Xiao Yang 等
LinkVLA通过统一语言和动作令牌,提升自动驾驶指令遵循准确率至91.01分。
Xinyang Wang, Qian Liu, Wenjie Ding 等
UniTalking框架通过多模态Transformer块实现高保真语音和同步视频生成,超越现有开源方法。
Hebeizi Li, Zihao Liang, Benyuan Sun 等
提出VACO,通过优势对齐与TV过滤缓解异步强化学习中的策略滞后,提升鲁棒性。
Homayoun Honari, Roger Creus Castanyer, Michael Przystupa 等
提出RMBench基准和Mem-0策略,系统评估记忆能力在机器人操作中的作用。
Tianxing Chen, Yuran Wang, Mingleyang Li 等
ReGFT利用人类参考解,合成硬题正轨,提升RL训练效果,显著改善奖励稀疏问题。
Yangzhen Wu, Shanda Li, Zixin Wen 等
Semantic XPath通过树状结构访问对话记忆,性能提升176.7%,仅用9.1%令牌。
Yifan Simon Liu, Ruifan Wu, Liam Gallagher 等
vEcho利用大语言模型实现从被动验证到主动发现漏洞的范式转变,检测率达65%,误报率降至59.78%。
Mingcheng Jiang, Jiancheng Huang, Jiangfei Wang 等
提出基于核函数的LMI方法求解非线性最优控制中的HJB方程,结合Riccati-Hessian等式实现精确逼近。
Boumediene Hamzi, Umesh Vaidya
FlexiMMT实现多对象多运动转移,使用运动解耦掩码注意机制,提升了23%的运动保真度。
Yuze Li, Dong Gong, Xiao Cao 等
SOLACE通过内在自信信号提升文本生成图像的质量,减少外部监督需求。
Seungwook Kim, Minsu Cho
Minimalist Compliance Control利用电机电流信号实现无传感器的合规控制,适用于多种机器人。
Haochen Shi, Songbo Hu, Yifan Hou 等
RLAR利用LLM自主检索和合成奖励模型,提升多任务强化学习性能10-60%。
Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen 等
K²-Agent通过分离和共同进化的方式提升移动设备控制,达到76.1%的成功率。
Zhe Wu, Donglin Mo, Hongjin Lu 等
提出基于黎曼几何的异质超图神经网络,解决异质与同质超图的长距离依赖问题。
Li Sun, Ming Zhang, Wenxin Jin 等
SWE-Hub通过环境自动化、规模合成与多任务生成,构建了面向软件工程全生命周期的统一生产系统。
Yucheng Zeng, Shupeng Li, Daxiang Dong 等
提出IFCodeEvolve,通过演员-模式协同演化生成可调控指令编码数据,显著提升模型性能。
Tinglin Huang, Bo Chen, Xiao Zhang 等
AxProverBase通过迭代证明精炼和上下文管理,在简化架构下实现了与先进方法相当的性能。
Borja Requena, Austin Letson, Krystian Nowakowski 等
提出了smooth-rank算法,优化连续条件分布下的双部排序,提升ROC曲线精度。
James Cheshire, Stephan Clémençon