AMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body Control
提出AMO框架,结合模拟强化学习与轨迹优化,实现人形机器人高维度全身运动控制。
Jialong Li, Xuxin Cheng, Tianshu Huang 等
提出AMO框架,结合模拟强化学习与轨迹优化,实现人形机器人高维度全身运动控制。
Jialong Li, Xuxin Cheng, Tianshu Huang 等
VIDEOMIMIC通过单目视频重建人类与环境,训练环境条件下的全身控制策略,实现机器人在复杂场景中的自主行为。
Arthur Allshire, Hongsuk Choi, Junyi Zhang 等
LlamaFirewall利用PromptGuard 2、Agent Alignment Checks和CodeShield三大防护机制,有效抵御LLM代理的提示注入、目标偏离和不安全代码生成,提升系统安全性。
Sahana Chennabasappa, Cyrus Nikolaidis, Daniel Song 等
综述CoT、RAG与验证器如何协同提升LLM复杂问题求解,但未报告统一实验指标。
Da Zheng, Lun Du, Junwei Su 等
提出绝对零(Absolute Zero)自我演化RLVR模型AZR,零数据训练,优化推理能力。
Andrew Zhao, Yiran Wu, Yang Yue 等
MORE通过场景图和子图筛选实现零样本移动操作规划,提升大规模环境中的可靠性。
Mohammad Mohammadi, Daniel Honerkamp, Martin Büchner 等
通过奖励信号指导LLM行为,采用RLHF、RLAIF等技术,实现动态反馈学习。
Xiaobao Wu
提出融合扩散与自回归的统一多模态模型,提升理解与生成能力。
Shanshan Zhao, Xinjie Zhang, Jintao Guo 等
El Agente Q基于LLM的多智能体系统,自动执行量子化学工作流,任务成功率超过87%。
Yunheng Zou, Austin H. Cheng, Abdulrahman Aldossary 等
RM-R1将奖励建模作为推理任务,通过链式推理和Rubrics机制提升性能,超越更大模型。
Xiusi Chen, Gaotang Li, Ziqi Wang 等
本研究分析LLMs在长文机器翻译评估中的长度偏差,提出FSP和微调策略改善其一致性。
Tobias Domhan, Dawei Zhu
VLoRP引入多粒度低秩梯度投影,提升LLM微调的内存效率与稳定性。
Yezhen Wang, Zhouhao Yang, Brian K Chen 等
DetoxAI是基于代表层干预的深度学习偏差消除工具包,支持多种最新算法,提升视觉模型公平性。
Ignacy Stępka, Lukasz Sztukiewicz, Michał Wiliński 等
提出模块化GP-GOMEA,支持多树协同进化,提升符号回归的表达能力与可解释性。
Joe Harrison, Peter A. N. Bosman, Tanja Alderliesten
提出SynPAT,自动生成具有数据的合成物理理论,包括公理、推导目标和噪声数据。
Jonathan Lenchner, Karan Srivastava, Joao Goncalves 等
提出SpatialLLM,通过3D感知数据与多阶段训练,提升模型3D空间推理能力,超越GPT-4o 8.7%。
Wufei Ma, Luoxin Ye, Celso M de Melo 等
提出RoVI通过手绘符号实现机器人空间指令,结合VIEW实现高精度操作,达87.5%成功率。
Yanbang Li, Ziyang Gong, Haoyang Li 等
提出DeepCritic两阶段框架,利用Qwen2.5-72B-Instruct增强数学推理批判能力,显著优于现有模型。
Wenkai Yang, Jingwen Chen, Yankai Lin 等
本研究比较大规模语言模型在上下文学习与微调中的泛化能力,提出增强微调的推理追踪方法。
Andrew K. Lampinen, Arslan Chaudhry, Stephanie C. Y. Chan 等
提出COIL(成本最优交互学习)将多任务学习转化为无容量设施选址问题,有效降低人类负担。
Shivam Vats, Michelle Zhao, Patrick Callaghan 等