Scaling Cross-Embodiment World Models for Dexterous Manipulation
提出一种基于粒子的跨形态世界模型,实现灵巧操作,提升了未见手的泛化能力。
Zihao He, Bo Ai, Tongzhou Mu 等
提出一种基于粒子的跨形态世界模型,实现灵巧操作,提升了未见手的泛化能力。
Zihao He, Bo Ai, Tongzhou Mu 等
GUI-AIMA通过对齐多模态注意力实现高效GUI定位,平均准确率达61.5%。
Shijie Zhou, Viet Dac Lai, Hao Tan 等
提出SpecDiff-2,结合离散扩散模型与对齐机制,显著提升LLM推理速度达5.5倍。
Jameson Sandler, Jacob K. Christopher, Thomas Hartvigsen 等
VinciCoder通过粗到细视觉强化学习统一多模态代码生成,提升代码执行率和视觉一致性。
Xuanle Zhao, Deyang Jiang, Zhixiong Zeng 等
提出一种基于3D高斯表示和运动扩散先验的对象感知4D人类运动生成框架。
Shurui Gui, Deep Anil Patel, Xiner Li 等
提出分阶段DMD,通过子区间得分匹配,提升多步蒸馏性能,验证在图像视频生成中的优越性。
Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu 等
提出一种数据高效的流式等变抓取合成架构,处理多种抓手类型,数据集包含25000个场景和2000万次抓取。
Roman Freiberg, Alexander Qualmann, Ngo Anh Vien 等
HyperClick通过自我批判强化学习提升GUI定位的可信度,显著提高了信心对齐。
Shaojie Zhang, Pei Fu, Ruoceng Zhang 等
DeepThinkVLA通过双重条件验证,结合混合注意力解码和两阶段训练,显著提升VLA模型性能,达97.0%成功率。
Cheng Yin, Yankai Lin, Wang Xu 等
提出一种多模态神经符号框架,结合全景图像和3D点云,实现机器人领域的空间推理视觉定位。
Simindokht Jahangard, Mehrzad Mohammadi, Abhinav Dhall 等
本研究评估Veo-3视频模型在12个推理维度上的零样本推理能力,发现其在短期空间一致性表现良好,但在长远因果和抽象逻辑方面有限。
Ziyu Guo, Xinyan Chen, Renrui Zhang 等
提出“监督游戏”框架,利用Markov潜在博弈保证AI自主性与安全的内在对齐。
William Overman, Mohsen Bayati
提出基于置信度的混合评估方法,提升AI与人类在事实验证中的协作效果。
Rishub Jain, Sophie Bridgers, Lili Janzer 等
基于影响函数的离策略数据选择方法CROPI,显著提升大模型RLVR训练效率。
Erle Zhu, Dazhi Jiang, Yuan Wang 等
Agent Skills框架易受简单提示注入攻击,导致敏感数据泄露。
David Schmotz, Sahar Abdelnabi, Maksym Andriushchenko
提出CATG,基于约束流匹配的端到端自主驾驶轨迹生成框架,有效避免模式崩溃,融入安全约束。
Lin Liu, Guanyi Yu, Ziying Song 等
PHUMA利用物理约束的运动筛选与重定向,构建73小时高可靠性 humanoid 数据集。
Kyungmin Lee, Sibeen Kim, Youngdo Lee 等
提出PLD框架,通过残差RL和分布感知数据采集,显著提升VLA模型性能。
Wenli Xiao, Haotian Lin, Andy Peng 等
FM Agent结合LLM推理与演化搜索,实现多领域自主优化,性能提升显著。
Annan Li, Chufan Wu, Zengle Ge 等
OneTrans采用统一Transformer架构,实现特征交互与序列建模,提升工业推荐系统性能。
Zhaoqi Zhang, Haolei Pei, Jun Guo 等