MoReact: Generating Reactive Motion from Textual Descriptions
MoReact通过扩散模型生成基于文本描述的反应动作,显著提升交互真实感。
Xiyan Xu, Sirui Xu, Yu-Xiong Wang 等
MoReact通过扩散模型生成基于文本描述的反应动作,显著提升交互真实感。
Xiyan Xu, Sirui Xu, Yu-Xiong Wang 等
提出基于多智能体强化学习的能效无人机群通信与控制联合优化方法,提升公平性与节能效果。
Tianjiao Sun, Ningyan Guo, Haozhe Gu 等
DocPruner通过自适应修剪patch级嵌入,降低多向量视觉文档检索存储成本50-60%。
Yibo Yan, Guangwei Xu, Xin Zou 等
GUI-Shepherd通过过程奖励模型提高长序列GUI任务成功率7.7个百分点。
Cong Chen, Kaixiang Ji, Hao Zhong 等
提出ReWatch数据集及多阶段合成,结合多智能体ReAct框架,提升大视觉-语言模型视频推理能力。
Congzhi Zhang, Zhibin Wang, Yinchao Ma 等
提出CLAP框架,通过任务分解和3D关键点预测实现机器人操控的泛化,成功在GemBench提升12%的成功率。
Jianshu Hu, Lidi Wang, Shujia Li 等
双分布框架评估SFT/DPO法:未来泛化困难,DPO刷新最高提升7.6个百分点。
Janvijay Singh, Austin Xu, Yilun Zhou 等
SPEC-RL结合投机解码技术,通过重用前一轮轨迹段,实现RL训练中rollout速度提升2-3倍,保持策略性能。
Bingshuai Liu, Ante Wang, Zijun Min 等
提出几何框架利用信念集(credal sets)衡量大模型创意变异的校准差距,分析500个写作提示,模型校准最高仅达0.434。
Esteban Garces Arias, Julian Rodemann, Christian Heumann
ARMimic利用XR头显进行被动示范,融合手部追踪与虚拟机器人,提升数据采集效率与泛化能力。
Rohan Walia, Yusheng Wang, Ralf Römer 等
提出WoW模型,基于2百万机器人交互轨迹,具备物理直觉和因果推理能力。
Xiaowei Chi, Peidong Jia, Chun-Kai Fan 等
采用n-gram新颖度评估文本创造力,发现其与专家评判存在偏差,强调多维度评价的重要性。
Arkadiy Saakyan, Najoung Kim, Smaranda Muresan 等
LongLive采用因果帧级自回归模型,结合KV重置机制,实现20.7FPS的实时长视频生成,支持240秒视频。
Shuai Yang, Wei Huang, Ruihang Chu 等
JanusVLN利用双隐式神经记忆,分离空间几何与语义信息,提升视觉-语言导航性能。
Shuang Zeng, Dekang Qi, Xinyuan Chang 等
提出AMBS方法,在LLaMA-2-7B上提高HHH表现至56.5%,同时保持效率。
Gautam Siddharth Kashyap, Mark Dras, Usman Naseem
提出EELMA算法,基于信息论评估语言模型代理的影响力,显示与任务表现高度相关。
Jinyeop Song, Jeff Gore, Max Kleiman-Weiner
提出基于拍卖的多机器人任务分配算法AURA,有效处理任务需求不确定性,提升任务完成率。
Ben Rossano, Jaein Lim, Jonathan P. How
Aurora为多模态时间序列基础模型,支持零样本跨域预测,采用流匹配和原型引导机制。
Xingjian Wu, Jianxin Jin, Wanghui Qiu 等
提出Representation Gradient Tracing(RepT)框架,精确追溯LLM不良行为的根源,提升样本和词级归因性能。
Zhe Li, Wei Zhao, Yige Li 等
MimicDreamer通过视觉、视角和动作对齐,将人类演示转化为机器人训练数据,提升VLA模型性能。
Haoyun Li, Ivan Zhang, Runqi Ouyang 等