DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
DualCoT-VLA通过并行推理实现视觉-语言-动作模型的视觉语言思维链,提升复杂任务的执行效率。
Zhide Zhong, Junfeng Li, Junjie He 等
DualCoT-VLA通过并行推理实现视觉-语言-动作模型的视觉语言思维链,提升复杂任务的执行效率。
Zhide Zhong, Junfeng Li, Junjie He 等
3D-Layout-R1通过场景图推理实现语言指导的空间布局编辑,IoU提升15%,中心距离误差减少25%。
Haoyu Zhen, Xiaolong Li, Yilin Zhao 等
研究揭示视觉语言模型中空间变量绑定的双重机制,提升COCO数据集上的性能。
Kelly Cui, Nikhil Prakash, Shoval Messica 等
Scaling DoRA通过分解范数和融合内核实现高阶适配,显著降低内存使用,提升速度。
Alexandra Zelenin, Alexandra Zhuravlyova
TiCo方法通过语音时间标记显著提高对话模型的时间控制能力,MAE降至4.54秒。
Kai-Wei Chang, Wei-Chih Chen, En-Pei Hu 等
DexDrummer结合轨迹规划和残差强化学习,实现1.0的F1分数。
Hung-Chieh Fang, Amber Xie, Jennifer Grannen 等
MemDLM通过双层优化嵌入模拟去噪过程,提升DLM训练效率和长文本理解能力。
Zehua Pei, Hui-Ling Zhen, Weizhe Lin 等
SPA方法通过精心设计的提示生成大规模合成数据,实现知识注入,表现优异。
Kexian Tang, Jiani Wang, Shaowen Wang 等
NMR框架通过动态映射解决人形机器人运动重定向问题,显著减少关节跳跃和自碰撞。
Qingrui Zhao, Kaiyue Yang, Xiyu Wang 等
P-Flow利用测试时优化文本提示,实现无需训练的动态视觉特效定制。
Rui Zhao, Mike Zheng Shou
GeoFusion-CAD通过几何状态空间扩展长序列CAD生成,提升240步命令的准确性。
Xiaolei Zhou, Chuangjie Fang, Jie Wu 等
提出适应性视频蒸馏框架,有效缓解过饱和和时间塌陷问题,提升少步生成质量。
Yuyang You, Yongzhi Li, Jiahui Li 等
提出基于图像条件的强化学习方法,实时调节视觉里程计前端参数,提升轨迹长度和效率。
Simone Nascivera, Leonard Bauersfeld, Jeff Delaune 等
TableLong方法通过表格数据提升长上下文推理能力,平均提高8.24%。
Huaibing Xie, Guoliang Zhao, Yang Liu 等
WinDiNet使用预训练视频模型快速模拟城市风流,优化行人舒适度,生成112帧仅需1秒。
Janne Perini, Rafael Bischof, Moab Arar 等
SqueezeComposer通过时间加速生成长音乐,使用扩散模型实现高效、高质量的音乐生成。
Jianyi Chen, Rongxiu Zhong, Shilei Zhang 等
LongCat-Flash-Prover通过工具整合强化学习提升Lean4形式化推理,MiniF2F-Test通过率97.1%。
Jianing Wang, Jianfei Zhang, Qi Guo 等
提出VARS框架,通过在线弱奖励学习用户双向向量,提升多会话个性化交互效率。
Yuren Hao, Shuhaib Mehri, ChengXiang Zhai 等
PUPPET框架预测LLM对人类信念的影响,相关性达r=0.3-0.5,揭示模型偏差。
Jocelyn Shen, Amina Luvsanchultem, Jessica Kim 等
提出Spectral-Sphere-Constrained Hyper-Connections (sHC),突破Birkhoff多面体限制,增强模型表达力。
Zhaoyi Liu, Haichuan Zhang, Ang Li