RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation
提出RoboTron-Mani多模态机器人操作模型,融合多数据集,提升3D感知与泛化能力。
Feng Yan, Fanfan Liu, Liming Zheng 等
提出RoboTron-Mani多模态机器人操作模型,融合多数据集,提升3D感知与泛化能力。
Feng Yan, Fanfan Liu, Liming Zheng 等
提出经济计量框架,确保LLMs预测与估计的有效性,强调无训练泄漏与验证样本的重要性。
Jens Ludwig, Sendhil Mullainathan, Ashesh Rambachan
MV-DUSt3R+在2秒内从稀疏视图重建场景,显著提升速度和精度。
Zhenggang Tang, Yuchen Fan, Dilin Wang 等
P3-PO通过人类标注的语义点和视觉模型实现机器人策略的空间泛化,提升43%的整体性能。
Mara Levy, Siddhant Haldar, Lerrel Pinto 等
提出主动T2I代理,通过提问和信念图实现多轮文本到图像生成的高效对齐。
Meera Hahn, Wenjun Zeng, Nithish Kannen 等
Coconut方法通过连续潜在空间推理显著提升逻辑任务表现,实验表明其在ProsQA上优于传统CoT。
Shibo Hao, Sainbayar Sukhbaatar, DiJia Su 等
提出Gated DeltaNet,通过门控与Delta规则结合,显著提升长序列任务性能。
Songlin Yang, Jan Kautz, Ali Hatamizadeh
Mamba和状态空间模型的计算能力与Transformer相同,无法解决TC0之外的问题。
Yifang Chen, Xiaoyu Li, Yingyu Liang 等
本论文系统综述了基于大规模语言模型(LLMs)作为评估者的方法,涵盖功能、方法、应用、元评估与局限,强调其创新与挑战。
Haitao Li, Qian Dong, Junjie Chen 等
SAME模型实现多任务通用视觉导航,超越单任务模型,利用状态自适应专家混合机制。
Gengze Zhou, Yicong Hong, Zun Wang 等
UniScene以占据为枢纽,统一生成视频/激光雷达/占据。
Bohan Li, Jiazhe Guo, Hongsi Liu 等
InternVL 2.5通过模型、数据和测试时扩展,实现对开源多模态模型性能的显著提升,突破70% MMMU指标。
Zhe Chen, Weiyun Wang, Yue Cao 等
TeamCraft基于Minecraft,构建55,000多模态多智能体任务,评估模型泛化能力。
Qian Long, Zhi Li, Ran Gong 等
提出基于黎曼偏微分方程的距离场方法,结合神经网络实现高维机器人路径优化。
Yiming Li, Jiacheng Qiu, Sylvain Calinon
提出ADU-Bench基准,评估16个LALMs在多场景、多技能、多语种和模糊处理的音频对话理解能力。
Kuofeng Gao, Shu-Tao Xia, Ke Xu 等
采用能量优化和生命周期评估策略,降低大规模语言模型的环境影响。
Aditi Singh, Nirmal Prakashbhai Patel, Abul Ehtesham 等
REGENT通过检索增强的Transformer策略,无需微调即可在新环境中快速泛化,参数少、数据少。
Kaustubh Sridhar, Souradeep Dutta, Dinesh Jayaraman 等
NVILA通过“先放大再压缩”策略,提升高分辨率图像和长视频处理效率,训练成本降低1.9-5.1倍。
Zhijian Liu, Ligeng Zhu, Baifeng Shi 等
VisionZip通过选择高信息量视觉Token,减少冗余,提升效率,性能提升至少5%。
Senqiao Yang, Yukang Chen, Zhuotao Tian 等
Moto利用潜在运动Token进行无监督预训练,提升机器人操控性能,关键指标成功率达61.4%。
Yi Chen, Yuying Ge, Weiliang Tang 等