JointDiT: Enhancing RGB-Depth Joint Modeling with Diffusion Transformers
提出JointDiT,基于扩散变换器实现RGB-深度联合建模,支持多任务生成。
Kwon Byung-Ki, Qi Dai, Lee Hyoseok 等
提出JointDiT,基于扩散变换器实现RGB-深度联合建模,支持多任务生成。
Kwon Byung-Ki, Qi Dai, Lee Hyoseok 等
本综述分析物理模拟器在机器人导航与操作中的作用,重点关注模拟特性对实地迁移的影响。
Lik Hang Kenny Wong, Xueyang Kang, Kaixin Bai 等
Common3D利用自监督学习,从视频中构建面向普通物体的3D变形模型,提升姿态和对应关系估计。
Leonhard Sommer, Olaf Dünkel, Christian Theobalt 等
LongFuncEval评估长上下文模型在函数调用中的有效性,性能下降7%-85%。
Kiran Kate, Tejaswini Pedapati, Kinjal Basu 等
ImaginateAR结合场景理解、3D生成和LLM,实现语音驱动的户外AR创作,3D生成速度提升30%。
Jaewook Lee, Filippo Aleotti, Diego Mazala 等
强化学习提升多模态大模型推理能力,提出价值模型自由和基于价值模型的方法。
Guanghao Zhou, Panjia Qiu, Cen Chen 等
提出CMT:基于边界表示的多模态级联MAR,支持复杂CAD生成,提升覆盖率10.68%。
Jianyu Wu, Yizhou Wang, Xiangyu Yue 等
OGPIT方法通过高斯过程和信赖域框架优化高方差随机函数,提升效率。
Mickael Binois, Jeffrey Larson
利用分支潜在神经映射(BLNM)结合统计形状模型,构建心脏几何变异的全场代理模型,预测心脏激活图。
Elena Martinez, Beatrice Moscoloni, Matteo Salvador 等
CarbonCall通过动态工具选择与碳感知执行,显著降低边缘设备LLM能耗与碳排放。
Varatheepan Paramanayakam, Andreas Karatzas, Iraklis Anagnostopoulos 等
提出DRO:基于频率调制连续波雷达的SE(2)直接里程计,结合多普勒信息实现高精度定位。
Cedric Le Gentil, Leonardo Brizi, Daniil Lisus 等
采用AutoNuggetizer自动评估LLM回答的关键信息块,与人类偏好显著相关。
Sahel Sharifymoghaddam, Shivani Upadhyay, Nandan Thakur 等
RepText利用复制机制增强单语文本生成模型,精准复现多语种视觉文本。
Haofan Wang, Yujia Xu, Yimeng Li 等
ARTEMIS用自回归+MoE在NAVSIM上达87.0 PDMS、83.1 EPDMS。
Renju Feng, Ning Xi, Duanfeng Chu 等
DISCO结合超网络与神经微分方程,短轨迹预测多物理场景,性能优越。
Rudy Morel, Jiequn Han, Edouard Oyallon
本研究提出BrowseComp-ZH基准,评估中文大模型的网页浏览能力,涵盖289题,模型准确率普遍低于20%。
Peilin Zhou, Bruce Leon, Xiang Ying 等
提出可扩展监督的框架,模型能力与成功概率的比例关系,验证于多游戏场景。
Joshua Engels, David D. Baek, Subhash Kantamneni 等
Sky-Drive以CARLA、RPC和人机协同模块构建分布式多智能体交通仿真平台,论文暂未报告定量性能提升。
Zilin Huang, Zihao Sheng, Zhengyang Wan 等
第四届单目深度估计挑战赛提高3D F-Score至23.05%,采用仿射不变预测。
Anton Obukhov, Matteo Poggi, Fabio Tosi 等
StarPO与StarPO-S揭示多轮智能体RL的Echo Trap;FrozenLake筛选可将稳定期由100步延至140步。
Zihan Wang, Kangrui Wang, Qineng Wang 等