InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
InfiniBench通过LLM引导、集群优化和任务感知摄像头路径,实现无限可定制的3D场景生成,提升空间推理评估能力。
Haoming Wang, Qiyao Xue, Wei Gao
InfiniBench通过LLM引导、集群优化和任务感知摄像头路径,实现无限可定制的3D场景生成,提升空间推理评估能力。
Haoming Wang, Qiyao Xue, Wei Gao
Muskie以多视角掩码重建学习几何一致性,在NAVI上将3D轨迹误差降至2.38厘米。
Wenyu Li, Sidun Liu, Peng Qiao 等
基于Deming循环的多智能体系统SciEducator实现科学视频理解与教育,显著优于现有模型。
Zhiyu Xu, Weilong Yan, Yufei Shi 等
MobileVLA-R1结合CoT和GRPO,提升四足机器人视觉-语言-控制性能,达5%提升。
Ting Huang, Dongjian Li, Rui Yang 等
通过模拟自调阻性元件的模拟系统,展示了双峰现象,验证了模拟物理系统可表现出类似数字AI的泛化行为。
Sam Dillavou, Jason W Rocks, Jacob F Wycoff 等
SketchVerify通过草图验证提高物理感知视频生成的运动规划质量。
Yidong Huang, Zun Wang, Han Lin 等
SMILE结合语义和词汇精确性,显著提升问答评估的效率与准确性。
Shrikant Kendre, Austin Xu, Honglu Zhou 等
ReBaPL结合循环SGHMC和表示空间排斥,提升多模态prompt的多峰探索能力。
Yassir Bendou, Omar Ezzahir, Eduardo Fernandes Montesuma 等
研究表明,即使在非过拟合模型中,边界样本仍易受成员推断攻击,提出了logit重加权防御策略。
Mona Khalil, Alberto Blanco-Justicia, Najeeb Jebreel 等
提出TwiG框架,实现视觉生成中文本推理的实时交错,显著提升语义丰富度。
Ziyu Guo, Renrui Zhang, Hongyu Li 等
Nemotron Elastic通过嵌套子模型实现高效多合一推理,训练成本减少360倍。
Ali Taghibakhshi, Sharath Turuvekere Sreenivas, Saurav Muralidharan 等
提出AINA框架,利用智能眼镜采集人类多环境演示,实现多指机器人无数据训练。
Irmak Guzey, Haozhi Qi, Julen Urain 等
提出认知基础分类,分析18模型192K推理轨迹,提升复杂问题推理性能66.7%。
Priyanka Kargupta, Shuyue Stella Li, Haocheng Wang 等
提出MiMo-Embodied,融合自主驾驶与 embodied AI 的跨域基础模型,基于多阶段训练实现17项embodied AI基准和12项自动驾驶基准的最优性能。
Xiaoshuai Hao, Lei Zhou, Zhijian Huang 等
提出基于熵正则化逆最优输运的凸优化方法,用于从聚合数据估计马尔可夫链转移矩阵,实验显示在噪声和样本有限条件下具有优越性能。
Michele Mascherpa, Axel Ringh, Amirhossein Taghvaei 等
提出VLA-Fool,结合文本、视觉和跨模态攻击,揭示VLA模型在多模态扰动下的脆弱性。
Yuping Yan, Yuhan Xie, Yixin Zhang 等
ENNs与Tikhonov-NN以网络宽度正则化;理论保证噪声趋零时收敛,宽度可达O(δ^{-2/θ})。
Lan Wang, Qiao Zhu, Bangti Jin 等
提出加权Token重要性机制,提升ColBERT多向检索性能,零-shot提升1.28%,微调达3.66%。
Archish S, Ankit Garg, Kirankumar Shiragur 等
提出GESC,利用投影机制取消自干扰,显著提升异质图性能。
Yoonhyuk Choi, Jiho Choi, Jiwoo Kang
QueryGym是一个支持多种LLM查询重写方法的Python工具包,集成了BEIR和MS MARCO基准,提升检索效果。
Amin Bigdeli, Radin Hamidi Rad, Mert Incesu 等