Localized Conformal Prediction for Image Classification with Vision-Language Models
提出局部一致性预测(LCP)结合视觉-语言模型,利用非线性变换提升图像分类中的预测集效率。
Clément Fuchs, Tim Bary, Benoît Macq
提出局部一致性预测(LCP)结合视觉-语言模型,利用非线性变换提升图像分类中的预测集效率。
Clément Fuchs, Tim Bary, Benoît Macq
MV-GEL利用多视角排序和VLM推理实现网格几何实体的自然语言定位,IoU最高达1.7倍。
Kartik Bali, Roland Aydin
SimpleSearch-VL通过FAR优化采样效率,结合证据验证提升可靠性,保持轻量工具接口,显著提升多模态搜索性能。
Ming Dai, Zhihong Lu, Jinjie Gu 等
提出ChronoFlow-Policy,融合过去、当前、未来交互动态的3D关键点流,提升机器人操控性能。
Bokai Lin, Yifu Xu, Xinyu Zhan 等
提出SAGE框架,通过多假设失败归因提升自主研究的可靠性,从42%提升至92%。
Jie Ma, Binfei Chu, Jie Gao 等
Xiaomi-GUI-0在真实设备上实现72.0%成功率,显著提高稳定性。
Wanxia Cao, Chengzhen Duan, Pei Fu 等
通过失败学习:利用失败轨迹在推理时自我改进,成功率提升6.6个百分点。
Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt 等
Embodied CAD结合LLM和几何求解器,采用分层技能库实现参数化装配建模。
Fumin Liu, Haoyu Zhou, Fei Hao 等
Delta-JEPA通过Latent Difference Decoder实现动作敏感的潜在世界模型,提升规划性能。
Zhenghao Zhang, Yuanxiang Wang, Zhenyu Guan 等
ForgeDrive通过视觉-动作双向交叉条件生成,在NAVSIM上实现90.3 EPDMS,统一驾驶模拟与规划。
Xuchang Zhong, He Zheng, Chenxu Zhao 等
提出RosettaSim,基于结构化自回归模型实现长时域交通模拟,结合注意力机制和语义检索,提升准确性与稳定性。
Lingyu Xiao, Zexin Feng, Xintao Yan
AETDICE结合AET框架,实现非线性多目标强化学习的离线优化,解决SER与ESR的分裂问题。
Woosung Kim, Youngjun Suh, Jinho Lee 等
提出View-PNDF,通过选择性神经元实现多视角胸片报告一致性,显著提升生成质量。
Yucheng Chen, Jinjing Zhu, Yang Yu 等
提出基于Lean编译和语义判定的信实性评价框架,覆盖400题数学声明,揭示编译通过但语义不符的30%差距。
Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy 等
引入“图灵式标签模仿游戏”框架,通过TTN实现零样本伪标签筛查,提升多模型性能。
Brent A. Griffin, Jason J. Corso
GradeSQL框架通过ORM提升Text-to-SQL的可靠性,在BIRD上提升4.33%。
Mattia Tritto, Giuseppe Farano, Dario Di Palma 等
通过混合整数线性规划实现时间窗口时序逻辑的鲁棒性合成,提升控制输入的鲁棒性。
Philip Smith, Ahmad Ahmad, Kevin Leahy
提出DERAIL攻击框架,利用生成驾驶规划中的评分头漏洞,导致安全性显著下降(碰撞率达50%)。
Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu 等
RTSM方法在稀疏标签的域适应目标检测中提升1.7到18.3 AP50。
Lijun Zhang, Ruinian Xu, Mudit Agrawal
HSAP结合层次化序列感知算法,有效支持超长混合上下文序列的生成模型。
Songxin Zhang, Zejian Xie, Zhuoyang Song 等