Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies
CI-MSE通过关注关键任务段,显著提高了离线验证与真实表现的相关性。
Haoxu Huang, Tongsam Zheng, Yifan Chen 等
CI-MSE通过关注关键任务段,显著提高了离线验证与真实表现的相关性。
Haoxu Huang, Tongsam Zheng, Yifan Chen 等
SABER-Math通过自动化构建数学信息检索基准,利用大模型提取和排序,显著提升符号密集领域的检索效果。
Nikolay Georgiev, Maria Drencheva, Kseniia Ibragimova 等
提出跨模态特异稀疏自编码器,解决概念在图像与文本中的方向差异,提升跨模态表示的重建与检索性能。
Chungpa Lee, Jihoon Kwon, Kyle Min 等
提出Dual-Flow RL,结合条件流匹配实现连续回报分布与多模策略,增强探索与估值。
Qijun Li, Zheng Fu, Qi Song 等
提出Nemotron-Labs-Diffusion-Image,结合可动态修正的离散掩码扩散模型,提升高分辨率图像生成质量,达成0.90的GenEval评分。
Shufan Li, Greg Heinrich, Hanrong Ye 等
提出基于结构分析概念的记忆框架,提升长时程机器人操控的对象追踪与技能重用。
Mingyang Sun, Xiujian Liang, Jiude Wei 等
GUICrafter通过弱监督学习和大量未标注截图,提升GUI代理的跨设备泛化能力。
Sunqi Fan, Lingshan Chen, Runqi Yin 等
通过冻结OpenVLA策略,使用线性探测器检测视觉分布转移下的故障信号,AUROC达0.972。
Dipesh Tharu Mahato, Rachel Ren
SFBench是一个评估科学主张可行性的基准数据集,包含197个材料科学主张及其可行性评分。
Cash Costello, James Mayfield, Elsbeth Turcan 等
提出MultiDepth-3k基准,使用Laplacian视觉提示(LVP)探讨单目深度模型的几何层偏好,DAv2-L模型在ML-SRA上达到75.5%。
Xiaohao Xu, Feng Xue, Xiang Li 等
RESOURCE2SKILL通过多模态资源提取可执行技能,提升软件代理性能,平均提升11.9个百分点。
Yijia Fan, Zonglin Di, Zimo Wen 等
CogWM模型通过追踪用户BDI/E状态轨迹,提升对话智能体的认知评估,训练于15万样本,优于现有基线。
Minghui Ma, Bin Guo, Hao Wang 等
MIRROR利用Gromov–Wasserstein正则化,将语言中的关系几何结构迁移到视觉表示中,提升多模态关系推理。
Hong-Han Wang, Yuntao Wang, Hu Ding
提出一种自监督学习框架,仅用八张相位移图像学习次表面散射表示。
Arjun Majumdar, Raphael Braun, Andreas Engelhardt 等
TASKER算法通过任务驱动和场景感知的关键帧提取提升视频理解性能,EgoSchema提高2.0%。
Sunqi Fan, Qingle Liu, Runqi Yin 等
提出结合操作设计域(ODD)的AI风险评估框架,明确安全边界,提升风险识别能力。
Heidy Khlaaf
潜在遗传算法(LGA)通过潜在空间交叉提高HfO2基态恢复率至60-95%。
Kaixin Zheng, Wanjian Yin, Hongyu Yu 等
TacGen结合视觉-触觉对比和Latent生成,有效缓解触觉数据稀缺,提升物理属性表征。
Wanghao Ye, Aarosh Das, Sihan Chen 等
提出TILR框架,通过低秩子空间识别稳定推理方向,提升模型推理一致性。
Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut 等
TrafficAlign通过视频合成场景,利用DSL验证,微调LLMs以匹配真实交通分布,提升自动驾驶模型安全性。
Zhi Tu, Liangkun Niu, Tianyi Zhang