SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents
SubtleMemory基准测试评估AI代理的细粒度关系记忆辨别能力,揭示现有系统在此方面的不足。
Wenxuan Wang, Haoyu Sun, Fukuan Hou 等
SubtleMemory基准测试评估AI代理的细粒度关系记忆辨别能力,揭示现有系统在此方面的不足。
Wenxuan Wang, Haoyu Sun, Fukuan Hou 等
MARDoc通过结构化记忆实现多模态长文档问答,显著提升多跳推理性能。
Kaifeng Chen, Hongtao Liu, Qiyao Peng 等
AdaPLD通过自适应检索和重用实现高效解码,速度提升3.10倍。
Runheng Liu, Jincheng Xie, Wen Hu 等
并行Jacobi解码实现快速自回归图像生成,提升4.8至6.4倍速度。
Boya Liao, Ying Li, Siyong Jian 等
MolE-RAG结合化学文献、分子特征和结构相似性,显著提升LLMs的分子性质预测性能,分类任务ROC-AUC提升至28个百分点。
Joey Chan, Wonbin Kweon, Ashley Shin 等
提出Discrete-WAM,利用离散视觉-动作标记实现世界-策略联合建模,提升自主驾驶规划性能。
Ziyang Yao, Haochen Liu, Yuncheng Jiang 等
WorldBench通过构建多领域视觉概念分类,评估MLLMs在多样视觉输入下的推理能力,模型最高准确率仅64%。
Yida Yin, Harish Krishnakumar, Chung Peng Lee 等
SelfBootTok通过全球-局部分解与自监督学习,实现图像压缩与生成的高效平衡。
Haozhe Chi, Jinghan Li, Hao Jiang 等
BloomBench以布卢姆分类法评测VLM,含7747条英阿样本,质量率98.45%。
Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor 等
SciVisAgentSkills通过增强编码代理技能提高科学数据分析和可视化效率。
Kuangshi Ai, Haichao Miao, Kaiyuan Tang 等
通过零阶优化,单层解码器主导LLM微调,提升性能并加速训练达4.52倍。
Wanhao Yu, Ziyan Wang, Zheng Wang 等
EpiEvolve以记忆自进化适应疫情变局,准确率0.629,恢复滞后由5周降至2周。
Yiming Lu, Sihang Zeng, Zhengxu Tang 等
提出α-STOP方法,在对话和LLM代理轨迹中实现早期失败预警,提升1-42%的前沿质量。
Avinash Baidya, Xinran Liang, Ruocheng Guo 等
ALE基准评估AI在长远、经济价值高的真实行业任务中的表现,涵盖55个子领域,实测全通过率低于1%。
Yiyou Sun, Xinyang Han, Weichen Zhang 等
提出Representation Curriculum,通过阶段性训练提升排序系统的鲁棒性,实验表明在冷启动场景中表现显著提升。
Ehsan Ebrahimzadeh, Sina Baharlouei, Abraham Bagherjeiran
提出PERSUASIONTRACE框架,使用贝叶斯网络模拟多轮人类信念更新,得分接近人类(81 vs 80)。
Jared Moore, Noah Goodman, Nick Haber 等
提出Agentic Monte Carlo(AMC)用于黑箱LLM代理的贝叶斯采样,显著优于提示和GRPO。
Dae Yon Hwang, Raunaq Suri, Valentin Villecroze 等
提出基于分布式DAgger的丰富反馈强化学习方法DistIL,保证单调改进并提升Pass@N指标。
Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad
HORIZON通过恢复能力控制课程扩展物理域,提升四足机器人零样本迁移能力。
Chenhao Bai, Liqin Lu, Kaijun Wang 等
ZipSplat通过解耦高斯分布与像素网格,使用场景令牌实现高质量低成本的3D重建,减少6倍高斯数。
Alexander Veicht, Sunghwan Hong, Dániel Baráth 等