The Limits of Predicting Agents from Behaviour
提出行为预测的理论极限,基于代理的世界模型,推导出新环境中行为的界限,揭示推断信念的局限。
Alexis Bellot, Jonathan Richens, Tom Everitt
提出行为预测的理论极限,基于代理的世界模型,推导出新环境中行为的界限,揭示推断信念的局限。
Alexis Bellot, Jonathan Richens, Tom Everitt
提出双重鲁棒的反事实政策均值嵌入(CPME),实现复杂分布的非参数估计与检验。
Houssam Zenati, Bariscan Bozkurt, Arthur Gretton
使用随机活动网络模型量化自动驾驶汽车在交叉路口的安全性,事故率低于10^-5每小时。
Peter Popov, Lorenzo Strigini, Cornelius Buerkle 等
通过微调OpenAI Whisper模型,利用少量MSA数据显著提升五大阿拉伯方言的ASR性能。
Ömer Tarik Özyilmaz, Matt Coler, Matias Valdenegro-Toro
ReasoningFlow解析复杂推理轨迹的语义结构,采用有向无环图。
Jinu Lee, Sagnik Mukherjee, Dilek Hakkani-Tur 等
STORYTELLER通过SVO节点和动态模块显著提升故事连贯性,达84.33%人类偏好率。
Jiaming Li, Yukun Chen, Ziqiang Liu 等
提出角度浓缩作为模型学习信号,基于此设计GAIN-RL提升训练效率超2.5倍。
Qinsi Wang, Jinghan Ke, Hancheng Ye 等
本文提出小型语言模型(SLMs)在代理AI中的优越性,强调其在成本、效率和适应性方面的优势。
Peter Belcak, Greg Heinrich, Shizhe Diao 等
SynthRL通过自动合成难度递增且可验证的训练数据,提升视觉推理模型性能。
Zijian Wu, Jinjie Ni, Xiangyan Liu 等
利用Temporal-RLT框架,通过奖励设计和数据选择提升视频理解效率,显著减少训练数据。
Hongyu Li, Songhao Han, Yue Liao 等
ShapeLLM-Omni利用3D VQVAE实现3D内容理解与生成,构建3D-Alpaca数据集。
Junliang Ye, Zhengyi Wang, Ruowen Zhao 等
提出UMA:基于多层面表面对齐的超细节人体虚拟人建模方法,显著提升4K渲染细节。
Heming Zhu, Guoxing Sun, Christian Theobalt 等
提出Common Corpus,约2万亿无版权或开源标注的多语种数据集,用于多模态预训练。
Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett 等
提出注意力索引模型(AIM),通过统计力学预测贝叶斯最优泛化误差。
Fabrizio Boncoraglio, Emanuele Troiani, Vittorio Erba 等
本文提出PGPO,通过伪代码式规划增强LLM智能体推理能力,显著提升性能。
Zouying Cao, Runze Wang, Yifei Yang 等
用ODE/SDE统一讲清Flow Matching与扩散模型
Peter Holderrieth, Ezra Erives
HASHIRU通过CEO-员工代理系统提升资源利用率,GSM8K上达96%。
Kunal Pai, Parth Shah, Harshil Patel
提出多智能体系统中的动态社会对齐模型,强调环境依赖性和社会互动的重要性。
Florian Carichon, Aditi Khandelwal, Marylou Fauchard 等
提出SealQA基准,评估搜索增强语言模型在噪声和冲突信息下的推理能力,表现极差。
Thinh Pham, Nguyen Nguyen, Pratibha Zunjare 等
提出Conformal Arbitrage框架,通过校准阈值在主模型与守护模型间实现风险控制的平衡,保证不良事件发生频率不超标。
William Overman, Mohsen Bayati