NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
NL2Repo-Bench通过长远目标任务评估编码智能体的完整软件仓库生成能力,平均测试通过率不足40%。
Jingzhe Ding, Shengda Long, Changxin Pu 等
NL2Repo-Bench通过长远目标任务评估编码智能体的完整软件仓库生成能力,平均测试通过率不足40%。
Jingzhe Ding, Shengda Long, Changxin Pu 等
提出轻量级视频片段选择方法,利用大模型提取关键时刻,达成接近参考片段的多模态长视频总结。
Galann Pennec, Zhengyuan Liu, Nicholas Asher 等
FACTS排行榜评估大语言模型的事实准确性,使用四个子排行榜,平均得分为68.8。
Aileen Cheng, Alon Jacovi, Amir Globerson 等
通过细调极窄数据集引发大范围误导和隐性后门,揭示LLMs的泛化风险。
Jan Betley, Jorio Cocola, Dylan Feng 等
SAGE基准通过9维度和4530个测试项评估大语言模型的跨文化理解能力,揭示其系统性不足。
Shiwei Guo, Sihang Jiang, Qianxi He 等
DeepSeek-V3.2通过引入稀疏注意机制和大规模强化学习,显著提升开放式大模型的推理和代理能力,达到了与GPT-5相当的性能。
DeepSeek-AI, Aixin Liu, Aoxue Mei 等
提出多解任务中的推理过度自信问题,Long-CoT缓解该问题,基于认知刚性假设。
Jiannan Guan, Qiguang Chen, Libo Qin 等
提出Matrix去中心化多智能体合成数据框架,通过消息传递实现高效扩展,提升2-15倍吞吐量。
Dong Wang, Yang Li, Ansong Ni 等
研究发现,任务算术是唯一能在“野外”环境中提升大型语言模型性能的方法。
Oğuz Kağan Hitit, Leander Girrbach, Zeynep Akata
提出结合检索和自我知识的上下文感知PMP方法,提升 sarcasm 检测中的宏F1达9.87%。
Michael Iskandardinata, William Christian, Derwin Suhartono
Evo-Memory通过自我演化机制评估LLM在连续任务中的记忆更新,达成平均性能提升0.65。
Tianxin Wei, Noveen Sachdeva, Benjamin Coleman 等
提出RLER方法,结合搜索与演化的评判标准,训练深度研究模型DR Tulu-8B,性能优于现有开源模型。
Rulin Shao, Akari Asai, Shannon Zejiang Shen 等
SMILE结合语义和词汇精确性,显著提升问答评估的效率与准确性。
Shrikant Kendre, Austin Xu, Honglu Zhou 等
Nemotron Elastic通过嵌套子模型实现高效多合一推理,训练成本减少360倍。
Ali Taghibakhshi, Sharath Turuvekere Sreenivas, Saurav Muralidharan 等
本研究发现,诗歌风格可作为单轮越狱工具,25个模型中攻击成功率达62%,跨领域传递显著。
Piercosma Bisconti, Matteo Prandi, Federico Pierucci 等
提出Agent-R1框架,基于逐步轨迹表示与灵活上下文管理,支持多种优化策略,提升多轮智能体学习能力。
Mingyue Cheng, Shuo Yu, Daoyu Wang 等
Spark-Prover-X1通过多样数据训练提升形式定理证明能力,解决PutnamBench 27题。
Xinyuan Zhou, Yi Lei, Xiaoyu Zhou 等
提出LLMLagBench,利用变点检测识别大模型训练的时间边界,实测多模型偏差显著。
Piotr Pęzik, Konrad Kaczyński, Maria Szymańska 等
提出GAD框架,通过对抗训练实现黑盒LLM的无参数知识蒸馏,Qwen2.5-14B在GPT-5-Chat上表现接近。
Tianzhu Ye, Li Dong, Zewen Chi 等
ADI-20数据集扩展了ADI-17,使用ECAPA-TDNN和Whisper模型进行阿拉伯方言识别。
Haroun Elleuch, Salima Mdhaffar, Yannick Estève 等