Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
提出NCP-Bench,评估LLM在长时序一致性中的表现,GPT-5.2仅达42%存活率。
Yingpeng Ma, Jianhao Yan, Bei Shi 等
提出NCP-Bench,评估LLM在长时序一致性中的表现,GPT-5.2仅达42%存活率。
Yingpeng Ma, Jianhao Yan, Bei Shi 等
提出Prompt Embedding Probes(PEP)用于冻结大模型的隐藏状态检测幻觉,提升在分布内表现。
Zakhar Mrykhin, Valentin Malykh
SurakshaEval评估多语言LLM在10种印度语言中的安全性,揭示文化敏感性问题。
Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah 等
CoinRAG通过细粒度信息碎片的KV缓存重用,在低延迟下实现长上下文RAG,平均提升答题F1 5.3%。
Gyuwan Kim, Cheoneum Park, Tao Yang
GPTKB 2.0通过上下文引导的消歧构建了3850万三元组的知识库,支持可追溯的实体消歧。
Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski
提出“视距差距”概念,分析长时任务中LLM的规划、记忆、执行等问题,基于1547篇论文总结解决方案。
Mingguang Chen, Licheng Wang, Bo Qu
本研究比较程序化工具调用(PTC)与原生JSON调用,在14个模型中,PTC在BFCL v4上提升了10.6%的准确率,表现稳定。
Ishan Patel, Sahil Sen, Elias Lumer 等
提出无参考指标评估对话基准的质量,涵盖一致性、复杂性和覆盖度,验证通过多模型生成和人为标注,显著区分基准质量。
Noam Koren, Roy Bar-Haim, Abigail Goldsteen
提出GB/T-Bench和GB/T-Reviewer,利用层级化错误分类和多智能体协作显著提升国家标准文档规则审查能力。
Tao Wang, Qihao Yang, Rongjiao Liang 等
HiLP方法通过引入高层抽象潜变量,提升语言模型的长程推理能力。
Chang Shi, Tim Pearce, Manan Tomar 等
提出Spoken Function Calling(SFC)新视角,通过结构化规则提升大音频语言模型的语义理解,超越传统封闭集SLU。
Yuezhang Peng, Yuxin Liu, Changfeng Gao 等
EuroExec基准显示前沿大模型在欧洲高管决策任务中表现远低于专家水平。
Pau Arnal, Khaled Denfir, Danylo Smahliuk 等
以Qwen2.5-0.5B递归训练显示:公平性恶化先于困惑度崩溃。
Irina Proskurina, Antoine Gourru, Julien Velcin
VetScore为兽医长文问答引入风险加权事实验证,结合引用支持与危害潜力评估。
Ivan Kartáč, Jan Tovarys, Mateusz Lango 等
本研究分析SFT与RL在多任务学习中的冲突与共存,发现RL引入稀疏正交参数更新,显著减少任务干扰。
Kejian Zhu, Zhuoran Jin, Shangqing Tu 等
提出ICO框架,通过迭代优化上下文,有效提升语义漂移越狱成功率达74.6%。
Hujian Zhu, Yihao Huang, Felix Juefei-Xu 等
区分模拟与估算任务,基础模型擅长生成,微调模型优于直接预测分布。
Seth Grief-Albert, Jessica Bo, Difan Jiao 等
提出PCTree,通过父条件树结构提升半自回归推理效率,速度提升达29.5%。
Zixian Li, Tong Li, Chi Xie 等
提出Cloud-ScPO,利用隐藏状态几何结构在半监督偏好优化中提升LLM推理性能,最高提升4.49%。
Yuzhou Liu, Xiyang Hu
提出Pruned BPE,通过后训练可见性修剪和重分配提升编码效率,减少长度约0.27%-0.36%。
Kenny Shao