Needle Threading: Can LLMs Follow Threads through Near-Million-Scale Haystacks?
本研究评估17个LLMs在长上下文中追踪多线程信息的能力,发现模型表现随上下文增长而下降,但多线程追踪表现良好。
Jonathan Roberts, Kai Han, Samuel Albanie
本研究评估17个LLMs在长上下文中追踪多线程信息的能力,发现模型表现随上下文增长而下降,但多线程追踪表现良好。
Jonathan Roberts, Kai Han, Samuel Albanie
SimpleQA基准测试评估语言模型回答简短事实性问题的能力,挑战性高,易于评分。
Jason Wei, Nguyen Karina, Hyung Won Chung 等
MM-Embed利用多模态大模型实现跨任务的普适检索,显著超越SOTA指标。
Sheng-Chieh Lin, Chankyu Lee, Mohammad Shoeybi 等
CRMArena通过模拟真实CRM环境,评估LLM代理在九项专业任务中的表现,发现最优模型成功率不足58%。
Kung-Hsiang Huang, Akshara Prabhakar, Sidharth Dhawan 等
Hunyuan-Large是腾讯开源的MoE模型,拥有52亿激活参数,处理256K tokens。
Xingwu Sun, Yanfeng Chen, Yiqing Huang 等
提出以任务能力和资源限制为界的定义,分析SLMs技术、应用及未来方向。
Fali Wang, Zhiwei Zhang, Xianren Zhang 等
本研究利用多样化和信息丰富的语言反馈提升离线强化学习中仿生代理的任务泛化能力。
Jiajun Xi, Yinong He, Jianing Yang 等
基于心理学与人类学定义,调研文化意识在多模态大模型中的数据构建与评估方法。
Siddhesh Pawar, Junyeong Park, Jiho Jin 等
提出能量基扩散语言模型(EDLM),利用残差EBM提升文本生成质量,显著优于现有扩散模型,接近自回归模型困惑度。
Minkai Xu, Tomas Geffner, Karsten Kreis 等
提出支持18种语言的仓库级代码补全基准M2RC-EVAL,结合AST解析进行细粒度标注。
Jiaheng Liu, Ken Deng, Congnan Liu 等
CycleResearcher利用强化学习训练的开源模型,实现从文献综述到同行评审的全流程自动化,预测论文评分误差降低26.89%。
Yixuan Weng, Minjun Zhu, Guangsheng Bao 等
提出了Relaxed Recursive Transformers,通过层级LoRA实现有效参数共享,性能接近完整模型。
Sangmin Bae, Adam Fisch, Hrayr Harutyunyan 等
MAPO利用动量增强梯度法优化大模型提示,显著提升收敛速度和性能。
Anthony Cui, Pranav Nandyalam, Andrew Rufail 等
提出相似性调节的惊异理论,结合Ricotta和Szeidl的多样性指数,提升阅读时间预测能力。
Clara Meister, Mario Giulianelli, Tiago Pimentel
ReflecTool框架在医学领域中提升了临床代理的工具使用能力,实验中超越纯LLM超过10分。
Yusheng Liao, Shuyang Jiang, Yanfeng Wang 等
提出VoiceBench基准,利用多场景语音数据评估LLM语音助手性能,揭示现有模型在真实环境中的局限。
Yiming Chen, Xianghu Yue, Chen Zhang 等
双部Token Embedding以共享语义加随机区分,在LTLRandom35上达95.94%正确率并支持扩展词表。
İlker Işık, Ramazan Gokberk Cinbis, Ebru Aydin Gol
提出API调用和混合代理,API代理在WebArena上提升24.0%,成功率达38.9%。
Yueqi Song, Frank Xu, Shuyan Zhou 等
本研究利用ALTI方法分析大规模语言模型在机器翻译中的上下文贡献,揭示源文本和示例位置偏差。
Emmanouil Zaranis, Nuno M. Guerreiro, André F. T. Martins
提出TMCHT任务与ARCJ方法,有效攻击多代理系统,提升成功率达52.93%。
Tianyi Men, Pengfei Cao, Zhuoran Jin 等