On the generalization of language models from in-context learning and finetuning: a controlled study
本研究比较大规模语言模型在上下文学习与微调中的泛化能力,提出增强微调的推理追踪方法。
Andrew K. Lampinen, Arslan Chaudhry, Stephanie C. Y. Chan 等
本研究比较大规模语言模型在上下文学习与微调中的泛化能力,提出增强微调的推理追踪方法。
Andrew K. Lampinen, Arslan Chaudhry, Stephanie C. Y. Chan 等
本研究提出BrowseComp-ZH基准,评估中文大模型的网页浏览能力,涵盖289题,模型准确率普遍低于20%。
Peilin Zhou, Bruce Leon, Xiang Ying 等
稀疏注意力在Transformer LLM中提高长序列处理能力,使用Quest和Vertical-Slash方法。
Piotr Nawrot, Robert Li, Renjie Huang 等
采用Prompt引导ChatGPT基于定制错误类型识别LSP翻译中的错误,准确率达64.1%。
Joachim Minder, Guillaume Wisniewski, Natalie Kübler
提出OmniV-Med,融合多模态医学视觉-语言模型,处理14种影像模态和11项临床任务,采用旋转位置编码和令牌剪枝,达成多任务SOTA。
Songtao Jiang, Yuan Wang, Sibo Song 等
Nemotron-CLIMB通过嵌入和迭代优化数据混合,提升大规模语言模型预训练性能。
Shizhe Diao, Yu Yang, Yonggan Fu 等
MLRBench评估LLM在多语言长文本推理中的表现,揭示资源差距。
Amey Hengle, Prasoon Bajpai, Soham Dan 等
Persona-judge通过令模型自我判断实现个性化对齐,提升了98%的对齐效率。
Xiaotian Zhang, Ruizhe Chen, Yang Feng 等
提出衡量LLM生成内容的有效语义多样性框架,揭示偏好调优模型在质量与多样性间的权衡。
Alexander Shypula, Shuo Li, Botong Zhang 等
BrowseComp是衡量AI持续浏览网页搜寻难解信息的挑战性基准,包含1266题,强调持久性与创造性。
Jason Wei, Zhiqing Sun, Spencer Papay 等
WebRollback通过显式回滚机制提升网页代理性能,在Mind2Web-Live和WebVoyager基准上表现优异。
Zhisong Zhang, Tianqing Fang, Kaixin Ma 等
AskQE利用问答框架检测机器翻译关键错误,基于ContraTICO和BioMQM数据集,采用LLaMA-3 70B模型实现高相关性评估。
Dayeon Ki, Kevin Duh, Marine Carpuat
提出DeepMath-103K,含高难度题目、去污染和可验证答案,推动推理能力提升。
Zhiwei He, Tian Liang, Jiahao Xu 等
提出LLM-SRBench,包含239题,评估LLMs科学方程发现能力,挑战模型超越记忆。
Parshin Shojaee, Ngoc-Hieu Nguyen, Kazem Meidani 等
提出文化本地化基准,发现显式提示显著提升文化响应,但带来刻板化,利用激活调控实现跨语言文化引导。
Veniamin Veselovsky, Berke Argin, Benedikt Stroebl 等
SocioVerse利用LLM代理和1000万真实用户数据,构建多场景社会模拟模型,准确反映大规模人口动态。
Xinnong Zhang, Jiayu Lin, Xinyi Mou 等
提出多类别语音语言模型(SLMs),涵盖纯语音、语音+文本及语音感知文本模型,推动普适语音处理。
Siddhant Arora, Kai-Wei Chang, Chung-Ming Chien 等
ASI方法通过程序化技能提升代理任务成功率23.5%,提高效率10.7-15.3%。
Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig 等
NoveltyBench评估模型多样性,20个模型中大多表现低于人类,模型越大越缺乏多样性。
Yiming Zhang, Harshita Diddee, Susan Holm 等
本教程介绍大规模语言模型(LLM)适应技术,包括参数微调和外部知识增强,强调多阶段训练与评估。
Zixuan Ke, Yifei Ming, Shafiq Joty