Make Prompt-based Black-Box Tuning Colorful: Boosting Model Generalization from Three Orthogonal Perspectives
提出BBT-RGB,结合两阶段无梯度优化、多重Verbalizer和指令搜索,提升黑箱调优性能。
Qiushi Sun, Chengcheng Han, Nuo Chen 等
提出BBT-RGB,结合两阶段无梯度优化、多重Verbalizer和指令搜索,提升黑箱调优性能。
Qiushi Sun, Chengcheng Han, Nuo Chen 等
提出TinyStories数据集,训练参数低于1000万的小模型仍能生成连贯故事,采用GPT-4评分多维能力。
Ronen Eldan, Yuanzhi Li
WebCPM采用交互式网页搜索,构建中文长问答数据集,结合模型模仿人类搜索行为,提升回答质量。
Yujia Qin, Zihan Cai, Dian Jin 等
VCSUM为中文会议摘要提供多任务标注,包括话题分割、摘要和亮点句,推动会议文本理解。
Han Wu, Mingjie Zhan, Haochen Tan 等
SUR-adapter通过知识蒸馏增强扩散模型的语义理解,提升简洁叙述的生成质量。
Shanshan Zhong, Zhongzhan Huang, Wushao Wen 等
提出链式推理(CoT)解释的系统性不忠实问题,实验证明偏置特征影响模型推理,导致高达36%的准确率下降。
Miles Turpin, Julian Michael, Ethan Perez 等
提出BIRD基准,涵盖12,751对文本-SQL配对,强调大规模数据库中的值理解与效率,GPT-4执行准确率仅40.08%。
Jinyang Li, Binyuan Hui, Ge Qu 等
提出SG-CQG框架,结合语义图实现无答案对话式问答生成,达成SOTA性能。
Xuan Long Do, Bowei Zou, Shafiq Joty 等
提出基于梯度下降和束搜索的自动提示优化(APO),提升性能最高达31%。
Reid Pryzant, Dan Iter, Jerry Li 等
大语言模型(LLM)可替代人类评估,结果与人类专家一致。
Cheng-Han Chiang, Hung-yi Lee
mPLUG-Owl通过模块化学习提升大语言模型的多模态能力,显著提高指令理解和视觉理解能力。
Qinghao Ye, Haiyang Xu, Guohai Xu 等
利用公民科学进行NLP标注,招募98志愿者完成1481条高质量注释。
Jan-Christoph Klie, Ji-Ung Lee, Kevin Stowe 等
提出Evol-Instruct方法,通过LLM自动生成多层次复杂指令,显著提升LLaMA模型性能。
Can Xu, Qingfeng Sun, Kai Zheng 等
利用自然逻辑中的中间特征,通过干预方法(Amnesic和Mnestic)分析大模型的因果关系,揭示高维表示中的潜在机制。
Julia Rozanova, Marco Valentino, Lucas Cordeiro 等
提出评估生成式搜索引擎可验证性的方法,发现平均句子支持率仅51.5%。
Nelson F. Liu, Tianyi Zhang, Percy Liang
提出行为期望界限(BEB)框架,揭示大模型对抗性提示的固有限制。
Yotam Wolf, Noam Wies, Oshri Avnery 等
API-Bank基准评估工具调用能力,涵盖73API,提升LLMs工具利用率。
Minghao Li, Yingxiu Zhao, Bowen Yu 等
本研究评估LLMs在任务导向对话中的表现,发现其在明确信念状态追踪方面表现不佳,但能引导对话成功,提升依赖真实信念状态和示例。
Vojtěch Hudeček, Ondřej Dušek
提出AGIEval基准,基于人类标准考试评估GPT-4等模型,GPT-4在SAT数学和中国高考英语中超越平均人类表现。
Wanjun Zhong, Ruixiang Cui, Yiduo Guo 等
评估ChatGPT在37种语言中的零样本学习表现,覆盖7项任务,发现其多语言能力仍有局限。
Viet Dac Lai, Nghia Trung Ngo, Amir Pouran Ben Veyseh 等