Enhancing Chat Language Models by Scaling High-quality Instructional Conversations
通过规模化高质量指令对话数据UltraChat,微调LLaMA-13B模型UltraLLaMA,显著优于Vicuna,提升多轮对话性能。
Ning Ding, Yulin Chen, Bokai Xu 等
通过规模化高质量指令对话数据UltraChat,微调LLaMA-13B模型UltraLLaMA,显著优于Vicuna,提升多轮对话性能。
Ning Ding, Yulin Chen, Bokai Xu 等
提出基于合成反馈的对齐方法,训练出超越开源模型的ALMoST(65.2%准确率),无需大量人类标注。
Sungdong Kim, Sanghwan Bae, Jamin Shin 等
LogicLLM通过自监督训练提升大语言模型逻辑推理能力,在ReClor和LogiQA-v2上表现优异。
Fangkai Jiao, Zhiyang Teng, Bosheng Ding 等
提出GDP-Zero,无需模型训练,利用开放环蒙特卡洛树搜索进行目标导向对话策略规划。
Xiao Yu, Maximillian Chen, Zhou Yu
提出GQA方法,使用5%计算量将多头模型转换为多查询模型,速度接近MQA,质量接近MHA。
Joshua Ainslie, James Lee-Thorp, Michiel de Jong 等
扩展HOLISTICBIAS至50语言,揭示多语言中的人口偏见,发现翻译偏向男性。
Marta R. Costa-jussà, Pierre Andrews, Eric Smith 等
提出iEvaLM评估方法,利用LLM模拟用户,显著提升对话推荐性能和解释能力。
Xiaolei Wang, Xinyu Tang, Wayne Xin Zhao 等
本研究评估了ChatGPT和GPT-4作为抽象摘要自动评估工具的稳定性与可靠性,发现其在多维度和系统间表现存在显著局限。
Chenhui Shen, Liying Cheng, Xuan-Phi Nguyen 等
提出基于残差流和注意力分解的Transformer解释方法ALTI-Logit,优于梯度和扰动基线。
Javier Ferrando, Gerard I. Gállego, Ioannis Tsiamas 等
Adaptive-Consistency方法在减少采样预算的同时,保持高准确性,平均准确性下降不到0.1%。
Pranjal Aggarwal, Aman Madaan, Yiming Yang 等
CRITIC框架结合外部工具实现大模型自我校正,提升问答、数学推理和毒性控制性能。
Zhibin Gou, Zhihong Shao, Yeyun Gong 等
提出LLM-Pruner结构剪枝方法,仅用50K数据,3小时内实现大模型压缩,保持多任务能力。
Xinyin Ma, Gongfan Fang, Xinchao Wang
利用大规模语言模型(LLMs)通过上下文学习(ICL)实现无知识的时间知识图预测,性能媲美SOTA模型。
Dong-Ho Lee, Kian Ahrabian, Woojeong Jin 等
提出DoReMi,通过小模型优化数据域重加权,加速大规模语言模型预训练。
Sang Michael Xie, Hieu Pham, Xuanyi Dong 等
提出基于Jacobi和Gauss-Seidel的并行解码算法,实现Transformer翻译推理速度提升38%,无需模型修改。
Andrea Santilli, Silvio Severino, Emilian Postolache 等
SLiC-HF通过人类反馈校准序列似然性,在TL;DR任务上提升性能。
Yao Zhao, Rishabh Joshi, Tianqi Liu 等
PaLM 2以混合目标、计算最优缩放和多语数据,在更小规模上提升推理与翻译表现。
Rohan Anil, Andrew M. Dai, Orhan Firat 等
提出SpecInfer,利用树状推测推理与验证显著加速大规模生成式语言模型服务。
Xupeng Miao, Gabriele Oliaro, Zhihao Zhang 等
C-Eval评估中国基础模型的多学科多层次能力,GPT-4表现优异。
Yuzhen Huang, Yuzhuo Bai, Zhihao Zhu 等
政治罗盘探测与受控续训显示:偏见从语料经RoBERTa传至仇恨言论和虚假信息任务。
Shangbin Feng, Chan Young Park, Yuhan Liu 等