DistillSpec: Improving Speculative Decoding via Knowledge Distillation
DistillSpec通过知识蒸馏提升推测解码速度,提升10-45%。
Yongchao Zhou, Kaifeng Lyu, Ankit Singh Rawat 等
DistillSpec通过知识蒸馏提升推测解码速度,提升10-45%。
Yongchao Zhou, Kaifeng Lyu, Ankit Singh Rawat 等
LLMBar评估LLM评估器的指令遵循能力,揭示性能差距。
Zhiyuan Zeng, Jiatong Yu, Tianyu Gao 等
本文研究Transformer嵌入的线性分解,验证其与模型性能的相关性及变异性。
Timothee Mickus, Raúl Vázquez
Mistral 7B采用GQA和SWA技术,参数7亿,性能优于Llama 2 13B,提升推理效率。
Albert Q. Jiang, Alexandre Sablayrolles, Arthur Mensch 等
SWE-bench评估语言模型解决真实GitHub问题的能力,Claude 2仅解决1.96%。
Carlos E. Jimenez, John Yang, Alexander Wettig 等
提出结构化剪枝方法“Sheared-LLaMA”,在保持性能的同时将7B模型压缩至1.3B和2.7B参数,训练成本仅为从零训练的3%。
Mengzhou Xia, Tianyu Gao, Zhiyuan Zeng 等
Selective Context方法通过压缩上下文提高大语言模型推理效率,减少50%上下文成本。
Yucheng Li, Bo Dong, Chenghua Lin 等
LLMLingua采用分层压缩策略,实现大规模语言模型提示的20倍压缩,保持任务性能。
Huiqiang Jiang, Qianhui Wu, Chin-Yew Lin 等
FREE框架通过同步并行解码显著降低推理延迟,提升性能。
Sangmin Bae, Jongwoo Ko, Hwanjun Song 等
DecoderLens通过中间编码层交叉注意,实现对编码器-解码器Transformer的逐层解释。
Anna Langedijk, Hosein Mohebbi, Gabriele Sarti 等
PPNL基准测试显示GPT-4在空间推理上有潜力,但在长时间推理上仍有不足。
Mohamed Aghzal, Erion Plaku, Ziyu Yao
自学优化器(STOP)通过递归自我改进生成代码,显著提高性能。
Eric Zelikman, Eliana Lorch, Lester Mackey 等
通过插入暂停标记训练语言模型,提升SQuAD任务18%准确率。
Sachin Goyal, Ziwei Ji, Ankit Singh Rawat 等
OceanGPT基于LLaMA-2预训练,结合多智能体生成,显著提升海洋科学任务表现。
Zhen Bi, Ningyu Zhang, Yida Xue 等
LLMs在无外部反馈的情况下无法有效自我纠正推理,甚至可能导致性能下降。
Jie Huang, Xinyun Chen, Swaroop Mishra 等
PECORE框架量化神经机器翻译中的上下文依赖合理性,结合模型内部机制识别上下文敏感目标词。
Gabriele Sarti, Grzegorz Chrupała, Malvina Nissim 等
提出RoG方法,将大规模语言模型(LLMs)与知识图谱(KGs)结合,通过规划-检索-推理框架实现可信且可解释的推理,显著提升KG问答性能。
Linhao Luo, Yuan-Fang Li, Gholamreza Haffari 等
提出DAEMON,通过序列能量函数优化解码分布,提升与人类文本的多方面一致性。
Haozhe Ji, Pei Ke, Hongning Wang 等
RoleLLM通过四阶段框架提升大模型角色扮演能力,生成RoleBench数据集。
Zekun Moore Wang, Zhongyuan Peng, Haoran Que 等
提出COBBLER基准评估大语言模型作为偏见检测工具,发现模型存在显著偏见。
Ryan Koo, Minhwa Lee, Vipul Raheja 等