DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
DeepSeek-V2为236B参数的MoE模型,采用MLA和DeepSeekMoE架构,提升推理效率与训练经济性。
DeepSeek-AI, Aixin Liu, Bei Feng 等
DeepSeek-V2为236B参数的MoE模型,采用MLA和DeepSeekMoE架构,提升推理效率与训练经济性。
DeepSeek-AI, Aixin Liu, Bei Feng 等
本研究评估大规模语言模型(GPT-3.5 Turbo、Gemini 1.5 Pro)在孟加拉语自然语言推理中的表现,超越传统Transformer模型。
Fatema Tuj Johora Faria, Mukaffi Bin Moin, Asif Iftekher Fahim 等
本研究综述了大规模语言模型在金融、医疗和法律中的应用、方法及伦理挑战。
Zhiyu Zoey Chen, Jing Ma, Xinlu Zhang 等
本研究分析五大生成式语言模型在教育场景中的偏见表现,揭示代表性伤害类型及其心理影响。
Faye-Marie Vassel, Evan Shieh, Cassidy R. Sugimoto 等
Prometheus 2通过模型权重融合,提升开源评估模型与人类和GPT-4的相关性,涵盖直接评估与配对排序。
Seungone Kim, Juyoung Suk, Shayne Longpre 等
WildChat收集了100万用户与ChatGPT的多轮多语对话,揭示真实使用场景和毒性问题。
Wenting Zhao, Xiang Ren, Jack Hessel 等
提出多-token预测方法,在训练和推理中显著提升大规模语言模型的样本效率和推理速度,13B模型在代码任务中性能提升12%。
Fabian Gloeckle, Badr Youbi Idrissi, Baptiste Rozière 等
提出Scaffold-BPE,通过动态移除低频“支架标记”缓解频率不平衡,提升大规模语言模型性能。
Haoran Lian, Yizhe Xiong, Jianwei Niu 等
IndicGenBench评估多语言生成能力,涵盖29个印地语系语言,采用跨语言总结、翻译和问答任务。
Harman Singh, Nitish Gupta, Shikhar Bharadwaj 等
LayerSkip结合层丢弃与早期退出,提升大模型推理速度达2.16倍,创新自我猜测解码。
Mostafa Elhoushi, Akshat Shrivastava, Diana Liskovich 等
GraphRAG利用图结构实现大规模文本的全局理解,显著优于传统RAG。
Darren Edge, Ha Trinh, Newman Cheng 等
SnapKV通过观察窗口自动压缩LLM的KV缓存,提升长序列处理效率。
Yuhong Li, Yingbing Huang, Bowen Yang 等
phi-3-mini为3.8亿参数模型,训练数据达3.3万亿,性能媲美GPT-3.5,能在手机端部署。
Marah Abdin, Jyoti Aneja, Hany Awadalla 等
利用多义一致性检测语言模型的语义深度,基于Frege感知理论,评估GPT-3.5在五语种中的表现。
Xenia Ohmer, Elia Bruni, Dieuwke Hupkes
提出Language Ranker,基于内部表示量化LLM在不同语言中的性能差异。
Zihao Li, Yucheng Shi, Zirui Liu 等
本研究分析会议摘要自动评估指标的表现,发现其对会议特有错误反应不足。
Frederic Kirstein, Jan Philip Wahle, Terry Ruas 等
MiniCheck通过合成数据训练,达到GPT-4水平的事实核查,成本降低400倍。
Liyan Tang, Philippe Laban, Greg Durrett
通过自我对抗语言游戏SPAG,提升了大语言模型的推理能力,表现提升达5%。
Pengyu Cheng, Tianhao Hu, Han Xu 等
本研究发现大型语言模型(如GPT-4)具有自我识别能力,且自我识别与偏向自身生成内容呈线性相关。
Arjun Panickssery, Samuel R. Bowman, Shi Feng
LLoCO通过离线学习长文本上下文,结合压缩与LoRA微调,将4k模型扩展至128k,有效提升长文理解与问答性能。
Sijun Tan, Xiuyu Li, Shishir Patil 等