JetMoE: Reaching Llama2 Performance with 0.1M Dollars

TL;DR

JetMoE-8B以低于10万美元的成本达到Llama2性能,使用稀疏门控专家混合架构。

cs.CL 🔴 高级 2024-04-11 5 次浏览
Yikang Shen Zhen Guo Tianle Cai Zengyi Qin
大型语言模型 稀疏激活 成本效益 开源 高效计算

核心发现

方法论

JetMoE-8B采用稀疏门控专家(SMoE)架构,将稀疏激活应用于注意力和前馈层。模型在1.25T开源数据集上训练,使用30,000小时H100 GPU。通过激活8B参数中的2B,减少了70%的推理计算。

关键结果

  • JetMoE-8B在Hellaswag基准测试中达到80.5分,超过Llama2-7B的78.6分,显示出显著的性能提升。
  • 在MMLU测试中,JetMoE-8B取得49.2分,优于Llama2的46.9分,展示了其在多任务学习中的优势。
  • JetMoE-8B在MBPP(Pass@1)测试中取得34.2分,显示出在代码生成任务中的竞争力。

研究意义

JetMoE-8B展示了在有限预算下训练高性能LLM的可能性,推动了学术界和工业界在低成本高效模型开发上的进步。通过开源数据集和代码,JetMoE-8B促进了研究的透明性和协作。

技术贡献

JetMoE-8B通过在注意力和前馈层中引入稀疏激活,显著降低了计算成本。与现有的密集模型相比,JetMoE-8B提供了新的工程可能性,特别是在资源受限的环境中。

新颖性

JetMoE-8B首次在注意力和前馈层中同时应用稀疏激活,与传统MoE模型相比,显著降低了计算需求。其开源和低成本特性在LLM领域中具有创新性。

局限性

  • 由于预算限制,未进行模型架构的消融研究,可能影响对各组件贡献的理解。
  • 数据混合策略基于经验选择,可能不是最优。
  • 模型在编码和提取任务中的表现相对较弱。

未来方向

未来工作可以包括对模型架构进行更深入的消融研究,以优化数据混合策略,并探索在不同任务中的性能提升。

AI 总览摘要

JetMoE-8B是一个新型的大型语言模型,旨在以低于10万美元的成本实现高性能。现有的大型语言模型通常需要大量的计算资源,限制了其在学术和工业界的广泛应用。JetMoE-8B通过采用稀疏门控专家架构,显著降低了计算成本,同时保持了卓越的性能。

JetMoE-8B的核心技术创新在于其稀疏激活机制,这一机制在注意力和前馈层中同时应用,使得模型在推理时仅激活部分参数,从而减少了70%的计算量。通过在1.25T开源数据集上训练,JetMoE-8B在多个基准测试中超过了Llama2等现有模型。

尽管JetMoE-8B在性能和成本效益上取得了显著进展,但其在编码和提取任务中的表现仍有提升空间。未来的研究可以进一步优化数据混合策略,并探索在更多任务中的应用潜力。JetMoE-8B的开源特性为研究人员提供了一个良好的基础,促进了在低成本高效模型开发上的合作与创新。

深度分析

研究背景

大型语言模型(LLM)近年来取得了显著进展,尤其是在自然语言处理任务上。然而,这些模型通常需要大量的计算资源和数据,限制了其在学术界和工业界的应用。Mixture-of-Experts(MoE)架构通过稀疏激活来降低计算成本,成为一种流行的解决方案。

核心问题

现有LLM的计算资源需求过高,导致其在广泛应用中的成本过高。如何在保持高性能的同时降低计算成本,是当前研究的核心问题。

核心创新

JetMoE-8B的核心创新在于其稀疏门控专家架构,首次在注意力和前馈层中同时应用稀疏激活。这一创新显著降低了计算成本,使得在有限预算下训练高性能LLM成为可能。

方法详解

  • �� 使用稀疏门控专家架构,减少计算量。
  • �� 在注意力和前馈层中应用稀疏激活。
  • �� 使用开源数据集进行训练,确保模型的开放性和可复现性。
  • �� 采用两阶段训练策略,优化数据混合。

实验设计

实验使用1.25T开源数据集,采用30,000小时H100 GPU进行训练。基准测试包括Hellaswag、MMLU和MBPP等,评估模型在多任务学习和代码生成任务中的性能。

结果分析

JetMoE-8B在Hellaswag和MMLU等基准测试中超过了Llama2,展示了其在多任务学习中的优势。在MBPP测试中,JetMoE-8B的代码生成能力也表现出色。

应用场景

JetMoE-8B适用于资源受限的环境,如学术研究和中小型企业。其低成本高效的特性使其在自然语言处理和代码生成任务中具有广泛的应用潜力。

局限与展望

由于预算限制,未进行消融研究,可能影响对各组件贡献的理解。数据混合策略基于经验选择,可能不是最优。模型在编码和提取任务中的表现相对较弱。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,这个工厂有很多机器,每台机器都有不同的功能。传统的工厂在生产时会同时启动所有机器,这样会消耗大量的电力和资源。JetMoE-8B就像一个智能工厂,它能够根据需要只启动部分机器,从而节省资源。这种方法不仅降低了成本,还提高了效率,让工厂在有限的预算下也能生产出高质量的产品。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你有很多角色可以选择,每个角色都有不同的技能。通常,你会一次性使用所有角色的技能,但这会耗尽你的能量。JetMoE-8B就像是一个聪明的玩家,它知道什么时候用哪个角色的技能,这样可以节省能量,同时打出高分!这就是JetMoE-8B的聪明之处,它能在有限的资源下做到最好!

术语表

稀疏门控专家 (SMoE)

一种通过选择性激活部分专家来降低计算成本的架构。

在JetMoE-8B中用于注意力和前馈层的计算优化。

注意力机制 (Attention Mechanism)

一种在处理序列数据时用于聚焦重要信息的技术。

JetMoE-8B通过稀疏激活优化注意力机制。

前馈层 (Feedforward Layer)

神经网络中的一种层,用于处理输入数据并生成输出。

在JetMoE-8B中通过稀疏激活降低计算需求。

开源数据集 (Open-source Dataset)

公开可用的数据集,任何人都可以访问和使用。

JetMoE-8B使用开源数据集进行训练,确保模型的开放性。

基准测试 (Benchmark Test)

用于评估模型性能的标准测试集。

JetMoE-8B在多个基准测试中超过现有模型。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下进一步提高模型性能?
  • 2 数据混合策略如何优化以提高模型的泛化能力?
  • 3 稀疏激活在其他任务中的应用潜力是什么?

应用场景

近期应用

学术研究

JetMoE-8B的低成本特性使其适用于学术研究,特别是在资源有限的环境中。

远期愿景

工业应用

JetMoE-8B的高效计算能力可以在工业界广泛应用,特别是在自然语言处理和代码生成任务中。

原文摘要

Large Language Models (LLMs) have achieved remarkable results, but their increasing resource demand has become a major obstacle to the development of powerful and accessible super-human intelligence. This report introduces JetMoE-8B, a new LLM trained with less than $0.1 million, using 1.25T tokens from carefully mixed open-source corpora and 30,000 H100 GPU hours. Despite its low cost, the JetMoE-8B demonstrates impressive performance, with JetMoE-8B outperforming the Llama2-7B model and JetMoE-8B-Chat surpassing the Llama2-13B-Chat model. These results suggest that LLM training can be much more cost-effective than generally thought. JetMoE-8B is based on an efficient Sparsely-gated Mixture-of-Experts (SMoE) architecture, composed of attention and feedforward experts. Both layers are sparsely activated, allowing JetMoE-8B to have 8B parameters while only activating 2B for each input token, reducing inference computation by about 70% compared to Llama2-7B. Moreover, JetMoE-8B is highly open and academia-friendly, using only public datasets and training code. All training parameters and data mixtures have been detailed in this report to facilitate future efforts in the development of open foundation models. This transparency aims to encourage collaboration and further advancements in the field of accessible and efficient LLMs. The model weights are publicly available at https://github.com/myshell-ai/JetMoE.

cs.CL cs.AI