Textbooks Are All You Need II: phi-1.5 technical report

TL;DR

phi-1.5模型以1.3亿参数实现与5倍大模型相当的常识推理能力。

cs.CL 🔴 高级 2023-09-11 9 次浏览
Yuanzhi Li Sébastien Bubeck Ronen Eldan Allie Del Giorno Suriya Gunasekar Yin Tat Lee
Transformer 常识推理 自然语言处理 小模型 开源

核心发现

方法论

phi-1.5模型采用Transformer架构,具有24层、32个头,每个头的维度为64。使用旋转嵌入和flash-attention技术加速训练。训练数据包括7亿个phi-1的训练数据和20亿个新合成的“教科书式”数据,重点在于常识推理和世界知识。

关键结果

  • phi-1.5在WinoGrande等常识推理基准上表现与Llama2-7B和Vicuna-13B相当,尤其在多步推理任务中表现突出。
  • 在GSM8K数学和HumanEval编程任务中,phi-1.5-web模型超过了Llama 65B,显示出高效的知识存储和访问能力。
  • 使用合成数据的phi-1.5在生成有毒内容方面表现优于仅使用网络数据的模型。

研究意义

phi-1.5的研究展示了小规模模型在常识推理和复杂任务中的潜力,挑战了大规模模型在能力上的垄断地位。通过使用合成数据,phi-1.5在减少有毒和偏见内容生成方面取得了进展,为负责任的AI开发提供了新思路。

技术贡献

phi-1.5通过合成数据训练展示了小模型在复杂任务中的潜力,提出了新的数据生成和选择策略,减少了对大规模网络数据的依赖,提供了新的工程可能性。

新颖性

phi-1.5首次在小规模模型中实现了与大模型相当的常识推理能力,创新性地使用合成数据替代传统网络数据,减少了有毒内容生成的风险。

局限性

  • phi-1.5在某些复杂任务中仍可能表现不佳,尤其是需要广泛背景知识的场景。
  • 模型可能在处理非常规输入时出现幻觉现象。
  • 未进行指令微调,可能在指令遵循上表现有限。

未来方向

未来工作可以探索合成数据生成的优化策略,进一步减少有毒内容生成,并在指令微调和RLHF上进行深入研究。

AI 总览摘要

近年来,大型语言模型在自然语言处理领域取得了显著进展,但其庞大的规模带来了高昂的计算成本和能耗问题。phi-1.5模型通过合成数据训练,展示了小规模模型在常识推理和复杂任务中的潜力。

phi-1.5采用了Transformer架构,结合旋转嵌入和flash-attention技术,使用合成的“教科书式”数据进行训练,重点在于常识推理和世界知识。实验结果表明,phi-1.5在多个基准测试中表现优异,尤其是在多步推理任务中超过了许多大模型。

尽管phi-1.5在减少有毒内容生成方面取得了进展,但仍存在一些局限性,如在处理非常规输入时可能出现幻觉现象。未来研究可以进一步优化合成数据生成策略,并探索指令微调和RLHF的应用。

深度分析

研究背景

近年来,Transformer架构的语言模型在自然语言处理领域取得了显著进展。代表性工作包括GPT-3和PaLM等大规模模型,这些模型在多个任务上表现出色,但其庞大的规模带来了高昂的计算成本和能耗问题。phi-1.5旨在探索小规模模型在常识推理任务中的潜力。

核心问题

大型语言模型的高计算成本和能耗限制了其广泛应用的可能性。如何在小规模模型中实现与大模型相当的能力,尤其是在常识推理和复杂任务上,是一个重要的研究问题。

核心创新

phi-1.5的核心创新在于使用合成的“教科书式”数据进行训练,减少了对大规模网络数据的依赖。通过这种方式,phi-1.5在减少有毒内容生成方面取得了进展,同时在常识推理任务中表现出色。

方法详解

  • �� 使用Transformer架构,24层、32个头,每个头的维度为64。
  • �� 采用旋转嵌入和flash-attention技术加速训练。
  • �� 训练数据包括7亿个phi-1的训练数据和20亿个新合成的“教科书式”数据。
  • �� 重点在于常识推理和世界知识。

实验设计

实验设计包括多个常识推理和复杂任务的基准测试,如WinoGrande、ARC-Easy和GSM8K等。使用LM-Eval Harness进行零样本评估,比较phi-1.5与其他模型的表现。

结果分析

phi-1.5在常识推理基准上表现与Llama2-7B和Vicuna-13B相当,尤其在多步推理任务中表现突出。在GSM8K数学和HumanEval编程任务中,phi-1.5-web模型超过了Llama 65B。

应用场景

phi-1.5可以应用于需要常识推理和复杂任务处理的场景,如智能助手和教育工具。其小规模和高效能使其在资源有限的环境中具有优势。

局限与展望

phi-1.5在某些复杂任务中仍可能表现不佳,尤其是需要广泛背景知识的场景。模型可能在处理非常规输入时出现幻觉现象,未来研究需进一步优化合成数据生成策略。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。大模型就像一个需要很多食材和时间的大餐,而phi-1.5就像是一道简单但美味的家常菜。通过使用高质量的合成食材,phi-1.5在不需要大量食材的情况下,仍然能做出美味的菜肴。这就像是用少量的食材做出一道美味的菜,而不是依赖大量的食材。phi-1.5通过这种方式,在常识推理和复杂任务中表现出色,减少了有毒内容的生成。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,通常你需要一个超级强大的角色才能打败大Boss,但phi-1.5就像是一个小角色,却能用聪明的策略打败大Boss。它通过使用聪明的合成数据,而不是依赖大量的网络数据,来完成任务。这就像是用聪明的策略而不是蛮力来赢得游戏。phi-1.5在常识推理和复杂任务中表现出色,就像是在游戏中用小角色打败大Boss一样。

术语表

Transformer (变压器)

一种用于自然语言处理的深度学习模型架构,擅长处理序列数据。

phi-1.5使用了Transformer架构来实现高效的常识推理。

Common Sense Reasoning (常识推理)

AI在理解和推断日常生活中的常识性知识的能力。

phi-1.5在常识推理任务中表现优异,接近大规模模型的水平。

Synthetic Data (合成数据)

通过人工生成的模拟数据,用于训练AI模型。

phi-1.5使用合成的“教科书式”数据进行训练,减少了有毒内容生成。

Flash-Attention (闪存注意力)

一种加速Transformer模型训练的技术,通过优化内存访问来提高效率。

phi-1.5在训练中使用了flash-attention技术来加速训练过程。

Zero-shot Learning (零样本学习)

AI在没有见过特定任务数据的情况下进行推理的能力。

phi-1.5在多个基准测试中进行了零样本评估,表现优异。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化合成数据生成策略,以减少有毒内容生成?
  • 2 在指令微调和RLHF上,phi-1.5如何进一步提高指令遵循能力?

应用场景

近期应用

智能助手

phi-1.5可以用于开发更智能的助手,提供更准确的常识推理和任务执行能力。

远期愿景

教育工具

phi-1.5可以用于开发教育工具,帮助学生在常识推理和复杂任务中提高学习效果。

原文摘要

We continue the investigation into the power of smaller Transformer-based language models as initiated by \textbf{TinyStories} -- a 10 million parameter model that can produce coherent English -- and the follow-up work on \textbf{phi-1}, a 1.3 billion parameter model with Python coding performance close to the state-of-the-art. The latter work proposed to use existing Large Language Models (LLMs) to generate ``textbook quality" data as a way to enhance the learning process compared to traditional web data. We follow the ``Textbooks Are All You Need" approach, focusing this time on common sense reasoning in natural language, and create a new 1.3 billion parameter model named \textbf{phi-1.5}, with performance on natural language tasks comparable to models 5x larger, and surpassing most non-frontier LLMs on more complex reasoning tasks such as grade-school mathematics and basic coding. More generally, \textbf{phi-1.5} exhibits many of the traits of much larger LLMs, both good -- such as the ability to ``think step by step" or perform some rudimentary in-context learning -- and bad, including hallucinations and the potential for toxic and biased generations -- encouragingly though, we are seeing improvement on that front thanks to the absence of web data. We open-source \textbf{phi-1.5} to promote further research on these urgent topics.

cs.CL cs.AI