PaLM 2 Technical Report
PaLM 2以混合目标、计算最优缩放和多语数据,在更小规模上提升推理与翻译表现。
核心发现
方法论
PaLM 2采用Transformer架构,并借鉴UL2的混合预训练目标,而非只使用因果语言建模。训练语料覆盖网页、书籍、代码、数学、对话及数百种语言的平行文本,并进行去重、质量过滤和敏感个人信息清理。缩放实验使用FLOPs≈6ND,在1×10^19至1×10^22 FLOPs下拟合IsoFLOP曲线,寻找参数量N与训练数据D的近似等比例扩展。
关键结果
- 在1-shot英语任务上,PaLM 2-L平均得分76.9%,超过PaLM的70.4%;TriviaQA为86.1%对81.4%,ANLI-R3为67.1%对52.3%,显示问答与推理均有明显提升。
- PaLM 2在多语专业考试中全部达到及格,包括中文HSK 7–9总体82%、日语J-Test 94%、法语TCF 82%、西语DELE C2总体62%;论文同时报告其推理、翻译和代码能力显著改善。
- 缩放研究显示,在1×10^22 FLOPs下约9.5B参数达到最低损失,接近PaLM 2预测的9.50B;但16.1B模型在部分下游任务略优,说明训练损失不是任务性能的完美代理。
研究意义
论文的重要意义在于说明,提升大模型能力不必单纯依靠扩大参数规模。更高质量、更广泛的多语数据,结合计算最优的数据—参数配比和混合训练目标,可以让较小模型获得更强的语言、推理与翻译能力。PaLM 2-L小于最大PaLM,却使用更多训练计算并取得更好结果,降低了推理延迟与部署成本。对产业而言,这支持更广泛的终端部署;对研究而言,它强化了数据质量、目标设计和服务效率同等重要的观点。
技术贡献
技术贡献包括三方面:第一,独立验证大规模条件下数据量D与参数量N应近似等比例增长,而非早期Kaplan规律中的参数优先扩张;第二,将UL2式混合目标、多语平行语料、代码和数学数据结合,增强跨语言迁移及复杂推理;第三,在少量训练样本中加入Perspective API毒性标记,使模型可通过控制token在推理时调节毒性,且无额外推理开销或明显能力损失。多语canary序列还提供了跨语言记忆评估机制。
新颖性
PaLM 2并非提出全新的基础网络,而是把缩放规律、数据工程、混合目标和安全控制系统性整合。相较主要使用英语语料和单一语言建模目标的PaLM式方案,它以更高质量、多语种、平行文本和专门领域数据训练较小模型,并展示了性能、效率与可控性之间的协同提升。
局限性
- 评测主要是few-shot或考试模拟,写作由人工评分且不含口语部分;考试结果不是官方成绩,不能完全代表真实语言交际能力。
- 论文没有公开完整训练语料、参数配置和全部模型细节;用户产品还包含额外前后处理,产品表现不应直接等同于报告数字。
- 缩放规律优化的是验证损失,9.5B最低损失模型仍略逊于16.1B模型的部分下游结果,说明任务、吞吐和延迟需要联合优化。
未来方向
未来研究应扩大低资源语言和文化语境评测,分析混合目标各组成部分的因果贡献,并建立更可靠的长上下文、事实性、偏见和隐私测试。还需研究训练计算、服务延迟与任务收益的联合缩放规律,以及更细粒度、跨语言的安全控制和持续更新机制。
AI 总览摘要
大型语言模型长期依赖扩大参数量和英语语料,但这种路线成本高,也容易忽视低资源语言、代码和复杂推理。PaLM 2技术报告提出一种更系统的改进方案:以Transformer为基础,结合更高质量的多语数据、代码和数学文本,并采用混合预训练目标。其核心观点是,在固定计算预算下,模型参数N与训练数据D应近似同步增长;实验通过FLOPs≈6ND和IsoFLOP曲线验证了这一点。
PaLM 2家族包含Small、Medium和Large版本。模型使用网页、书籍、对话、程序代码及数百种语言的平行文本,并进行去重、过滤和个人信息清理。结果显示,PaLM 2-L在1-shot英语任务上的平均得分为76.9%,高于PaLM的70.4%;在TriviaQA、RACE-H和ANLI-R3上分别达到86.1%、62.3%和67.1%。多语能力也十分突出:中文HSK 7–9总体得分82%,日语J-Test为94%,法语TCF为82%。
报告还强调安全与部署价值。PaLM 2通过毒性控制token实现推理时控制,无需额外推理开销,也未显著损害其他能力;多语canary用于衡量记忆和隐私风险。不过,考试是模拟评测,不含口语,且产品会加入额外处理。总体而言,PaLM 2证明高质量数据、混合目标和合理缩放可以让更小模型获得更强能力,为低成本、多语种和更广泛的生成式AI部署提供了路径。
深度分析
研究背景
语言建模经历了n-gram、LSTM到Transformer的演进。GPT-3、PaLM和Chinchilla等工作表明,扩大模型与数据能够提升语言理解和推理;Kaplan等人强调参数增长,Hoffmann等人则指出数据与参数应近似等比例扩展。PaLM 2进一步关注多语种、代码、数学、长上下文和部署效率。
核心问题
传统大模型常由英语语料主导,并主要优化单一因果或掩码语言目标,导致低资源语言、跨语言迁移和复杂推理不足。单纯增大参数还会增加训练与服务成本。研究因此需要同时解决能力、计算效率、长上下文、安全控制和记忆风险。
核心创新
- ��采用更丰富的多语混合语料及英语对齐的平行文本;•借鉴UL2,混合不同去噪和语言建模目标;•通过缩放实验寻找计算最优N/D比例;•扩大上下文长度;•加入毒性控制token和多语canary,分别支持推理时安全控制与记忆测量。
方法详解
- ��数据:整合网页、书籍、代码、数学、对话和数百种语言文本,执行去重、质量筛选及敏感PII移除。
- ��训练:使用Transformer与混合目标,在预训练后进行通用指令微调。
- ��缩放:训练400M至15B参数模型,在1×10^19–1×10^22 FLOPs预算下,以FLOPs≈6ND估算token量,并用二次曲线拟合IsoFLOP最低点。
- ��评测:使用PaLM 2-S/M/L及PaLM基线,采用1-shot、多语问答、推理、代码、翻译、生成和责任AI测试。
实验设计
评测覆盖TriviaQA、Natural Questions、HellaSwag、RACE、PIQA、ARC、SuperGLUE、ANLI、TyDi QA、BIG-Bench、HumanEval和多项翻译数据集。模型通常采用few-shot提示,并平均最近五个PaLM 2-L检查点。语言考试包括HSK、J-Test、PLIDA、TCF和DELE;写作由三名母语者评分,听力以文本形式加入。
结果分析
PaLM 2-L英语任务平均76.9%,PaLM为70.4%;ANLI-R1/R2/R3分别为73.1%、63.4%、67.1%,明显高于PaLM的52.6%、48.7%、52.3%。在TyDi QA无上下文设置中,英语F1为43.7%,芬兰语45.5%,印尼语46.4%。缩放实验的最低损失点约为9.5B参数,但下游任务并非完全同步。
应用场景
PaLM 2适合多语问答、翻译、教育辅导、代码修复、数学解释、长对话和摘要。其较小而高质量的模型有利于降低服务延迟和成本;毒性控制token可为开发者提供额外的推理时安全开关,但仍需结合内容审核、权限管理和人工反馈。
局限与展望
模型性能依赖训练数据覆盖,低资源语言和文化偏差仍可能存在。模拟语言考试不包含口语,也不是官方认证;基准分数不能保证事实准确性、稳健性或现实安全性。报告版本对应2023年5月发布的PaLM 2,产品模型可能持续变化。未来需公开更多可复现实验信息,强化长上下文、事实性、隐私和跨文化安全评估。
通俗解读 非专业人士也能看懂
可以把PaLM 2想成一所大型学校。以前的学校主要收集英语课本,靠增加教室和学生数量来变聪明;PaLM 2则同时增加中文、日文、阿拉伯文、代码、数学和对话教材,并先把重复内容删掉,把质量差的内容筛掉。它还安排不同类型的练习:有的要求补全句子,有的要求从上下文恢复缺失内容,有的要求理解不同语言之间的对应关系。
学校资源有限,所以不能无限扩建。研究者比较不同规模的班级和教材数量,发现最划算的办法不是只扩大班级,而是让学生数量和教材数量一起增加。这样,较小的班级也能取得很好的成绩,并且考试批改和日常交流更快。
结果表明,这所学校在英语问答、常识和推理考试中表现更好,也能通过中文、日文、法文和西文的高级考试。它还学习了一个“安全按钮”:生成内容前可以降低有害表达倾向。不过,考试成绩不等于现实中的完美表现,学生仍可能答错、偏见或泄露记忆中的内容,因此实际使用需要教师和规则共同监督。
简单解释 像给14岁少年讲一样
想象你在训练一个超级厉害的游戏队友。普通训练可能只给它大量英文攻略,然后让它不停猜下一个词。PaLM 2的训练更像全能训练营:它同时读中文、日文、阿拉伯文等语言,还看数学题、程序代码、小说和聊天记录;有些材料还成对出现,一边是英文,另一边是其他语言。
研究者还测试了“花钱方式”。如果把所有计算资源都用来造一个超大的模型,可能很贵但不一定最划算。实验发现,模型大小和训练材料大致一起增加更好。就像升级游戏角色时,不能只加血量,也要同时获得更多装备和地图知识。
成绩很亮眼:PaLM 2-L在许多英语任务平均达到76.9%,PaLM是70.4%;TriviaQA达到86.1%,ANLI-R3达到67.1%。它还通过了中文HSK 7–9、日语J-Test等高级考试。它甚至能修代码、解释外国谚语和进行翻译!
但它不是不会犯错的机器人。考试没有真正测试口语,产品版本也可能改变;模型仍可能产生错误或有害内容。所以把它当作速度很快、知识很多的助手,而不是永远正确的老师。使用时要核查答案、保护隐私,并给它设置清楚的安全规则。
术语表
Transformer(变换器)
一种利用注意力机制处理序列的神经网络架构。它能并行分析上下文,是PaLM 2的基础。
用于PaLM 2的预训练和生成。
混合预训练目标(Mixture of Objectives)
同时采用多种文本预测或去噪任务训练模型。不同目标帮助模型学习补全、理解和生成。
PaLM 2借鉴UL2设计训练目标。
计算最优缩放(Compute-optimal Scaling)
在固定FLOPs下联合选择参数量和训练token数,使效果最大。论文以FLOPs≈6ND估算训练成本。
用于确定不同计算预算的最优模型规模。
IsoFLOP曲线
保持计算量相同、比较不同参数规模模型损失的曲线。曲线最低点表示该预算下的近似最优参数量。
用于分析1×10^19至1×10^22 FLOPs实验。
TyDi QA
覆盖多种语言的问答数据集。Gold Passage提供证据文本,no-context设置只给问题。
用于衡量跨语言问答能力。
BIG-Bench
包含多类复杂任务的大型语言模型评测集合。它尤其用于观察推理和泛化能力。
论文用其展示PaLM 2相对PaLM的推理提升。
开放问题 这项研究留下的未解疑问
- 1 PaLM 2在低资源语言、方言和非西方文化语境中的真实使用效果仍不清楚。现有基准覆盖有限,需要长期、跨文化、由当地专家参与的评测。
- 2 混合目标、数据质量和多语平行文本各自贡献多少尚未完全分离。更严格的消融实验和可复现训练配置有助于解释性能来源。
- 3 训练损失与下游任务表现并不总是一致,未来需要把能力、吞吐、延迟、安全和成本纳入统一缩放模型。
应用场景
近期应用
多语教育与翻译
教育平台可使用PaLM 2生成多语解释、练习题和翻译草稿,尤其适合英语与多种非英语语言之间的转换。部署前应加入教师审核、术语词表、隐私过滤和事实核查。
代码助手
开发团队可用模型解释代码、修复简单错误并生成带注释的示例,例如论文展示的递归DFS修复。实际接入需要沙箱执行、测试用例、代码审查和机密信息隔离。
远期愿景
低成本全球化助手
更高效的PaLM 2家族可能支持手机、客服和公共服务中的实时多语交互。长期障碍包括低资源语言质量、偏见、法规、延迟约束和持续模型更新。
原文摘要
We introduce PaLM 2, a new state-of-the-art language model that has better multilingual and reasoning capabilities and is more compute-efficient than its predecessor PaLM. PaLM 2 is a Transformer-based model trained using a mixture of objectives. Through extensive evaluations on English and multilingual language, and reasoning tasks, we demonstrate that PaLM 2 has significantly improved quality on downstream tasks across different model sizes, while simultaneously exhibiting faster and more efficient inference compared to PaLM. This improved efficiency enables broader deployment while also allowing the model to respond faster, for a more natural pace of interaction. PaLM 2 demonstrates robust reasoning capabilities exemplified by large improvements over PaLM on BIG-Bench and other reasoning tasks. PaLM 2 exhibits stable performance on a suite of responsible AI evaluations, and enables inference-time control over toxicity without additional overhead or impact on other capabilities. Overall, PaLM 2 achieves state-of-the-art performance across a diverse set of tasks and capabilities. When discussing the PaLM 2 family, it is important to distinguish between pre-trained models (of various sizes), fine-tuned variants of these models, and the user-facing products that use these models. In particular, user-facing products typically include additional pre- and post-processing steps. Additionally, the underlying models may evolve over time. Therefore, one should not expect the performance of user-facing products to exactly match the results reported in this report.