A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models
TextFlint评测六个GPT模型、21个数据集后发现:RLHF提升人类化表达,却未必提升NLU性能与鲁棒性。
核心发现
方法论
论文通过OpenAI官方API评测davinci、text-davinci-001、code-davinci-002、text-davinci-002、text-davinci-003和gpt-3.5-turbo。覆盖ABSA、MRC、NER、NLI、POS、RE、SC、SM、WSC九类NLU任务,使用21个中英文数据集,并借助TextFlint生成AddSent、词序扰动、回译等变换数据,在zero-shot与few-shot条件下比较准确率、F1、EM及鲁棒性。
关键结果
- 模型能力并未随版本线性增长。zero-shot中,code-davinci-002在ABSA、MRC、SC领先,text-davinci-003在POS、RE、SM较强,gpt-3.5-turbo在NLI和WSC较好;但其SQuAD1.1微平均F1仅约55.26,明显低于code-davinci-002的83.58。
- RLHF并不等同于任务知识增强。text-davinci-003多数任务接近text-davinci-002,却在SC和SM低于后者;gpt-3.5-turbo与text-davinci-003整体相近,但在MRC、POS、RE上处于劣势,显示聊天优化可能牺牲结构化任务能力。
- few-shot通常有效但不稳定,取决于模型、任务、提示和示例。davinci在NER、POS中可理解输出格式,但推理类任务提升有限;ABSA中code-davinci-002在Restaurant的ReverseNonTarget变换达到100%原始准确率,但扰动后仍明显下降。
研究意义
研究把“模型越来越强”拆解为预训练、指令微调、代码训练和RLHF等因素,提醒学界不能只用聊天体验或单一基准判断能力。结果对工业部署尤其重要:更自然、更安全的回答不必然意味着更可靠的抽取、阅读理解或分类。论文同时证明,模型鲁棒性没有随迭代普遍改善,提示评测必须同时考察任务准确率、格式可解析性和分布外变化。
技术贡献
技术贡献主要是建立了跨版本、跨任务、跨语言的统一黑盒评测框架。作者将promptsource提示与人工设计提示结合,每个数据集选择三个表现最佳的模板,并映射NER、POS、RE标签;再用TextFlint生成系统变换数据。该设计同时报告zero-shot、few-shot、analyzability和性能,使“不会做”与“不会按要求输出”得以区分,并揭示FeedME、PPO/RLHF与聊天优化的不同影响。
新颖性
相较大量只比较ChatGPT与微调模型的研究,本文聚焦GPT-3到GPT-3.5的能力演化及训练策略影响。其新意不在提出新模型,而在用21个数据集和鲁棒性变换进行纵向、统一、可复核的比较,明确展示了“对齐税”、非单调能力增长及提示敏感性。
局限性
- 样本规模不完全一致:davinci与code-davinci-002各测100例,text-davinci-001/002测1000例,后两模型使用全量数据,模型间差异可能受抽样影响。
- 官方文档未公开各模型的微调数据、参数规模和训练细节,因此无法严格归因某项能力变化;部分结论如gpt-3.5-turbo较弱源于更小模型规模,仍只是推测。
- 提示只选每数据集三个最佳模板,不能代表所有提示;API模型也可能持续更新,结果存在时间敏感性。
未来方向
未来应扩大随机抽样与重复次数,公开完整prompt和方差,控制解码参数,并比较更多语言、任务与模型规模。还需进行训练数据与监督任务的可追踪消融,研究RLHF奖励设计如何造成“对齐税”,并发展同时优化准确率、可解析性、稳定性和安全性的评测协议。
AI 总览摘要
大型语言模型的进步通常被描述为一条持续上升的曲线,但复旦大学团队的系统研究给出了更复杂的图景。作者选取GPT-3的davinci、text-davinci-001,以及GPT-3.5系列的code-davinci-002、text-davinci-002、text-davinci-003和gpt-3.5-turbo,在九类自然语言理解任务、21个中英文数据集上进行统一比较,并用TextFlint制造文本扰动,检验模型是否真正理解问题,而非只记住表面形式。
结果显示,能力演化并不单调。zero-shot时,code-davinci-002在ABSA、MRC和情感分类表现突出,text-davinci-003在POS、RE和语义匹配较强,gpt-3.5-turbo在NLI和WSC领先。然而在SQuAD1.1上,code-davinci-002的微平均F1约为83.58,而gpt-3.5-turbo仅55.26。text-davinci-003引入PPO驱动的RLHF后,回答更像人,却没有普遍提升任务分数,甚至在情感分类和语义匹配上低于text-davinci-002。few-shot也不是万能药:它依赖提示设计和示例选择。
这项工作的重要启示是,聊天质量、任务知识和鲁棒性是不同维度。davinci即使没有指令微调,也能在MNLI、IMDB和WSC273上zero-shot完成任务;但复杂的NER和POS往往要靠示例才能输出可解析答案。与此同时,模型面对回译、词序或目标替换时普遍退化,说明更强的语言生成能力尚未自动转化为可靠推理。对研究者而言,论文呼吁更透明的纵向评测;对应用方而言,部署前必须测试格式、提示敏感性和扰动鲁棒性。
深度分析
研究背景
GPT-3以1750亿参数的davinci展示了统一生成式处理NLU任务的潜力;随后OpenAI沿监督指令微调、代码训练和RLHF路线推出InstructGPT、Codex、text-davinci系列及ChatGPT。既有工作多研究单个模型与微调模型的差异,却较少追踪同一产品家族在训练策略变化下的能力起伏。
核心问题
核心问题是:模型迭代、FeedME、代码训练和PPO/RLHF分别改变了什么能力?聊天中更自然的回答是否意味着更强的分类、抽取和阅读理解?此外,zero-shot与few-shot的收益是否稳定,模型能否抵抗TextFlint生成的语义或表面扰动,都是实际部署的关键瓶颈。
核心创新
- �� 纵向比较六个代表性GPT模型,而非只评估单一ChatGPT。
- �� 统一覆盖九项NLU任务、21个数据集及中英文场景。
- �� 将任务性能与analyzability分开,识别模型是否按格式回答。
- �� 结合promptsource、人工模板和TextFlint变换,评估提示敏感性及鲁棒性。
- �� 对比FeedME、代码训练与PPO/RLHF,提出“对齐税”可损害结构化任务能力的证据。
方法详解
- �� 模型:调用官方API评估davinci、text-davinci-001、code-davinci-002、text-davinci-002、text-davinci-003和gpt-3.5-turbo。
- �� 任务:ABSA、MRC、NER、NLI、POS、RE、SC、SM和WSC;数据包括SQuAD1.1/2.0、MNLI、SNLI、CoNLL2003、Tacred、IMDB、MRPC、QQP等。
- �� 提示:每个数据集筛选三个模板,构造zero-shot、1-shot和3-shot,并将标签映射为自然语言短语。
- �� 指标:分类用Accuracy,序列标注与RE用F1,MRC报告micro-F1和Exact Match,同时记录输出可解析率。
- �� 鲁棒性:通过TextFlint的AddDiff、AddSent、ReverseTarget、回译、MLM扰动和问题改写比较原始与变换数据表现。
实验设计
评测覆盖21个数据集:英文ABSA、MRC、NER、NLI、POS、RE、SC、SM、WSC,也包括HONOR、MSRANER、OntoNote4NER和PKU-SEGPOS等中文数据。davinci与code-davinci-002测100样本,text-davinci-001/002测1000样本,text-davinci-003与gpt-3.5-turbo使用全量数据。作者比较zero-shot和few-shot,并以TextFlint变换测试鲁棒性。
结果分析
总体没有版本越新越强的规律。code-davinci-002在SQuAD1.1 zero-shot达到83.58微平均F1,gpt-3.5-turbo为55.26;在SemEval2014-Laptop的3-shot原始准确率分别为97.00与90.75。davinci的few-shot显著改善NER/POS的可解析性,但推理任务收益有限。除ABSA外,各模型鲁棒性差异通常不大,变换后性能大幅下降。
应用场景
结果可用于选择任务专用模型:代码训练模型适合部分结构化理解,指令模型适合更易交互的任务,聊天模型不应默认替代抽取或MRC系统。企业应在上线前固定提示、测量输出格式,并用回译、拼写、顺序和对抗改写测试稳定性;教育、客服、搜索和数据标注尤其需要这种分层验证。
局限与展望
研究是黑盒API比较,训练语料、监督任务、参数规模和版本更新均不透明,因而难以建立严格因果关系。不同模型样本量不一致,提示选择偏向最佳模板,且论文未提供所有任务的完整数值和统计显著性。未来需进行受控训练消融、更多语言与模型规模比较,结合校准、事实性、安全性和成本评测。
通俗解读 非专业人士也能看懂
把六个模型想成六位参加同一组考试的学生。老师准备了九门课和21套试卷:有的考阅读,有的考情感,有的要求找出人名地点,还有的要求判断两句话是否相同。每位学生先独立答题,再给他几道例题,最后把题目改写、调换顺序或加入干扰,看看他是否真的懂。
结果很像现实中的学生:换一届并不保证每门课都进步。code-davinci-002在不少试卷上最强,而聊天型gpt-3.5-turbo在阅读理解上反而落后。RLHF像是训练学生更有礼貌、更会和人说话,但它没有自动教会学生解所有题,甚至可能让某些考试成绩下降。
例题通常有帮助,却不是魔法。davinci看到例题后,终于知道NER或POS要按什么格式作答;但在需要真正推理的题目上,帮助有限。题目稍微换一种说法,所有模型都可能失分。因此,判断AI不能只听它说得像不像人,还要检查它是否答对、格式是否正确,以及题目变化后是否仍然可靠。
简单解释 像给14岁少年讲一样
想象你在玩一个超级聪明的游戏助手。它可以聊天、写故事、看代码,还能回答考试题。研究者让六个不同版本的助手参加九类考试,共21个题库,包括《阅读理解》《情感判断》《找名字》《判断两句话关系》等。
最有趣的是,最新的聊天助手不一定每科第一名!code-davinci-002在一些阅读和情感题上很强;text-davinci-003在词性和关系抽取上更好;gpt-3.5-turbo在有些推理题上领先,但SQuAD1.1阅读理解的F1大约只有55.26,而code-davinci-002约83.58。就像游戏角色升级了社交技能,却不一定提升所有战斗属性。
研究者还给题目换装:调换词语、回译、加干扰句,看看助手会不会被骗。答案是,很多模型都会明显掉分。给几个示例通常能帮忙,但效果取决于示例写得好不好。davinci原本不太懂“请按这种格式回答”,看到例题后在找人名和词性时改善明显。
所以,AI说话自然不等于它每件事都可靠。使用它做作业、客服或资料整理时,不能只看它回答得流不流畅,还要核对答案、规定格式,并用不同说法重新测试。聪明的助手也需要认真考试!
术语表
Natural Language Understanding (自然语言理解)
让模型识别文本含义并完成分类、抽取、推理等任务。它关注的不只是生成流畅语言,还包括答案是否正确。
论文用九类NLU任务评估GPT系列能力。
In-context Learning (上下文学习)
模型不更新参数,仅通过提示中的示例临时学习任务格式和规则。few-shot是其典型使用方式。
论文比较zero-shot、1-shot和3-shot效果。
RLHF
用人类偏好训练奖励模型,再通过强化学习优化语言模型。PPO是论文讨论的具体优化算法。
text-davinci-003采用PPO/RLHF。
FeedME
基于人类示范和高质量模型样本进行监督微调的策略。它强化指令跟随,但未必覆盖所有任务知识。
text-davinci-001和002使用FeedME。
Robustness (鲁棒性)
输入发生合理改写或扰动后,模型仍保持正确的能力。原始准确率高不代表鲁棒性强。
TextFlint用于生成变换数据并比较性能下降。
Alignment Tax (对齐税)
模型更符合人类偏好或交互规范时,某些任务能力可能受损。它描述的是对齐目标与任务准确率之间的潜在权衡。
论文用text-davinci-002与003比较该现象。
开放问题 这项研究留下的未解疑问
- 1 各模型训练数据、监督任务和参数规模不公开,因此无法判断性能变化究竟来自数据、规模还是RLHF。
- 2 few-shot收益高度依赖提示和示例选择,仍缺少跨任务、跨语言的自动提示稳定性理论。
- 3 鲁棒性变换后的下降原因尚不清楚,需要研究模型是否依赖词面模式而非真正语义。
应用场景
近期应用
企业模型选型
在客服、搜索或标注系统中,不应只测试聊天质量。可用SQuAD、IMDB、Tacred等代表性数据,分别比较Accuracy、F1、EM和格式可解析率,再用TextFlint扰动决定是否上线。
提示与质量监控
为每项任务固定经过验证的模板,保留少量高质量示例,并监控回译、改写和顺序变化下的性能。对NER、POS和RE尤其要强制标签格式,减少“答非所问”。
远期愿景
多目标对齐系统
未来模型训练可同时优化人类偏好、任务准确率、输出可解析性和扰动鲁棒性,避免只追求自然对话而产生结构化任务的“对齐税”。
原文摘要
GPT series models, such as GPT-3, CodeX, InstructGPT, ChatGPT, and so on, have gained considerable attention due to their exceptional natural language processing capabilities. However, despite the abundance of research on the difference in capabilities between GPT series models and fine-tuned models, there has been limited attention given to the evolution of GPT series models' capabilities over time. To conduct a comprehensive analysis of the capabilities of GPT series models, we select six representative models, comprising two GPT-3 series models (i.e., davinci and text-davinci-001) and four GPT-3.5 series models (i.e., code-davinci-002, text-davinci-002, text-davinci-003, and gpt-3.5-turbo). We evaluate their performance on nine natural language understanding (NLU) tasks using 21 datasets. In particular, we compare the performance and robustness of different models for each task under zero-shot and few-shot scenarios. Our extensive experiments reveal that the overall ability of GPT series models on NLU tasks does not increase gradually as the models evolve, especially with the introduction of the RLHF training strategy. While this strategy enhances the models' ability to generate human-like responses, it also compromises their ability to solve some tasks. Furthermore, our findings indicate that there is still room for improvement in areas such as model robustness.