核心发现
方法论
作者从GSM8K训练集随机取1000题作开发集,再筛出100道可被至少一种提示法正确解出的“易题”作为基底;随后用模板向每题插入1句语义无关但语法自然的干扰句,控制主题、角色名重叠和数字范围三类因素,构成58,052个GSM-IC样本。评估用micro accuracy、macro accuracy及按基底题准确率归一化的norm,并在code-davinci-002与text-davinci-003上测试COT、0-COT、LTM、PROGRAM与self-consistency(SC)。
关键结果
- 在GSM-IC-4K上,所有提示法都明显退化:例如code-davinci-002下COT微平均仅72.4、宏平均6.0;LTM微平均77.5但宏平均也只有18.0,说明加入一条无关句后,很多题无法稳定复现正确解。
- SC是最强缓解手段之一:code-davinci-002下LTM+SC微平均达93.4、宏平均45.0;0-COT+SC也升到64.3/1.0。论文还指出,20次采样时正确答案召回率可达99.7%,即几乎总能“抽到”正确解。
- 把无关信息加入示例本身,或在提示里显式写入“可忽略无关信息”,都能稳定提升表现;同时,数字大小变化影响不大,而与原题词汇重叠越强,干扰越严重。text-davinci-003总体归一化更高,但宏平均常更差,说明RLHF并未根治分心问题。
研究意义
这篇工作把“模型会不会被无关信息带偏”从零散观察变成了可量化基准问题。它提醒我们,当前大模型在考试式题目上看似会推理,但在真实场景中还必须先判断哪些信息该忽略、哪些信息才相关。对学术界而言,这补上了鲁棒性评测的一块短板;对工业界而言,它直接关联客服、办公助手、教育产品和信息抽取系统:只要上下文里混入噪声,模型就可能算错、答偏或引用错误证据。
技术贡献
技术上,论文的贡献不在于提出新模型,而在于提出了新基准GSM-IC和一套清晰的鲁棒性测量框架。其核心是“保持原题不变,只额外添加一条保证不改变标准答案的干扰句”,从而把分心效应与题目语义变化解耦。再结合micro/macro/norm三类指标、COT/LTM/PROGRAM/0-COT的统一对比,以及SC和“带干扰示例/忽略指令”两种缓解策略,作者系统展示了模型在上下文筛选上的脆弱性与可恢复性。
新颖性
新颖性在于:它不是把题目改写成另一个任务,而是只加一条“本应无关”的句子,专门测模型是否会被打断。相比噪声标注、对抗改写或语法扰动,这种设计更贴近真实场景中的“背景杂讯”。同时,论文还把干扰因素拆成主题、角色名重叠、数字范围三维,给出了更细的机制分析。
局限性
- 数据规模虽然达58,052,但基底只有100题,且来自GSM8K中的“易题”子集,因此结论主要反映这类算术推理的分心脆弱性,未必覆盖更复杂的多跳推理或开放域问答。
- 评测主要依赖API模型code-davinci-002与text-davinci-003,且以单一模板家族构造干扰句;模型、提示格式或语言风格一变,敏感性可能不同。
- SC虽能显著提高召回,但需要20次采样,计算与调用成本更高,且它更像“多试几次”而非真正学会过滤无关信息。
未来方向
后续可把GSM-IC扩展到更难的推理任务、更多语言和更多噪声形态,并研究训练阶段如何显式学习“相关性筛选”。另一个方向是结合检索、工具调用或程序化分解,让模型先做信息选择,再做计算,从机制上减少被无关上下文牵走的概率。
AI 总览摘要
大语言模型在数学和推理榜单上屡创高分,但这篇论文指出了一个更接近真实世界、却常被忽视的弱点:只要问题描述里混进一条“看似自然、实则无关”的句子,模型就可能立刻跑偏。作者用GSM8K构造了GSM-IC——Grade-School Math with Irrelevant Context——在保持原题答案不变的前提下,系统加入无关信息,专门测试模型会不会被干扰。
实验覆盖COT、0-COT、LTM、PROGRAM和self-consistency(SC)等主流提示法,并比较code-davinci-002与text-davinci-003。结果非常直接:在GSM-IC-4K上,COT、LTM、PROGRAM都出现明显退化;例如code-davinci-002下COT微平均72.4、宏平均仅6.0,LTM微平均77.5,但宏平均也只有18.0。宏平均尤其低,说明很多原本能答对的基底题,一旦换个无关句子就不再稳定。作者还发现,text-davinci-003虽在部分微平均上更强,但宏平均并不总更好,说明RLHF式对齐并未消除“分心”。
更有意思的是,论文没有停留在“问题很严重”,而是提出了几种可操作的缓解方式。第一,SC通过20次采样并多数投票,能大幅抬升表现;code-davinci-002下LTM+SC达到93.4微平均与45.0宏平均,且正确答案召回率可高达99.7%。第二,在少样本示例中加入带干扰的样例,或者在提示中直接写“请忽略无关信息”,也能稳定提升。第三,作者做了机制拆解:无关句中的数字大小影响不大,但与原题词汇、角色名重叠越多,模型越容易被带偏。
这项研究的重要性在于,它把“推理能力”从只看解题难度,推进到也看信息筛选能力。现实中的助手经常面对冗长邮件、聊天记录、网页内容和表格注释,真正困难的往往不是“会不会算”,而是“先该看什么”。GSM-IC提醒我们,未来的大模型评测不能只测会做题,还要测会不会忽略噪声、保持注意力。
当然,作者也坦率地给出了边界:基底题只有100道,主要来自GSM8K的“易题”子集;干扰句是模板化生成;SC提升明显,但代价是多次采样,离真正稳健的理解还有距离。下一步更值得期待的是,把这种“抗干扰”能力扩展到更复杂任务、更多噪声类型,并在训练阶段就教会模型先过滤、再推理。
深度分析
研究背景
近年来,大语言模型借助few-shot prompting、chain-of-thought(Wei et al., 2022)、zero-shot CoT(Kojima et al., 2022)、least-to-most prompting(Zhou et al., 2022)和program-based reasoning(Chowdhery et al., 2022)在GSM8K等算术推理任务上表现亮眼。但这些基准通常默认“题目里出现的每句话都重要”。心理学早已发现,无关信息会干扰儿童乃至成人的数学推理;在QA、事实推断、代码生成与句法泛化中,类似脆弱性也被反复观察。本文正是在这一背景下,专门检验大模型是否会被无关上下文带偏。
核心问题
核心问题很明确:当输入中同时包含相关与无关信息时,模型能否识别哪些内容应被忽略,并保持原有推理正确率?作者把这种现象定义为distractibility。难点在于,这不是简单加噪声,因为无关句必须在语义上自然、在句法上可读、且不改变标准答案;同时还要区分“答案变了”与“只是模型被干扰了”两类效应。
核心创新
本文的创新主要有三点。第一,提出GSM-IC,采用“原题保留+插入一条无关句”的方式,把干扰效应单独抽离出来。第二,设计micro、macro与normalized accuracy三种互补指标,既看总体正确率,也看同一基底题在不同干扰下能否保持一致。第三,系统比较COT、0-COT、LTM、PROGRAM及SC,并通过“带干扰示例”“忽略指令”研究提示层面的抗干扰机制。
方法详解
- �� 数据构造:从GSM8K训练集随机抽1000题做开发池,再挑100题作为基底集,这些题至少能被一种提示法正确解出;每题需要2到7步推理,其中60题只需2步。\n\n• 干扰句生成:使用模板法插入1句无关信息,并控制三类因素:主题(同主题/跨主题)、角色名重叠(如A’s father)、数字范围(in-range/out-of-range)。作者手工检查英语可接受性,并确认添加后不改变标准答案。\n\n• 评测指标:micro accuracy是所有样本的平均正确率;macro accuracy要求同一基底题下所有干扰版本都答对才算成功;normalized accuracy则把结果除以基底题准确率,衡量“受干扰程度”。\n\n• 方法对比:测试COT、0-COT、LTM、PROGRAM四类提示;对SC则采样20个答案、温度0.7、取多数投票。\n\n• 提示策略:few-shot设置中比较“原始示例”与“带无关信息的示例”;另加一条任务指令“Solve grade school math problems. Feel free to ignore irrelevant information given in the questions.”以显式引导模型过滤噪声。
实验设计
作者主要在GSM-IC-4K上评测,即从58,052个GSM-IC样本中均匀抽取4,000个,覆盖全部100个基底题。模型包括code-davinci-002与text-davinci-003。无SC时用greedy decoding(τ=0);SC时采样20次,τ=0.7。基线来自GSM8K与GSM-IC上的原始/带干扰示例两种提示设置,系统比较COT、0-COT、LTM和PROGRAM,并报告micro、macro与norm。
结果分析
最核心的结果是:即便只加一句无关句,性能也显著下降。code-davinci-002下,COT在GSM-IC-4K的微平均/宏平均为72.4/6.0,LTM为77.5/18.0,PROGRAM为54.4/5.0,0-COT仅29.0/1.0。macro极低说明“同一题的所有干扰版本都答对”很难实现。text-davinci-003在部分设置下归一化更好,但整体宏平均仍偏弱。\n\n缓解策略有效但有限。SC显著增强:code-davinci-002下LTM+SC达到93.4微平均、45.0宏平均;COT+SC为88.1/30.0,PROGRAM+SC为74.6/13.0。论文还报告,20次采样时正确答案召回率高达99.7%,表明正确解几乎总会在多次采样中出现。\n\n机制分析显示,数字本身不是主要问题,词汇重叠才是关键。把无关信息加入示例或在提示中加入“忽略无关信息”都能稳定增益,说明模型确实能从上下文或指令中学会更好地筛噪,但这种能力仍远未稳健。
应用场景
短期内,这项工作可用于评测聊天助手、教育产品、财务与法律问答系统的抗干扰能力,尤其适合检查模型是否会把背景说明、侧边备注或不相关数字误当作证据。对提示工程而言,GSM-IC也提供了一个实用诊断工具:如果模型在这类样本上明显退化,说明它的上下文筛选还不够可靠。
局限与展望
如果要进一步验证结论,还需要更大、更难、跨语言的干扰基准,以及更接近真实应用的长上下文任务。
核心概念词典
Irrelevant Context
指对答案没有贡献、但会干扰模型判断的背景句。论文证明哪怕只加一句,也可能显著改变输出。
Normalized Accuracy
把在干扰集上的准确率除以基底题准确率后的指标,用来衡量相对鲁棒性。它能避免把“本来就不会做”误判成“被干扰”。
Instruction Tuning / Instruction
通过在提示中直接告诉模型任务规则来引导行为。本文发现“忽略无关信息”的自然语言指令确实有效。
Prompt Exemplar
放在问题前面的示例题及其答案,用来教模型如何作答。本文比较了带不带干扰示例的效果差异。
Lexical Overlap
无关句与原题共享的词汇或角色名程度。重叠越高,模型越容易把它们错误关联起来。
开放问题 这项研究留下的未解疑问
- 1 无关信息到底通过“注意力分散”“语言联想”还是“数值误用”影响推理?本文做了现象分解,但尚未给出可验证的内部机制模型,需要结合中间表示、注意力分析或因果追踪进一步研究。
- 2 怎样在训练阶段真正学会过滤无关上下文,而不是靠SC这类推理时补救?目前仍缺少统一、可迁移且成本可接受的训练方案。
应用场景
近期应用
提示鲁棒性体检
给企业或研究者一个快速体检工具:把候选提示放进GSM-IC式样本,若性能暴跌,就说明提示或模型对噪声不稳。
数据标注与评测设计
帮助评测人员在构造题目、问答或考试题时,有意识地区分“相关信息”和“诱饵信息”,避免把模型能力高估。
远期愿景
可忽略噪声的推理模型
未来可望形成一类原生抗干扰的大模型,能先判断上下文相关性,再执行推理,从而更适合真实长文本任务。
原文摘要
Large language models have achieved impressive performance on various natural language processing tasks. However, so far they have been evaluated primarily on benchmarks where all information in the input context is relevant for solving the task. In this work, we investigate the distractibility of large language models, i.e., how the model problem-solving accuracy can be influenced by irrelevant context. In particular, we introduce Grade-School Math with Irrelevant Context (GSM-IC), an arithmetic reasoning dataset with irrelevant information in the problem description. We use this benchmark to measure the distractibility of cutting-edge prompting techniques for large language models, and find that the model performance is dramatically decreased when irrelevant information is included. We also identify several approaches for mitigating this deficiency, such as decoding with self-consistency and adding to the prompt an instruction that tells the language model to ignore the irrelevant information.