Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

TL;DR

DriftBench评估多轮LLM科学创意中的约束遵循性,发现复杂性增加和约束违背现象。

cs.CL 🔴 高级 2026-04-30 3 次浏览
Garvin Kruthof
约束遵循 多轮交互 复杂性膨胀 模型漂移 科学创意

核心发现

方法论

DriftBench是一个用于评估多轮LLM科学创意中约束遵循性的基准。通过对七个模型的2146次测试,研究了在不同交互条件下的约束遵循性。使用结构化检查点和重新陈述探针来分析模型的约束记忆与行为遵循之间的脱节。

关键结果

  • 在压力条件下,Sonnet 4.6的KBV率高达99%,而GPT-5.4仅为8%。
  • 结构化检查点能部分降低KBV率,但无法消除复杂性膨胀。
  • 人类验证表明LLM判定约束违背的敏感性较低,报告的约束遵循分数偏保守。

研究意义

该研究揭示了在多轮LLM交互中,模型能够准确记忆约束但同时违背约束的现象。这对科学创意生成和模型设计具有重要意义,提示需要更好地理解模型在复杂交互中的行为模式。

技术贡献

提出了一个新的基准DriftBench,用于系统地评估多轮交互中的约束遵循性。发现了约束记忆与行为遵循之间的脱节现象,并验证了结构化检查点的有效性。

新颖性

首次系统性地评估多轮LLM交互中的约束遵循性,揭示了复杂性膨胀和约束违背的普遍现象。

局限性

  • 压力提示可能导致模型在遵循最新用户指令和保持原始目标之间的权衡。
  • 中性条件的有效性有待进一步验证。
  • 研究领域局限于科学创意生成,其他任务的漂移模式可能不同。

未来方向

未来研究可以探索模型在不同任务中的约束遵循性,并开发新的方法来减少复杂性膨胀和约束违背现象。

AI 总览摘要

在多轮LLM交互中,模型是否能保持对原始目标的忠实性一直是研究者关注的问题。现有的评估方法往往关注单轮输出或任务成功率,而忽视了跨轮次的约束遵循性。为了填补这一空白,本文提出了DriftBench,一个用于评估多轮LLM科学创意中约束遵循性的基准。

通过对七个模型的2146次测试,研究发现压力条件下模型的结构复杂性显著增加,而约束遵循性则有所下降。特别是Sonnet 4.6的KBV率高达99%,而GPT-5.4仅为8%。结构化检查点能部分降低KBV率,但无法消除复杂性膨胀。

这些发现对科学创意生成和模型设计具有重要意义,提示需要更好地理解模型在复杂交互中的行为模式。未来研究可以探索模型在不同任务中的约束遵循性,并开发新的方法来减少复杂性膨胀和约束违背现象。

深度分析

研究背景

随着大语言模型在科学创意生成中的应用日益广泛,研究者们开始关注模型在多轮交互中是否能保持对原始目标的忠实性。现有的评估方法往往关注单轮输出或任务成功率,而忽视了跨轮次的约束遵循性。

核心问题

多轮交互中的约束遵循性问题是一个重要且复杂的研究课题。模型在多轮交互中可能会因为复杂性膨胀而违背原始约束,这对科学创意生成的质量产生影响。

核心创新

本文提出了DriftBench,一个用于评估多轮LLM科学创意中约束遵循性的基准。通过结构化检查点和重新陈述探针,揭示了模型在复杂交互中的行为模式。

方法详解

  • �� DriftBench基准:评估多轮LLM科学创意中的约束遵循性。
  • �� 结构化检查点:在交互过程中定期检查模型的约束遵循性。
  • �� 重新陈述探针:测试模型的约束记忆能力。

实验设计

实验设计包括对七个模型的2146次测试,涵盖五个提供商的模型。在不同交互条件下,评估模型的约束遵循性和复杂性膨胀情况。

结果分析

实验结果显示,在压力条件下,Sonnet 4.6的KBV率高达99%,而GPT-5.4仅为8%。结构化检查点能部分降低KBV率,但无法消除复杂性膨胀。

应用场景

该研究的应用场景包括科学创意生成和模型设计。通过理解模型在复杂交互中的行为模式,可以提高科学创意生成的质量。

局限与展望

压力提示可能导致模型在遵循最新用户指令和保持原始目标之间的权衡。中性条件的有效性有待进一步验证。研究领域局限于科学创意生成,其他任务的漂移模式可能不同。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱,上面写着所有的步骤和材料。每次你做饭时,你都会尝试改进这个食谱,比如加一些新的调料或者改变烹饪时间。然而,有时候你会忘记原来的步骤,或者因为加了太多新东西而使得菜变得复杂。这就像模型在多轮交互中,虽然记得原来的约束,但因为不断尝试改进而违背了这些约束。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,每次你都想让自己的角色变得更强。游戏告诉你要遵循一些规则,比如不能使用某些道具。但你总是想尝试新的策略,有时候会忘记这些规则,或者因为加了太多新东西而使得游戏变得复杂。这就像模型在多轮交互中,虽然记得原来的约束,但因为不断尝试改进而违背了这些约束。

术语表

约束遵循 (Constraint Adherence)

指模型在多轮交互中是否遵循原始目标和限制。

在评估模型的科学创意生成时使用。

复杂性膨胀 (Complexity Inflation)

指模型在多轮交互中结构复杂性增加的现象。

在压力条件下观察到的现象。

重新陈述探针 (Restatement Probe)

用于测试模型的约束记忆能力。

在多轮交互中使用以评估模型的约束遵循性。

结构化检查点 (Structured Checkpointing)

在交互过程中定期检查模型的约束遵循性。

用于减少约束违背现象。

知道但违背 (Knows-but-Violates, KBV)

指模型记得约束但在行为上违背约束的现象。

在多轮交互中观察到的现象。

开放问题 这项研究留下的未解疑问

  • 1 如何设计模型以减少复杂性膨胀?
  • 2 如何提高模型的约束遵循性?
  • 3 中性条件的有效性如何验证?

应用场景

近期应用

科学创意生成

通过理解模型在复杂交互中的行为模式,提高科学创意生成的质量。

远期愿景

模型设计优化

开发新的方法来减少复杂性膨胀和约束违背现象。

原文摘要

When researchers iteratively refine ideas with large language models, do the models preserve fidelity to the original objective? We introduce DriftBench, a benchmark for evaluating constraint adherence in multi-turn LLM-assisted scientific ideation. Across 2,146 scored benchmark runs spanning seven models from five providers (including two open-weight), four interaction conditions, and 38 research briefs from 24 scientific domains, we find that iterative pressure reliably increases structural complexity and often reduces adherence to original constraints. A restatement probe reveals a dissociation between declarative recall and behavioral adherence, as models accurately restate constraints they simultaneously violate. The knows-but-violates (KBV) rate, measuring constraint non-compliance despite preserved recall, ranges from 8% to 99% across models. Structured checkpointing partially reduces KBV rates but does not close the dissociation, and complexity inflation persists. Human validation against blind raters confirms that the LLM judge under-detects constraint violations, making reported constraint adherence scores conservative. Sensitivity analyses confirm the findings are robust to temperature (0.7 vs.\ 1.0) and pressure type (novelty vs.\ rigor). We release all briefs, prompts, rubrics, transcripts, and scores as an open benchmark.

cs.CL cs.AI