The Illusion of Latent Generalization: Bi-directionality and the Reversal Curse

TL;DR

双向监督可缓解自回归语言模型的反转诅咒,提升反转准确率。

cs.CL 🔴 高级 2026-03-14 5 次浏览
Julian Coda-Forno Jane X. Wang Arslan Chaudhry
语言模型 反转诅咒 双向监督 掩码语言模型 线性探针

核心发现

方法论

研究采用了双向监督的方法,包括掩码语言模型(MLM)和仅解码器的掩码训练(NTP+Masking)。通过在四个反转基准上进行比较,研究探讨了这些目标如何成功地提高反转准确率。研究表明,反转准确率需要训练信号明确地将源实体作为预测目标。

关键结果

  • 在四个反转基准上,MLM和NTP+Masking显著提高了反转准确率,标准NTP模型几乎为0%。
  • 通过线性探针分析,发现正向和反向方向被存储为不同的条目。
  • MLM和NTP+Masking在反转查询中表现出不同的索引几何。

研究意义

该研究揭示了双向监督在提高语言模型反转能力方面的重要性,挑战了现有的单向自回归模型的局限性。通过引入双向监督,研究展示了在不依赖单一方向无关表示的情况下提高反转准确率的可能性。

技术贡献

技术贡献在于展示了双向监督如何在不依赖单一方向无关表示的情况下提高反转准确率,并揭示了MLM和NTP+Masking在索引几何上的差异。

新颖性

该研究首次系统地比较了MLM和仅解码器的掩码训练在反转任务中的表现,提出了反转准确率与训练信号之间的关系。

局限性

  • 研究未能证明成功的反转对应于单一的方向无关表示。
  • 结果表明,双向监督的改进可能不对应于统一概念的潜在泛化。

未来方向

未来的研究方向包括设计能够更好地耦合事实的两个方向的目标或架构,以实现更高效的数据学习。

AI 总览摘要

反转诅咒是指自回归语言模型在训练时学习了一个方向的事实,但在反向查询时失败。现有的解决方案主要依赖于数据级干预,如反向增强,但这些方法可能会扭曲语言统计或需要手动生成释义。本文提出了一种更为根本的方法,通过双向监督来缓解反转诅咒。研究表明,掩码语言模型(MLM)和仅解码器的掩码训练(NTP+Masking)在反转任务中表现优异,显著提高了反转准确率。

通过线性探针分析,研究发现成功的反转并不对应于单一的方向无关表示,而是将正向和反向方向存储为不同的条目。MLM和NTP+Masking在索引几何上表现出不同的特征,前者表现出更强的主体集中聚类,而后者则显示出反转与无关事实一样难以区分。

尽管双向监督在提高反转能力方面表现出色,但研究指出,这种改进可能并不对应于潜在泛化的统一概念。未来的研究方向包括设计能够更好地耦合事实的两个方向的目标或架构,以实现更高效的数据学习。

深度分析

研究背景

近年来,大型语言模型(LLM)在自然语言处理领域取得了显著进展。然而,这些模型在反转任务中表现不佳,即在训练时学习了一个方向的事实,但在反向查询时失败。反转诅咒是这一问题的典型表现,挑战了模型的泛化能力。

核心问题

反转诅咒是指模型在训练时学习了一个方向的事实,但在反向查询时失败。这一问题的重要性在于它反映了模型在知识表示和检索上的局限性,影响了模型的实际应用。

核心创新

本文的创新在于提出了双向监督的方法,包括掩码语言模型(MLM)和仅解码器的掩码训练(NTP+Masking),以提高反转准确率。与传统的单向自回归模型不同,这些方法通过引入双向监督,显著提高了反转任务的表现。

方法详解

  • �� 使用掩码语言模型(MLM)进行双向监督。

  • �� 采用仅解码器的掩码训练(NTP+Masking),在上下文中引入掩码。

  • �� 在四个反转基准上进行比较,分析不同目标的成功机制。

实验设计

实验设计包括在四个反转基准上比较MLM和NTP+Masking的表现。使用线性探针分析模型的内部表示,评估正向和反向方向的存储方式。

结果分析

实验结果表明,MLM和NTP+Masking在反转任务中表现优异,显著提高了反转准确率。线性探针分析揭示了正向和反向方向被存储为不同的条目。

应用场景

该研究的应用场景包括提高语言模型在反转任务中的表现,增强模型的知识表示和检索能力。

局限与展望

尽管双向监督在提高反转能力方面表现出色,但研究指出,这种改进可能并不对应于潜在泛化的统一概念。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱,告诉你先放什么,再放什么。现在,你想要反过来做,比如先放盐再放水。通常情况下,你的食谱只告诉你一种顺序,但如果你能记住两种顺序,那就更好了。本文研究的就是如何让语言模型像你一样,记住两种顺序,从而在反转任务中表现更好。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个游戏,游戏规则是你要记住一堆卡片的顺序。通常你只记得正着的顺序,但如果有人问你倒着的顺序,你就懵了。科学家们想办法让电脑也能记住倒着的顺序,就像你在游戏中一样,这样电脑就能更聪明地回答问题啦!

术语表

反转诅咒 (Reversal Curse)

指模型在训练时学习了一个方向的事实,但在反向查询时失败。

研究中探讨了如何通过双向监督缓解这一问题。

掩码语言模型 (Masked Language Model, MLM)

一种语言模型,通过掩码部分输入来预测被掩码的词语。

用于提供双向监督,提高反转准确率。

仅解码器的掩码训练 (NTP+Masking)

一种训练方法,通过在上下文中引入掩码来增强模型的反转能力。

与MLM一起用于比较反转任务的表现。

线性探针 (Linear Probe)

用于分析模型内部表示的一种工具,通过线性分类器来评估不同表示之间的距离。

用于分析正向和反向方向的存储方式。

双向监督 (Bidirectional Supervision)

一种训练策略,通过同时考虑正向和反向信息来提高模型的泛化能力。

用于提高反转任务的准确率。

开放问题 这项研究留下的未解疑问

  • 1 如何设计能够更好地耦合事实的两个方向的目标或架构,以实现更高效的数据学习。
  • 2 在不依赖单一方向无关表示的情况下,如何进一步提高反转准确率。

应用场景

近期应用

反转任务优化

通过双向监督提高语言模型在反转任务中的表现,适用于需要双向信息处理的应用场景。

远期愿景

泛化能力提升

通过改进模型的知识表示和检索能力,推动自然语言处理领域的进一步发展。

原文摘要

The reversal curse describes a failure of autoregressive language models to retrieve a fact in reverse order (e.g., training on ``$A > B$'' but failing on ``$B < A$''). Recent work shows that objectives with bidirectional supervision (e.g., bidirectional attention or masking-based reconstruction for decoder-only models) can mitigate the reversal curse. We extend this evaluation to include a vanilla masked language modeling (MLM) objective and compare it to decoder-only masking-based training across four reversal benchmarks and then provide a minimal mechanistic study of \emph{how} these objectives succeed. We show that reversal accuracy requires training signal that explicitly makes the source entity a prediction target, and we find little evidence that success corresponds to a single direction-agnostic representation of a fact. Instead, representation distances and linear probes are consistent with storing forward and reverse directions as distinct entries, with different indexing geometry for MLM versus decoder-only masking-based training. Our results caution that objective-level ``fixes'' can improve reversal behavior without necessarily inducing the kind of latent generalization one might expect from a unified concept.

cs.CL cs.AI