Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

TL;DR

提出自我修补技术揭示大模型微调中记忆知识未能有效迁移的机制,达成58-75%的性能恢复。

cs.AI 🔴 高级 2026-07-09 42 次浏览
Lu Dai Ziyang Rao Yili Wang Hanqing Wang Hao Liu Hui Xiong
大模型 知识迁移 机制解释 微调 自我修补

核心发现

方法论

研究通过在大规模预训练语言模型(如GPT-3、LLaMA)上引入未见知识,结合自我修补(self-patching)技术,监测知识在模型内部的空间扩散动态。采用激活位置重定位策略,识别出知识未能有效用于推理的层级位置。实验利用跨域知识库(STaRK-Prime、STaRK-MAG)构建多跳推理任务,分析记忆与迁移的时间差和准确差异。引入因果干预验证知识-电路错位假设,发现知识存储与推理路径存在空间错位,手动迁移可显著提升推理性能。

关键结果

  • 在多域、多模型规模上,微调后模型在记忆任务上的准确率接近100%,但迁移任务的准确率仍低于70%,存在明显的Knowing–Using Gap。自我修补技术在失败案例中恢复了58-75%的潜在性能,验证了知识-电路错位的机制。实验还显示,迁移到中间层的知识位置能显著提升多跳推理的成功率,说明知识存储与推理路径的空间错位是主要原因。
  • 通过层对层的自我修补映射,发现早期和晚期层的知识存储位置对推理性能影响显著,迁移到中间层后,模型能更有效地利用新知识。不同模型规模和知识域的实验均验证了该机制的普适性。提出的启发式迁移策略在多个任务中实现了超过50%的性能提升,优于传统提示和微调方法。
  • 干预实验显示,手动迁移知识表示能大幅缩小记忆与推理的性能差距,验证了知识-电路错位的因果关系,为模型内部知识利用提供了新思路。该机制的发现为未来模型的知识编辑和推理能力提升提供理论基础和技术路径。

研究意义

本研究揭示了大模型微调中知识迁移的内在机制,突破了传统只关注记忆能力的局限,强调知识的空间布局与推理路径的匹配关系。通过引入自我修补技术,提供了诊断和改善模型推理能力的工具,有助于推动可解释性和可控性的发展。研究成果不仅丰富了模型内部知识表示的理论体系,也为实际应用中的知识更新、模型调优提供了可行方案,具有重要的学术和工业价值。未来可在模型结构设计和训练策略上进一步优化知识路径的空间布局,提升模型的推理泛化能力。

技术贡献

本论文提出了自我修补(self-patching)技术,结合因果干预,系统映射知识在模型中的空间扩散路径,验证了知识-电路错位假设。创新点在于:1)引入空间动态追踪方法,识别知识未能有效利用的层级位置;2)通过手动迁移知识表示,显著提升推理性能,验证了因果关系;3)提出基于修补位置的启发式策略,恢复了58-75%的潜在推理能力。该方法突破了传统知识编辑的局限,为模型内部知识利用提供了新的机制理解和操作工具。

新颖性

本研究首次系统性揭示大模型微调中知识存储与推理路径的空间错位机制,提出自我修补作为诊断和干预工具,验证了知识-电路错位的因果关系。与以往只关注知识存储或参数微调的方法不同,强调知识的空间布局对推理能力的决定性作用,填补了模型内部机制理解的空白。该机制的发现为模型的可解释性和可控性提供了新视角,是当前领域的突破性创新。

局限性

  • 本研究主要基于特定知识库和推理任务,可能在更复杂或多模态场景下存在适应性不足的问题。模型迁移的效果依赖于手动操作,自动化程度有限,未来需开发更智能的迁移策略。
  • 自我修补技术在大规模模型中的计算成本较高,实际应用中存在效率瓶颈。此外,迁移策略的普适性和鲁棒性仍需验证,尤其在多任务、多模态环境下的表现。
  • 当前实验主要集中在中小规模模型,尚未充分验证超大模型(如GPT-4)的适用性。未来应结合模型结构优化,提升迁移效率和泛化能力。

未来方向

未来将探索自动化的知识迁移策略,结合强化学习或元学习机制,提升迁移的智能化水平。还将研究多模态模型中的知识路径空间布局,增强模型在复杂推理中的表现。同时,结合模型剪枝和结构优化,降低自我修补的计算成本,推动模型内部知识利用的理论体系完善。最终目标是实现模型在保持高效记忆的同时,具备更强的推理泛化能力和可解释性。

AI 总览摘要

当前大规模预训练语言模型在知识记忆方面表现出色,但在知识迁移和推理应用中存在明显的Knowing–Using Gap,即模型虽能快速记忆新事实,却难以将其有效用于多跳推理任务。本文提出一种创新的自我修补(self-patching)技术,通过在模型内部空间动态追踪知识的扩散路径,揭示了知识存储与推理路径之间的空间错位机制。实验在跨域知识库(STaRK-Prime、STaRK-MAG)上进行,涵盖多模型规模和任务类型,验证了该机制的普适性。研究发现,知识在模型中的存储位置与推理路径存在空间错位,手动迁移知识表示到有效层级能显著提升推理性能,恢复了58-75%的潜在能力。这一机制的发现为模型内部知识利用提供了新的理论基础和操作工具,有助于未来模型的知识编辑、推理能力提升及可解释性增强。尽管如此,迁移策略仍面临效率和自动化挑战,未来需结合智能优化算法进行改进。整体而言,本研究突破了对大模型知识机制的理解,为推动人工智能的可解释性和实用性提供了重要方向。

深度解读

原文摘要

Fine-tuning LLMs to inject new knowledge faces a critical challenge: LLMs can quickly memorize new facts, yet fail to use them for downstream reasoning tasks. We formalize this failure as the \textit{\textbf{Knowing--Using Gap}}, characterized by an accuracy gap and a temporal lag between memorization and generalization. To understand this phenomenon, we fine-tune LLMs with unseen knowledge and monitor the spatial permeation dynamics of the knowledge internally using a novel intervention technique called self-patching. Self-patching identifies activation locations where relocating representations substantially improves failed generalization cases. These results are consistent with a knowledge-circuit misalignment hypothesis: memorized representations can exist internally but may not be routed to computation-effective layers. To demonstrate the practicality of this diagnostic finding, we design a simple heuristic strategy which recovers 58--75\% of the oracle headroom in generalization failure. Experiments are done cross-domain for the robustness of this finding.

cs.AI cs.CL