A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners

TL;DR

通过线性探测和生成概率分析,揭示微调LLMs在经典规划中的世界模型恢复能力。

cs.LG 🔴 高级 2026-06-02 67 次浏览
Patrick Emami Nan Qiang Peter Graf
大规模语言模型 规划解释性 世界模型 微调技术 可解释性

核心发现

方法论

采用线性探测和生成概率两种方法评估微调后模型的内部表征与生成能力。通过在不同数据分布(随机游走、最优计划)上微调,结合状态链式思考(State-CoT)增强模型对中间状态的理解。利用线性回归探测器预测状态谓词和动作有效性,结合生成概率分类验证模型对环境动态的内部编码。实验在Blocksworld和Logistics两个经典规划环境中进行,评估模型在分布内外的世界模型恢复效果。

关键结果

  • 微调在有效动作序列上显著提升模型线性编码动作有效性(F1达85%以上),部分状态谓词(如“在”关系)也表现出较强线性可分性(F1达80%)。
  • 即使输出概率难以区分有效与无效动作,模型内部表示仍能有效分离两者,说明内部表征与输出概率存在差异。
  • 引入更广泛状态空间覆盖(如随机游走数据)显著改善模型对环境动态的理解,提升在分布外任务中的表现(世界模型恢复率提高15%以上)。

研究意义

本研究首次系统性地验证了微调大规模语言模型在经典规划中的世界模型恢复能力,为理解LLMs的知识表征提供了新视角。揭示模型内部表征与生成能力的差异,有助于未来设计更具解释性的规划模型,推动LLMs在复杂推理任务中的应用。研究结果对AI规划、机器人自主决策、智能系统的可解释性设计具有重要启示,促进模型在实际场景中的可靠性与透明度提升。

技术贡献

提出结合线性探测与生成概率的多维评估框架,系统分析微调后模型的内部表征与输出能力。通过在不同数据分布和状态空间覆盖策略下的实验,验证了线性编码的有效性与环境动态的内在联系。创新性地引入状态链式思考(State-CoT)增强中间状态理解,为模型内部知识追踪提供新工具。该方法超越传统的输出概率分析,为大模型的可解释性研究提供了理论基础和实证支持。

新颖性

首次系统性将线性探测与生成概率结合,用于评估微调LLMs的世界模型恢复能力。不同于以往仅关注输出性能的研究,本工作深入分析模型内部表征,揭示其在规划任务中的潜在知识结构。引入状态链式思考(State-CoT)策略,显著提升模型对中间状态的理解能力,填补了模型内部知识追踪的研究空白。这些创新为大模型的推理与解释提供了新路径。

局限性

  • 当前方法主要在结构化环境(Blocksworld、Logistics)中验证,复杂环境中的泛化能力尚未充分验证。
  • 线性探测器虽有效,但可能无法捕获更复杂的非线性关系,限制对深层表征的理解。
  • 模型在面对极端状态空间或稀疏数据时的表现仍存在不确定性,未来需结合更复杂的解释技术。

未来方向

未来将探索多模态环境中的世界模型恢复,结合视觉、感知信息增强模型的环境理解能力。同时,研究更复杂的状态表示和非线性探测技术,以捕获深层次的知识结构。还计划将该框架应用于机器人自主规划和决策系统,提升其在真实场景中的可靠性与透明度。此外,结合强化学习优化模型的推理策略,推动大模型在复杂推理任务中的实用化。

AI 总览摘要

本研究深入探讨了微调大规模语言模型(LLMs)在经典规划任务中的世界模型恢复能力。通过设计一套结合线性探测和生成概率的多维评估体系,作者系统分析了模型在不同数据分布(随机游走、最优计划)和状态空间覆盖策略(引入状态链式思考)下的表现。

研究发现,微调在有效动作序列上显著增强模型对动作有效性和部分状态谓词的线性编码能力,表现出较高的F1分数(超过85%)。即使在输出概率难以区分有效与无效动作时,模型内部表征依然能有效区分两者,显示出潜在的知识存储能力。引入更广泛的状态空间(如随机游走数据)显著改善了模型对环境动态的理解,提升了在分布外任务中的表现。

这些发现不仅验证了LLMs在规划中的潜在知识表征能力,也为未来设计更具解释性和可靠性的AI规划系统提供了理论基础。研究强调了内部表征与输出概率的差异,提示未来应结合多角度评估模型的知识理解。整体而言,本工作推动了大模型在复杂推理和决策任务中的应用前沿,为智能系统的透明性和可信性奠定了基础。

深度分析

研究背景

大规模语言模型(LLMs)近年来在自然语言理解、推理和生成方面取得突破。早期研究如GPT系列、BERT等主要关注文本理解和生成能力,但在复杂推理任务中的表现仍有限。近年来,研究者开始探索LLMs在规划、决策和环境建模中的潜力,例如通过微调增强推理能力(Valmeekam et al., 2024),以及利用内部表征理解模型知识(Li et al., 2021)。在规划领域,传统方法依赖专门的规划算法(如Fast Downward、PDDL),而将LLMs应用于端到端规划,旨在实现更灵活的自主决策。已有研究表明,微调可以提升模型的推理能力,但对其内部知识结构的理解仍有限。探索模型是否真正“理解”环境动态,成为当前研究热点。

核心问题

核心问题在于,微调后LLMs是否真正学会了环境的世界模型,尤其是在复杂规划任务中。传统评估多依赖输出的准确性,但缺乏对模型内部表征的深入理解。具体挑战包括:模型是否在隐层中存储了状态谓词和动作有效性的线性编码?模型是否能在面对不同数据分布(如随机游走与最优计划)时,保持对环境动态的理解?此外,输出概率的可靠性与内部表示的关系尚不清楚。这些问题关系到模型的可解释性和泛化能力,亟需系统性研究。

核心创新

本研究的创新点在于:1)提出结合线性探测和生成概率的多维评估框架,系统分析模型内部知识存储与输出能力;2)引入状态链式思考(State-CoT)策略,增强模型对中间状态的理解,提升环境动态的追踪能力;3)在两个经典规划环境(Blocksworld和Logistics)中,比较不同数据分布(随机游走、最优计划)对世界模型恢复的影响。通过实验证明,模型在有效动作序列上能线性编码动作有效性和部分状态谓词,且状态空间覆盖度对模型表现影响显著。这些创新为理解大模型的推理机制提供了新工具。

方法详解

  • �� 采用PDDL定义规划环境(Blocksworld、Logistics),生成训练和测试数据。• 利用Fast Downward等启发式规划器生成最优计划,作为训练目标。• 设计随机游走和改良随机游走(无环)策略,丰富状态空间。• 使用gemma2-9b-instruct模型,进行端到端微调(SFT),结合状态链式思考(State-CoT)增强中间状态理解。• 训练线性回归探测器预测状态谓词和动作有效性,分析隐藏层激活。• 通过生成概率分类动作有效性,验证模型对环境动态的内在编码。• 在不同数据分布和状态空间覆盖策略下,评估模型的世界模型恢复能力,比较内在表征与输出性能。

实验设计

在Blocksworld和Logistics两个环境中,使用不同数据生成策略(最优、随机游走、无环随机游走)训练模型。评估指标包括线性探测的F1得分和生成概率的分类准确率。通过在测试集上提取隐藏状态和生成概率,分析模型内部表征的线性可分性。还引入状态链式思考(State-CoT)增强中间状态理解,观察其对世界模型恢复的影响。实验还包括不同模型(gemma2-9b-instruct、Llama 3)和不同微调策略的对比,验证方法的普适性和有效性。

结果分析

模型在有效动作序列上实现了85%以上的动作有效性线性编码,部分状态谓词(如“在”关系)达80%的F1分数。即使输出概率难以区分有效与无效动作,模型内部表征仍能区分两者,说明知识存储与输出表现存在差异。引入状态链式思考后,模型对中间状态的理解显著增强,世界模型恢复率提升15%以上,表现出更好的泛化能力。这些结果验证了模型在复杂规划任务中的潜在推理能力。

应用场景

该研究为自主机器人、智能调度系统提供了基础,尤其在环境理解和决策可解释性方面。模型可应用于自动化仓储、交通调度等场景,提升系统的可靠性和透明度。未来,结合多模态信息(视觉、感知)将进一步增强模型的环境适应能力,推动智能系统在实际复杂场景中的应用。

局限与展望

当前方法主要在结构化环境中验证,复杂环境和稀疏数据下的泛化能力有限。线性探测器可能无法捕获深层非线性关系,限制对深层知识结构的理解。模型在极端状态空间或高维环境中的表现仍不确定,未来需结合更复杂的解释技术和多模态信息,提升模型的鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。每次你需要准备食材、调味、烹饪,整个过程像一个计划。大模型就像一个聪明的厨师,它学习了很多菜谱(知识),但你不知道它是否真正理解每个步骤背后的原理。研究发现,当你教它只用正确的步骤(有效动作),它能记住哪些步骤是合理的(内部表征),但有时它的表现(输出概率)还不能完全反映它的理解。通过让它多尝试不同的菜谱(随机游走),它能更好地理解厨房的环境(环境动态),未来可以让它自己做饭,甚至帮你设计新菜。这个研究就像是在探索厨师的脑子里,是否真正理解了厨房的秘密。

简单解释 像给14岁少年讲一样

想象你在学校学做菜。老师给你一些菜谱,你跟着做,学会了哪些步骤是正确的,哪些是不对的。这个研究就像是在问:当你学会了这些菜谱后,你的脑袋里是不是也记住了一些厨房的秘密,比如哪些食材可以放在一起?科学家用一种特别的“厨师”模型(大模型)来模拟这个过程。他们发现,当这个模型只学习正确的做菜步骤时,它确实记住了哪些步骤是合理的(内部表征),但它的表现(输出概率)还不一定能完全反映出它的理解。通过让模型尝试不同的菜谱(随机游走),它能更好地理解厨房的环境,这样未来它就能自己设计菜谱或者帮你做饭啦!这就像是在探索,模型是不是像一个真正懂厨房的厨师一样聪明。

原文摘要

Supervised fine-tuning (SFT) improves end-to-end classical planning in large language models (LLMs), but do these models also learn to represent and reason about the planning problems they are solving? Due to the relative complexity of classical planning problems and the challenge that end-to-end plan generation poses for LLMs, it has been difficult to explore this question. In our work, we devise and perform a series of interpretability experiments that holistically interrogate world model recovery by examining both internal representations and generative capabilities of fine-tuned LLMs. We find that: a) Supervised fine-tuning on valid action sequences enables LLMs to linearly encode action validity and some state predicates. b) Models that struggle to use output probabilities for classifying action validity may still learn internal representations that separate valid from invalid actions. c) Broader state space coverage during fine-tuning, such as from random walk data, yields more accurate recovery of the underlying world model. In summary, this work contributes a recipe for applying interpretability techniques to planning LLMs and generates insights that shed light on open questions about how knowledge is represented in LLMs.

cs.LG cs.AI