核心发现
方法论
该方法基于模型内部隐藏状态的几何结构,通过构建多银行参考云,利用拓扑连通性指标评估推理轨迹的质量。采用平均池化隐藏状态表示轨迹,结合软k近邻测度和多银行云评分,融合自我一致性,筛选优质轨迹。利用少量标注数据构建正确与错误的参考云,跨问题传递几何结构信息,提升偏好信号的鲁棒性。具体算法包括云构建、拓扑连通性分析、云评分和偏好对构造,结合变分贝叶斯优化进行模型训练。
关键结果
- 在GSM8K和MATH-Numeric数据集上,Cloud-ScPO在四个模型设置中均优于传统ScPO,提升最高达4.49%。例如,Llama-3-8B在GSM8K上的准确率由49.74%提升至52.24%。在偏好对数量上,Cloud-ScPO保持或略优于对比方法,且能更有效区分信息丰富的轨迹与低质量响应。
- 通过偏好对的分析,Cloud-ScPO在保持正确性可靠性的同时,显著改善了低质量响应的过滤效果,尤其在处理重复、截断或不完整轨迹时表现优越。
- 多银行云评分通过拓扑连通性指标增强了轨迹质量的判别能力,利用不同问题的全局几何结构,有效传递偏好信号,减少对外部奖励模型的依赖。
研究意义
该研究突破了依赖外部验证或人类标注的偏好监督限制,提出利用模型内部几何结构进行偏好信号的传递,极大降低了标注成本。其创新的拓扑几何方法为大规模LLM推理优化提供了新思路,有望推动自动化推理系统的鲁棒性和泛化能力,具有重要的理论和应用价值。
技术贡献
提出基于隐藏状态几何结构的多银行参考云构建与评分机制,结合拓扑连通性分析实现轨迹质量评估。创新性地将拓扑数据分析引入偏好优化,融合自我一致性与云评分,形成半监督偏好构建的新框架。该方法在无需大量标注的情况下,有效提升推理准确率,为偏好优化提供了新技术路径。
新颖性
首次将模型内部隐藏状态的几何拓扑结构应用于偏好信号传递,利用多银行云构建跨问题的全局几何图谱,区别于传统基于答案一致性或奖励模型的偏好方法。此创新突破了单一问题范围的局限,实现偏好信号的跨任务迁移。
局限性
- 当前方法依赖于预训练模型的内部表示质量,若模型表示不佳,则偏好信号的传递效果受限。
- 拓扑连通性分析在高维空间中计算复杂,可能影响大规模应用的效率。
- 偏好对构建仍受限于少量标注数据的代表性,未来需探索更鲁棒的几何特征提取方式。
未来方向
未来将结合更高效的拓扑分析算法,扩展多模态数据的几何偏好传递,探索自适应多银行云的动态构建策略。此外,结合强化学习与几何结构,优化偏好信号的自我增强机制,以实现更大规模、更复杂任务的推理优化。
AI 总览摘要
近年来,大型语言模型(LLMs)在数学推理和符号逻辑方面展现出巨大潜力,但其偏好优化仍面临标注成本高、外部奖励模型依赖强等难题。传统方法如RLHF和自我一致性,虽取得一定效果,但在多轨迹、多任务场景中偏好信号的鲁棒性不足。
本文提出Cloud-ScPO,一种基于模型内部隐藏状态几何结构的偏好优化框架。该方法利用少量标注数据构建多个正确与错误的参考云,通过拓扑连通性指标评估未标注轨迹的质量。核心思想是将轨迹表示为平均池化的隐藏状态,结合多银行云评分机制,融合自我一致性,筛选出高质量推理路径。
实验在GSM8K和MATH-Numeric数据集上验证了该方法的有效性。结果显示,Cloud-ScPO在四个模型设置中均优于传统的ScPO,最高提升4.49%。偏好对分析表明,该方法在保持正确性可靠性的同时,更有效地过滤低质量响应,尤其在处理重复或截断轨迹方面表现突出。
该研究的重要意义在于突破了对外部验证和人类标注的依赖,利用模型内部几何信息实现偏好信号的跨任务迁移,为大规模推理系统的鲁棒性和泛化能力提供了新路径。未来,结合更高效的拓扑分析和多模态几何特征,有望推动自动推理技术的进一步发展。
深度分析
研究背景
大语言模型(LLMs)在数学推理、符号逻辑等领域取得显著进展,代表性工作包括Chain-of-Thought prompting、自我一致性(Wang et al., 2023)和偏好优化(Ouyang et al., 2022; Rafailov et al., 2023)。这些方法通过引导模型生成多轨迹或利用奖励模型提升推理能力,但依赖大量标注和外部奖励,成本高且鲁棒性有限。近年来,研究开始关注模型内部表示的几何结构,试图从隐藏状态的空间特性中提取偏好信号(Burns et al., 2024; Zhang et al., 2026)。然而,如何有效利用这些几何信息实现跨任务迁移,仍是未解决的难题。
核心问题
现有偏好优化方法多依赖于答案一致性或外部奖励模型,在多轨迹、多任务场景中容易受到噪声干扰,导致偏好信号不稳定。尤其在半监督设置下,缺乏充分标注,模型难以区分优劣轨迹。如何利用模型内部隐藏状态的几何结构,构建鲁棒的偏好信号,成为提升推理性能的关键。该问题关系到自动化推理系统的泛化能力和效率,亟需创新的偏好传递机制。
核心创新
本研究提出Cloud-ScPO,创新点在于:1)利用模型隐藏状态的几何拓扑结构,构建跨任务的多银行参考云,传递偏好信息;2)引入拓扑连通性指标(如H0持久同调)评估轨迹质量,增强偏好信号的鲁棒性;3)融合自我一致性与云评分机制,筛选高质量推理路径,减少对外部奖励的依赖。这一方法突破了传统单一任务范围的限制,实现偏好信号的跨任务迁移,显著提升推理准确率。
方法详解
- �� 生成轨迹:用预训练模型对标注和未标注问题生成多条推理轨迹。• 表示提取:将每条轨迹的隐藏状态进行平均池化,获得轨迹向量。• 云构建:从标注数据中筛选正确和错误轨迹,构建多个参考云,利用拓扑分析(如H0持久同调)识别连通结构。• 云评分:对未标注轨迹在每个参考云中计算连通性指标,结合软k近邻机制,得到云评分。• 自我一致性:通过多轨迹投票确定答案偏好方向。• 轨迹筛选:结合云评分和偏好方向,筛选优质轨迹,构建偏好对。• 训练优化:采用变分贝叶斯优化和偏好对,调整模型参数,提升推理能力。
实验设计
在GSM8K和MATH-Numeric两个数据集上,采用Llama-3-8B和Mistral-7B模型,比较基线(如零-shot、SFT、ScPO)与提出方法的性能。设置包括每题生成8-16条轨迹,利用少量标注数据构建参考云,调节云评分参数。评估指标为准确率、偏好对数量和质量、偏好反转率。还进行消融实验,验证不同表示策略和拓扑指标的影响。通过偏好对分析,确认云评分在过滤低质量轨迹中的有效性。
结果分析
Cloud-ScPO在GSM8K上,Llama-3-8B模型准确率由49.74%提升至52.24%,Mistral-7B由28.43%提升至32.92%。在MATH-Numeric上,Qwen3-8B模型准确率由58.14%提升至62.33%。偏好对数量与质量均优于传统方法,偏好对的正确性保持稳定,过滤掉大量低质量、重复或截断轨迹。偏好信号的几何传递显著增强了模型的推理能力和鲁棒性。
应用场景
该方法适用于自动化数学推理、符号逻辑、编程辅助等场景,尤其在标注成本高昂或多任务环境中表现优越。通过利用模型内部几何信息,可降低对外部奖励模型的依赖,提升系统的自适应能力。未来可结合多模态数据和动态云构建策略,推动智能推理系统的广泛应用。
局限与展望
当前方法依赖于预训练模型的内部表示质量,若模型表示不佳,偏好信号效果受限。拓扑分析在高维空间中计算复杂,难以扩展到超大规模场景。偏好对构建仍受限于少量标注数据的代表性,未来需探索更鲁棒的几何特征提取和自适应机制。
通俗解读 非专业人士也能看懂
想象你在一个工厂里工作,工厂里有很多不同的机器在生产不同的产品。每台机器都在按照一定的流程操作,但有些流程更快、更准确,有些则容易出错。工厂管理者希望找到最优的生产流程,但没有时间逐一检查每台机器的每一步。于是,他们开始观察每台机器的操作轨迹,从中发现一些共同的规律,比如哪些流程更连贯、哪些流程容易出错。根据这些规律,他们可以判断某个流程是否优良,而不用每次都亲自检查。这个方法就像论文中的云结构分析,通过观察模型内部隐藏状态的几何关系,判断推理轨迹的质量,从而优化整个系统的表现。
简单解释 像给14岁少年讲一样
假设你在学校里参加一个数学比赛,你会做很多题目,有些题做得很好,有些题则出错。老师想帮你找到做得最好的解题步骤,但不能每次都检查每个步骤。于是,老师开始观察你做题的过程,把每个步骤的细节都记下来,然后找出那些看起来很合理、连贯的步骤。老师发现,正确的解题步骤通常在某个“思路空间”里聚集得很紧密,而错误的步骤则散落得很远。通过观察这些“思路空间”的结构,老师可以判断哪些步骤更靠谱,帮助你更快找到正确的解题方法。这就像论文里用几何和拓扑的方法,观察模型内部的“思路空间”,判断推理轨迹的好坏,从而让模型变得更聪明、更可靠。
术语表
Hidden State (隐藏状态)
模型在每个时间步的内部表示,反映当前信息的抽象特征。技术上为神经网络中的中间向量。
用于表示推理轨迹的整体特征,构建云结构和进行几何分析。
Topology (拓扑结构)
描述空间中点的连通关系和整体形状的数学结构。用于分析隐藏状态的几何连通性。
在云评分中,通过拓扑连通性指标评估轨迹的质量。
Persistent Homology (持久同调)
一种拓扑数据分析方法,用于识别数据中的连通和空洞结构,反映数据的多尺度特性。
用于分析隐藏状态点云的连通结构,构建参考云。
Cloud Score (云评分)
基于拓扑连通性指标的轨迹质量评估机制,衡量轨迹与参考云的相似度。
核心指标,用于筛选优质推理路径。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升几何结构在高维空间中的表达能力,解决计算复杂度问题。
- 2 能否结合多模态信息(如图像、语音)扩展几何偏好传递的适用范围。
- 3 在极少标注情况下,如何自动构建更鲁棒的参考云。
应用场景
近期应用
数学推理系统优化
利用模型内部几何结构筛选优质推理路径,提升自动数学解题的准确性和鲁棒性,适用于教育、科研等场景。
符号逻辑与编程辅助
通过几何偏好信号优化逻辑推理和代码生成模型,减少错误率,增强模型的推理连贯性。
远期愿景
通用推理引擎
结合几何结构分析,构建跨任务、跨模态的智能推理系统,实现自主学习和优化,推动AI自主推理技术发展。
原文摘要
Preference optimization improves mathematical reasoning in large language models (LLMs), but reliable chosen-rejected pairs usually require verified answers, human annotations, or external reward models. We investigate whether preference supervision can instead be derived from the model's internal representation geometry in a semi-supervised setting. Our analysis shows that reasoning trajectories generated across different mathematical problems form structured global point clouds in which correct and incorrect trajectories exhibit different geometric organization. Based on this observation, we propose Cloud-ScPO, a topology-guided preference-mining framework that uses a small labeled set to construct multiple correct and incorrect reference Clouds. Each trajectory is represented by a mean-pooled hidden state and scored against connectivity-induced components using a component-level soft $k$-nearest-neighbor measure averaged across reference banks. We combine this cross-problem Cloud signal with prompt-level self-consistency: self-consistency determines the answer-level preference direction, while Cloud scoring selects concrete trajectories and filters pairs by their score margin. Experiments on GSM8K and MATH-Numeric across four model settings show that Cloud-ScPO consistently improves over ScPO, with gains of up to 4.49% on GSM8K and 4.19% on MATH-Numeric. Pair-level analyses further show that Cloud-ScPO maintains comparable correctness reliability while more effectively separating informative chosen trajectories from incomplete, repetitive, or otherwise low-quality rejected responses.