OVD: On-policy Verbal Distillation

TL;DR

提出OVD:基于轨迹匹配的对策,显著降低内存消耗,提升Web问答和数学推理性能。

cs.CL 🔴 高级 2026-01-30 45 次浏览
Jing Xiong Hui Shen Shansan Gong Yuxin Cheng Jianghan Shen Chaofan Tao Haochen Tan Haoli Bai Lifeng Shang Ngai Wong
知识蒸馏 强化学习 对策探索 自然语言处理 模型压缩

核心发现

方法论

OVD采用轨迹匹配替代传统的逐词概率匹配,利用教师模型提供的离散Verbal评分(0-9)进行轨迹评估。通过在策略采样中引入拒绝采样机制,结合Verbal反馈实现高效的on-policy训练。该框架避免了大规模词表的存储瓶颈,显著降低内存需求,同时支持多步推理和交互反馈。具体算法包括基于PPO的策略优化和Verbal拒绝采样,确保梯度估计无偏,提升探索能力。

关键结果

  • 在Web问答任务中,OVD在平均Exact Match(EM)指标上比现有方法提升12.9%,在仅用单次随机样本训练时,数学推理任务中性能提升达25.7%。
  • 在多项复杂多跳推理任务(如HotpotQA、GAIA)中,OVD表现优异,显著优于传统token-level蒸馏和sequence-level方法,尤其在长序列和大规模样本情况下保持高效率。
  • 实验验证了Verbal拒绝采样的无偏梯度估计和方差减小效果,证明其在强化学习中的理论优势。

研究意义

该研究突破了传统逐词匹配的内存瓶颈,提出利用Verbal评分进行轨迹级监督,为大规模语言模型的高效知识蒸馏提供新思路。其在Web问答和数学推理中的优异表现,彰显了Verbal反馈在模型探索和交互中的潜力,为未来模型的可扩展性和交互性奠定基础,推动模型推理能力的普及与应用。

技术贡献

提出基于轨迹匹配的OVD框架,结合Verbal拒绝采样机制,确保梯度无偏和方差控制。引入离散Verbal评分替代全词表概率,极大降低内存需求,支持长序列和大批量训练。理论分析证明了该方法的无偏性和收敛性,为强化学习中的知识蒸馏提供了新范式。

新颖性

首次将Verbal评分引入on-policy知识蒸馏,避免了大规模词表存储,创新性地结合轨迹匹配和拒绝采样机制,突破了传统token-level蒸馏的瓶颈,开启了利用Verbal反馈进行高效模型训练的新路径。

局限性

  • 目前Verbal评分依赖预定义的离散等级,可能限制细粒度的质量评估,未来需探索连续评分或多维反馈。
  • 在极端复杂推理任务中,Verbal反馈的准确性和一致性仍有待验证,可能影响训练效果。
  • 模型训练依赖大量交互轨迹,计算成本仍较高,需优化采样和评估策略。

未来方向

未来将结合多模态反馈和自监督机制,提升Verbal评分的表达能力。探索多任务、多模态环境中Verbal反馈的融合,增强模型的推理和交互能力。同时,优化采样策略,降低训练成本,推动在实际应用中的部署。

AI 总览摘要

随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,如何高效传递其推理能力成为核心挑战。传统的知识蒸馏方法多依赖逐词概率匹配,面临巨大的内存瓶颈,尤其在强化学习场景中难以扩展。本文提出了OVD(On-policy Verbal Distillation),一种基于轨迹匹配的创新框架,利用教师模型提供的离散Verbal评分(0-9)进行轨迹评估,突破了全词表存储限制。通过引入Verbal拒绝采样机制,结合策略优化算法(如PPO),实现了高效、无偏的on-policy训练。实验结果显示,OVD在Web问答和数学推理任务中表现优异,平均提升达12.9%和25.7%,同时显著降低了内存消耗。该方法不仅增强了模型的探索能力,还支持多步推理和交互反馈,为未来大规模模型的高效训练提供了新思路。其核心创新在于用离散Verbal评分替代全词表概率,结合轨迹匹配和拒绝采样机制,解决了传统方法的瓶颈,推动了模型推理能力的普及与应用。未来,结合多模态反馈和自监督技术,有望进一步提升Verbal评分的表达能力,拓展在复杂推理和实际场景中的应用潜力。

深度分析

研究背景

近年来,随着Transformer架构的发展,大规模语言模型(如GPT、BERT)在自然语言理解和生成中取得突破。然而,模型推理能力的提升仍面临挑战,尤其在多步推理和交互式任务中。传统知识蒸馏方法(如Hinton的软标签蒸馏)主要在token级别进行,需存储庞大的概率分布,导致内存瓶颈,限制模型在长序列和强化学习中的应用。近年来,研究者尝试引入环境交互和Verbal反馈,提升模型探索能力,但多依赖全词表概率,仍未突破存储限制。本文在此背景下,提出基于轨迹匹配的Verbal蒸馏,结合强化学习,旨在解决内存瓶颈和探索不足的问题。

核心问题

传统token-level蒸馏在长序列推理中存储成本极高,限制了模型的探索空间和交互能力。尤其在强化学习场景,存储大规模词表的logits成为瓶颈,导致训练难以扩展。此外,逐词匹配忽略了推理的层次结构,影响模型理解和推理质量。如何在保证推理能力的同时,降低存储和计算成本,成为亟待解决的问题。

核心创新

本文提出的核心创新包括:1)用离散Verbal评分替代全词表概率,显著降低存储需求;2)引入轨迹匹配机制,支持多步推理和交互反馈;3)结合Verbal拒绝采样,确保无偏梯度估计,提升训练稳定性;4)在强化学习中实现高效on-policy训练,突破传统存储瓶颈。这些创新共同推动模型在复杂推理任务中的表现和效率。

方法详解

  • �� 轨迹采样:学生模型生成多步推理轨迹,教师模型提供Verbal评分。• Verbal评分:离散0-9分级,评估推理质量,支持随机采样。• 拒绝采样:低评分轨迹被拒绝,重新采样,确保高质量轨迹。• 策略优化:采用PPO算法,在轨迹基础上进行策略更新。• 目标设计:结合奖励函数(如F1、数学等价性)进行轨迹评价。• 理论分析:证明拒绝采样的无偏性和方差控制,确保训练收敛。• 训练流程:多轮交互采样、筛选、优化,逐步提升模型推理能力。

实验设计

在Web问答和数学推理任务上进行评估,使用多个公开数据集(如NQ、TriviaQA、HotpotQA、GAIA、Minerva等)。比较基线包括传统token-level蒸馏和sequence-level方法。采用平均EM、准确率等指标,验证模型性能。通过消融实验分析Verbal评分粒度、拒绝阈值等对效果的影响,确保方法的鲁棒性和泛化能力。

结果分析

OVD在Web问答任务中平均EM提升12.9%,在数学推理中单样本训练提升25.7%。在多跳推理和复杂任务(如GAIA)中表现优异,优于传统蒸馏和搜索基线。验证了Verbal拒绝采样的无偏性和方差减小效果,显示其在强化学习中的理论优势。模型训练效率显著提升,支持长序列和大规模样本,验证了方法的实用性。

应用场景

该方法适用于需要复杂推理和交互的应用场景,如智能问答、自动推理、教育辅导等。通过降低存储成本和提升探索能力,可在有限硬件条件下部署大模型,推动AI在实际场景中的普及。未来结合多模态和自监督技术,有望实现更智能、更高效的推理系统。

局限与展望

目前Verbal评分为离散等级,可能影响细粒度评估的准确性。复杂任务中,Verbal反馈的准确性仍需验证,存在误差风险。训练过程中采样成本较高,需优化采样策略和模型结构以降低计算负担。未来需探索连续评分、多模态反馈等提升方案。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂的目标是生产高质量的产品。传统方法就像每个工人都要逐个检查每个零件,确保每个都完美,但这样太慢也太费力。现在,工厂引入了一个新系统,工人们只用给每个产品打个0到9的评分,快速判断产品的整体质量。这个评分系统可以帮助工人更快地筛选出好产品,也能告诉他们哪里需要改进。通过不断调整评分标准,工厂逐渐提高了生产效率和产品质量。这就像论文中的Verbal评分机制,用简单的数字替代复杂的概率分布,让工厂(模型)更快、更聪明地学习,生产出更好的产品(答案)。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个比赛,老师给你每个答案打分,从0到9,告诉你答得好不好。你可以根据老师的评分,知道自己哪里做得不错,哪里还需要努力。以前,老师会告诉你每个答案的详细评价,比如每个字的正确率,但这样很麻烦,也占用很多空间。现在,老师只用一个数字,既快又方便。你可以用这个数字来调整自己的答题策略,慢慢变得更厉害。这个方法就像论文里的Verbal评分,用简单的数字帮助你快速学习,避免繁琐的细节,让你更聪明、更快地进步。

原文摘要

Knowledge distillation offers a promising path to transfer reasoning capabilities from large teacher models to efficient student models; however, existing token-level on-policy distillation methods require token-level alignment between the student and teacher models, which restricts the student model's exploration ability, prevent effective use of interactive environment feedback, and suffer from severe memory bottlenecks in reinforcement learning. We introduce On-policy Verbal Distillation (OVD), a memory-efficient framework that replaces token-level probability matching with trajectory matching using discrete verbal scores (0--9) from teacher models. OVD dramatically reduces memory consumption while enabling on-policy distillation from teacher models with verbal feedback, and avoids token-level alignment, allowing the student model to freely explore the output space. Extensive experiments on Web question answering and mathematical reasoning tasks show that OVD substantially outperforms existing methods, delivering up to +12.9% absolute improvement in average EM on Web Q&A tasks and a up to +25.7% gain on math benchmarks (when trained with only one random samples), while also exhibiting superior training efficiency. Our project page is available at https://OVD.github.io

cs.CL