Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation

TL;DR

提出压缩-蒸馏方法,压缩推理链条,训练效率提升至7.6倍,保持96%准确率。

cs.LG 🔴 高级 2026-06-04 41 次浏览
Maxime Griot Paul Steven Scotti Tanishq Mathew Abraham
知识蒸馏 推理链压缩 模型效率 链式推理 深度学习

核心发现

方法论

本文提出压缩-蒸馏(Compress-Distill)流程,包括三步:首先由大模型生成正确推理链,提取链条;其次用训练好的压缩模型对链条进行后处理,压缩至原长度的8.6-21%;最后用压缩链条训练学生模型。采用Qwen3.5-397B和gpt-oss-120B作为教师,压缩模型为Llama-3.3-70B和Ministral-14B,压缩比达0.086-0.21。训练过程中,比较原始链条、压缩链条和仅答案的效果,评估训练成本、推理长度和准确率。

关键结果

  • 压缩链条将训练用Token减少至原始的12-30%,训练速度提升2.0-7.6倍,推理输出缩短3-19倍。尽管如此,原始链条在所有尺度上仍保持最高的下游任务准确率,最高达96%。在长度匹配的截断实验中,压缩链条优于简单截断,尤其对较小模型效果明显。
  • 在不同教师和模型规模下,压缩链条的效果一致:训练成本显著降低,推理更快,但原始链条的准确率略优。压缩比例受数据集复杂度影响,长推理链更具冗余,压缩效果更佳。
  • 在不同训练方法(LoRA和全参数微调)中,压缩链条在保持较高准确率的同时,提升了每Token的效率,最大提升达18倍。压缩链条在小模型(0.8B)中表现尤为优越,能在保持96%原始准确率的基础上大幅提升效率。

研究意义

该研究揭示推理链压缩在提升训练效率和推理速度方面的潜力,为大规模模型的实际应用提供了新思路。通过后处理压缩链条,有效缓解了推理长链带来的成本瓶颈,同时保持较高的任务性能,为未来模型压缩和知识蒸馏提供了理论基础和实践方案。

技术贡献

本文提出了基于模型的后处理压缩机制,结合链条生成、压缩和训练三个阶段,系统性分析了压缩比例与性能的关系。引入多模型、多数据源的实验设计,验证了压缩链条在不同规模和训练策略下的适用性。提出的压缩模型(如Ministral-14B)在保持逻辑完整性的同时,大幅减少了推理链长度,显著提升训练和推理效率。

新颖性

首次系统性评估推理链压缩在知识蒸馏中的应用,结合多教师、多学生、多数据源,揭示了压缩比例与模型性能的权衡关系。区别于传统的剪枝或长度控制方法,本文采用模型生成的后处理压缩,提供了更灵活、更高效的压缩策略,突破了以往只关注模型参数或训练成本的局限。

局限性

  • 压缩链条虽提升效率,但在所有尺度上仍略逊于原始链条的准确率,尤其在大模型中差距较小,压缩效果受数据复杂度影响较大。
  • 当前压缩模型对链条逻辑完整性依赖较强,复杂推理场景下可能出现信息丢失或推理错误,影响下游任务表现。
  • 压缩过程增加了预处理复杂度,未来需优化压缩模型的速度和鲁棒性,确保在实际应用中的可扩展性。

未来方向

未来将探索自适应压缩策略,结合模型内部推理机制动态调整链条长度。还将研究多模态、多任务场景下的压缩方法,以及在更大规模模型和实际应用中的推广效果。此外,结合强化学习优化压缩策略,提升压缩质量与效率的平衡。

AI 总览摘要

随着大规模推理模型在复杂任务中的广泛应用,链式推理(Chain-of-Thought, CoT)链条的长短成为影响训练成本和推理速度的关键因素。传统上,长链虽能提升推理能力,但带来高昂的计算和存储负担。本文提出压缩-蒸馏(Compress-Distill)方法,通过模型后处理技术,将推理链压缩至原长度的8.6-21%,极大降低训练Token数(12-30%)和推理时间(3-19倍),同时保持高达96%的原始准确率。实验采用Qwen3.5-397B和gpt-oss-120B作为教师模型,压缩模型包括Llama-3.3-70B和Ministral-14B,验证了压缩比例与性能的权衡关系。压缩链条在不同训练策略(LoRA与全参数微调)中表现出优异的效率提升,尤其在较小模型中效果显著。尽管原始链条在所有尺度上仍优于压缩链条,但压缩策略为模型训练和推理提供了实用的折中方案。该研究不仅丰富了推理链压缩的理论基础,也为大规模模型的高效部署提供了新路径。未来,将结合自适应压缩和多模态场景,推动该技术在实际应用中的落地。整体而言,压缩-蒸馏为模型效率优化提供了可行方案,兼顾性能与成本,具有广泛的应用潜力。

深度分析

研究背景

近年来,深度学习模型在自然语言处理中的表现不断突破,链式推理(CoT)技术通过引导模型逐步推导,显著提升复杂任务的性能(Wei et al., 2022)。然而,长推理链带来训练成本高、推理时间长的问题,限制了其在实际场景中的应用。现有研究多关注链条长度控制(Zhang et al., 2026)或剪枝(Xia et al., 2025),但缺乏系统性评估模型后处理压缩的潜力。本文在此背景下,提出结合模型压缩与知识蒸馏的创新方案,旨在在保证推理能力的同时,显著降低成本。

核心问题

长链推理虽然提升了模型的推理能力,但带来了训练和推理的巨大成本。如何在保证模型性能的前提下,有效缩短推理链条,减少Token数,成为当前的核心难题。传统方法多依赖剪枝或长度限制,容易损失关键信息,影响准确率。现有蒸馏技术虽能迁移推理能力,但未充分考虑链条压缩的潜在价值。本文试图通过模型后处理实现链条压缩,探索其在实际训练中的效果与局限。

核心创新

本研究的核心创新包括:1)提出基于模型的推理链压缩机制,通过训练压缩模型对链条进行后处理,显著缩短推理链;2)结合多教师、多数据源,系统性分析压缩比例与模型性能的关系;3)在不同训练策略(LoRA与全参数微调)中验证压缩效果,发现压缩链条在提升效率的同时,保持高达96%的准确率。该方案突破了传统只关注模型参数或训练成本的局限,为推理链压缩提供了新思路。

方法详解

  • �� 生成:由大模型(Qwen3.5-397B、gpt-oss-120B)对问题生成推理链,验证正确性后提取链条。
  • �� 压缩:用训练好的压缩模型(如Ministral-14B、Llama-3.3-70B)对推理链进行后处理,生成短链。
  • �� 训练:用原始链条、压缩链条或答案-only目标训练学生模型,采用LoRA或全参数微调。
  • �� 评估:在多数据集、多模型规模下,比较不同方案的准确率、训练成本和推理长度,分析压缩比例的影响。

实验设计

采用多样化数据集(GSM8k、MultiArith、GPQA Diamond等)验证模型性能。设置不同压缩比(0.086-0.21),比较原始链条与压缩链条在训练速度、Token数和准确率上的差异。采用多模型(Llama、Ministral)和训练策略(LoRA、全参数)进行广泛实验。关键指标包括训练Token比例、训练时间、推理输出长度和任务准确率。还设计了长度匹配的截断对比,验证压缩链条的优势。

结果分析

压缩链条显著降低训练Token(12-30%),训练时间提升最高7.6倍,推理链缩短最多19倍。尽管如此,原始链条在所有尺度上仍保持最高准确率(最高达96%),压缩链在效率上优越,尤其在小模型(0.8B)中表现更佳。压缩比例受数据复杂度影响,长推理链更具冗余,压缩效果更明显。不同训练策略下,压缩链条的效率提升最大达18倍,验证了其在实际场景中的应用潜力。

应用场景

该技术适用于大规模模型的知识蒸馏、推理加速和成本控制,特别适合资源有限的场景。可用于企业部署、边缘计算和实时推理系统,显著降低硬件成本和能耗。未来还可结合自适应压缩策略,优化不同任务和模型的链条长度,推动模型在多模态、多任务环境中的高效应用。

局限与展望

压缩链条虽提升效率,但在某些复杂推理任务中可能丢失关键信息,影响准确率。当前压缩模型对链条逻辑依赖较强,难以应对极端场景。未来需优化压缩算法的鲁棒性和适应性,减少信息损失。此外,压缩过程增加预处理复杂度,需进一步提升速度和稳定性。

通俗解读 非专业人士也能看懂

想象你在准备一份复杂的菜肴,菜谱里有许多步骤和细节。传统做法是按照完整的菜谱逐步操作,虽然能做出美味佳肴,但耗时长、步骤繁琐。现在,你的朋友告诉你可以用一种特别的技巧,把菜谱中的关键步骤提炼出来,只保留最重要的部分,然后用这个简化的菜谱做菜。结果,虽然少了一些细节,但菜肴依然美味,做得更快更省力。这个技巧就像论文中的链条压缩,把繁琐的推理过程浓缩成简洁的版本,既节省时间,又能保持效果。它帮助模型在学习和推理时,专注于最核心的逻辑,减少冗余,提升效率。

简单解释 像给14岁少年讲一样

想象你在做一个超级复杂的科学实验,里面有很多步骤和细节。每次你都得把所有步骤都写下来,花费很多时间。而且,实验还很耗费材料。现在,假设你可以用一种神奇的工具,把那些繁琐的步骤压缩成几句话,只保留最重要的部分。这样,你就可以用更少的时间和材料完成实验,还能得到一样的结果。这就像论文里说的,把长长的推理链压缩成短短几句话,既节省时间,又不影响结果。这个方法让模型在学习和推理时,专注于最关键的内容,不再被繁琐的细节拖累。它就像用简洁的笔记代替一篇长文章,既方便又高效。

原文摘要

Reasoning models produce long chain-of-thought traces that are costly to distill and encourage verbose student outputs. We study post-hoc compression of such traces before knowledge distillation. Two teachers, Qwen3.5-397B-A17B and gpt-oss-120B, generate about 283k correct traces each; two instruction-tuned models then compress them to 8.6-21.0% of their original character length. Across a 48-run main grid plus seven Qwen-teacher truncation ablations, compressed traces reduce training tokens to 12-30% of raw, speed up training by 2.0-7.6x, and shorten inference outputs by 3-19x with smaller reductions under the shorter gpt-oss teacher. However, raw traces retain the highest downstream accuracy at every scale and for both teachers. A length-matched raw-trace truncation ablation shows that compression is not merely benefiting from a smaller token budget: model-compressed traces usually beat or match naive truncation, especially for smaller students, while maintaining shorter inference outputs. Overall, reasoning-trace compression offers an accuracy-efficiency trade-off rather than a free improvement: students retain up to 96% of raw-trace accuracy while gaining up to 18x higher per-token efficiency, and at the 0.8B scale under LoRA compressed traces narrow the raw-vs-compressed gap but do not exceed raw.

cs.LG cs.CL