When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs

TL;DR

层剪枝影响LLM推理能力,尤其是长链推理。

cs.LG 🔴 高级 2025-10-25 7 次浏览
Keyu Wang Tian Lyu Guinan Su Lu Yin Marco Canini Jonas Geiping Shiwei Liu
层剪枝 长链推理 大语言模型 推理能力 测试时间缩放

核心发现

方法论

研究通过测试时间缩放分析层剪枝对长链推理的影响。使用Qwen3-8B和s1.1-7B模型,采用ShortGPT、Reverse-order和LaCo等剪枝方法进行实验。

关键结果

  • 结果1:在AIME24上,剪去一层后,Qwen3-8B的长链推理能力急剧下降,准确率接近零。
  • 结果2:即使在知识密集任务中表现稳定,长链推理能力仍显著下降。
  • 结果3:监督微调无法恢复已损失的推理能力。

研究意义

研究揭示了层剪枝对推理密集型LLM的潜在风险,挑战了“无损剪枝”的普遍看法,强调了在实际应用中谨慎评估和部署的必要性。

技术贡献

本研究首次系统揭示了层剪枝对测试时间缩放的脆弱性,提供了新的分析框架和实验验证,推动了对LLM推理能力的深入理解。

新颖性

首次通过测试时间缩放探讨层剪枝对长链推理的影响,揭示了该领域的潜在风险和挑战。

局限性

  • 局限1:剪枝后模型在长链推理任务中表现不佳,尤其是当剪去多层时。
  • 局限2:监督微调未能有效恢复推理能力。

未来方向

未来研究可探索更有效的剪枝策略和恢复方法,以保持LLM的推理能力。

AI 总览摘要

层剪枝是一种提高大语言模型(LLM)效率的常用技术,但其对长链推理能力的影响尚未充分研究。本研究通过测试时间缩放,分析了层剪枝对LLM推理能力的影响。实验表明,即使剪去一两层,模型在长链推理任务中的表现也会显著下降,而在知识密集任务中仍保持稳定。监督微调未能恢复已损失的推理能力,表明层剪枝可能导致结构性损害。研究结果挑战了“无损剪枝”的普遍看法,呼吁重新审视剪枝策略,并为开发保持推理能力的方法提供了新见解。

深度分析

研究背景

近年来,大语言模型(LLM)在自然语言处理领域取得了显著进展。然而,这些模型通常具有大量的冗余层,导致计算效率低下。层剪枝已成为提高模型效率的常用方法,但其对模型推理能力的影响,尤其是长链推理能力,尚未得到充分研究。

核心问题

层剪枝虽然提高了模型效率,但可能会削弱模型的长链推理能力。长链推理对于许多实际应用至关重要,因此研究其在剪枝后的表现尤为重要。

核心创新

本研究首次通过测试时间缩放分析层剪枝对长链推理的影响,揭示了剪枝可能导致的推理能力下降,并挑战了现有的“无损剪枝”观点。

方法详解

  • �� 使用Qwen3-8B和s1.1-7B模型进行实验
  • �� 采用ShortGPT、Reverse-order和LaCo等剪枝方法
  • �� 评估剪枝对长链推理任务的影响
  • �� 分析监督微调对恢复推理能力的效果

实验设计

实验使用了MATH500、GPQA Diamond和AIME24等数据集,评估了不同剪枝深度下模型的推理能力。通过比较剪枝前后的性能,分析剪枝对长链推理的影响。

结果分析

实验结果表明,剪去一层后,Qwen3-8B在长链推理任务中的表现急剧下降。即使在知识密集任务中表现稳定,长链推理能力仍显著下降。监督微调未能有效恢复推理能力。

应用场景

研究结果对需要长链推理能力的应用场景具有重要意义,如科学推理和多步逻辑推理。需要重新评估剪枝策略以确保模型在这些任务中的表现。

局限与展望

研究表明,层剪枝可能导致长链推理能力的显著下降,尤其是在剪去多层时。监督微调未能有效恢复推理能力,表明需要探索新的恢复方法。

通俗解读 非专业人士也能看懂

想象一个工厂,生产线上的每个工人都有特定的任务。层剪枝就像减少工人数量以提高效率,但如果关键工人被移除,生产线可能会失去协调能力,导致生产效率下降。即使在某些任务中表现良好,但在需要复杂协调的任务中,生产线可能会崩溃。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,需要多个步骤才能赢。层剪枝就像减少游戏中的步骤来加快速度,但如果关键步骤被删除,你可能无法赢得比赛。即使在简单关卡中表现良好,但在需要多步策略的关卡中,你可能会失败。

术语表

层剪枝 (Layer Pruning)

一种减少模型层数以提高计算效率的方法。

用于提高大语言模型的效率。

长链推理 (Long-chain Reasoning)

涉及多个推理步骤的复杂推理过程。

评估层剪枝对模型推理能力的影响。

测试时间缩放 (Test-time Scaling)

在推理时分配更多计算资源以增强推理能力的技术。

用于评估模型的推理能力。

监督微调 (Supervised Fine-tuning)

通过有监督的数据对模型进行微调以提高性能。

尝试恢复剪枝后损失的推理能力。

Qwen3-8B

一种8亿参数的指令微调模型,支持思考和非思考模式。

用于评估层剪枝对推理能力的影响。

开放问题 这项研究留下的未解疑问

  • 1 如何在不损害长链推理能力的情况下进行层剪枝?
  • 2 是否存在更有效的微调方法来恢复剪枝后的推理能力?

应用场景

近期应用

科学推理

在科学研究中需要复杂推理的应用场景中,确保模型的推理能力不受损害。

远期愿景

智能助手

开发能够进行复杂推理的智能助手,提高用户体验和任务完成率。

原文摘要

Layer pruning has emerged as a widely adopted technique for improving the efficiency of large language models (LLMs). Although existing methods demonstrate strong performance retention on general knowledge tasks, their effect on long-chain reasoning, a more brittle yet crucial capability, remains largely unexplored. In this work, we study the impact of layer pruning on long-chain reasoning through the lens of test-time scaling, a key mechanism in modern LLMs that enables strong reasoning capacity by allocating more computation at inference time. With extensive experiments, we demonstrate that pruning even one or two layers can severely impair test-time scaling, with performance collapsing drastically on long reasoning benchmarks even when performance on knowledge-intensive and shallow reasoning tasks remains stable. Furthermore, we find that standard supervised fine-tuning remedies fail to recover test-time scaling once it has deteriorated. Through in-depth analyses, we identify the mechanisms underlying this fragility of test-time scaling and highlight the fundamental risks of applying layer pruning to reasoning-intensive LLMs. These findings call for a rethinking of layer pruning strategies and provide insights for developing methods that preserve the robustness of reasoning. We open-source the codebase in \href{https://github.com/keyu-wang-2002/Layer-Pruning-Harms-Inference-Scaling}{https://github.com/keyu-wang-2002/Layer-Pruning-Harms-Inference-Scaling}.

cs.LG cs.AI