LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

TL;DR

LoopUS通过循环潜在精炼模型提升LLM推理性能,提升了17.4%的WikiText困惑度。

cs.LG 🔴 高级 2026-05-10 8 次浏览
Taekhyun Park Yongjae Lee Dohee Kim Hyerim Bae
循环计算 预训练模型 推理性能 深度学习 自然语言处理

核心发现

方法论

LoopUS是一种后训练框架,将预训练的LLM转化为循环架构。其核心包括:1) 基于分阶段表示动态的块分解;2) 输入依赖的选择门以减轻隐藏状态漂移;3) 随机深度监督以实现内存高效学习;4) 自适应早退出的置信头。

关键结果

  • LoopUS在WikiText上降低了17.4%的困惑度,在LAMBADA上降低了21.3%,并在TinyLlama上实现了14.6%的相对增益,使用的训练数据比现有基线少17-20倍。
  • 在多项下游任务中,LoopUS平均提高了1.6到2.2个百分点的准确率,尤其在ARC-C和OBQA任务上表现显著。
  • 通过稳定的潜在循环,LoopUS在不增加参数的情况下提升了推理性能。

研究意义

LoopUS通过将预训练模型转化为循环潜在精炼模型,显著提升了推理性能,解决了现有方法中需要从头训练循环模型或进行破坏性改造的问题。该方法在不增加参数的情况下提高了模型的计算深度,具有重要的学术和工业意义。

技术贡献

LoopUS通过块分解和选择性门控机制,解决了循环模型中的隐藏状态漂移问题,并通过随机深度监督避免了全BPTT的高内存消耗。该方法提供了一种稳定的后训练修改方式,显著提升了推理性能。

新颖性

LoopUS是首个将预训练LLM转化为循环潜在精炼模型的方法,通过块分解和选择性门控机制,创新性地解决了隐藏状态漂移和计算瓶颈问题。

局限性

  • LoopUS在某些任务上性能提升有限,可能因为这些任务对知识检索的依赖较大。
  • 需要对不同任务进行个性化调整,以达到最佳效果。

未来方向

未来工作可以探索LoopUS在更大规模模型上的应用,以及在不同任务上进行更广泛的验证。同时,研究如何进一步优化选择性门控机制以提高适应性。

AI 总览摘要

在大规模语言模型(LLM)的推理性能提升中,现有方法通常需要从头训练循环模型或进行破坏性改造,这既耗费计算资源,又可能损害预训练模型的能力。LoopUS通过将标准预训练LLM转化为循环架构,解决了这些问题。

LoopUS的核心技术包括块分解、选择性门控、随机深度监督和自适应早退出。这些机制共同将非循环模型转化为循环形式,同时稳定其计算瓶颈和表示崩溃。

实验结果显示,LoopUS在WikiText和LAMBADA数据集上分别降低了17.4%和21.3%的困惑度,并在多项下游任务中提高了准确率。这表明,LoopUS不仅提高了推理性能,还在不增加参数的情况下实现了计算深度的提升。

深度分析

研究背景

近年来,大规模语言模型(LLM)在自然语言处理领域取得了显著进展。然而,现有方法在推理性能提升方面,通常需要从头训练循环模型或进行破坏性改造,这既耗费计算资源,又可能损害预训练模型的能力。为了解决这些问题,研究者们开始探索如何在不增加参数的情况下提升模型的计算深度。

核心问题

现有方法在提升LLM推理性能时,通常需要从头训练循环模型或进行破坏性改造,这既耗费计算资源,又可能损害预训练模型的能力。因此,如何在不增加参数的情况下提升模型的计算深度,成为一个重要的研究问题。

核心创新

LoopUS通过将标准预训练LLM转化为循环架构,解决了现有方法中的计算瓶颈和表示崩溃问题。其核心创新包括块分解、选择性门控、随机深度监督和自适应早退出,这些机制共同将非循环模型转化为循环形式。

方法详解

  • �� 块分解:将模型分为编码器、推理块和解码器,基于分阶段表示动态。
  • �� 选择性门控:通过插入选择性门控机制,减轻隐藏状态漂移。
  • �� 随机深度监督:避免全BPTT的高内存消耗,保持训练的稳定性。
  • �� 自适应早退出:通过置信头预测是否需要进一步精炼。

实验设计

实验在多个预训练模型上进行,包括Qwen3-1.7B、Qwen3-4B、TinyLlama等。使用的数据集包括WikiText和LAMBADA,评估指标为困惑度和准确率。实验结果显示,LoopUS在多个任务上均取得了显著的性能提升。

结果分析

LoopUS在WikiText上降低了17.4%的困惑度,在LAMBADA上降低了21.3%,并在多项下游任务中提高了准确率,尤其在ARC-C和OBQA任务上表现显著。

应用场景

LoopUS可以直接应用于需要高效推理的大规模语言模型中,如智能客服、自动翻译等领域。这些应用场景对推理性能和计算资源有较高要求,而LoopUS可以在不增加参数的情况下提升计算深度。

局限与展望

LoopUS在某些任务上性能提升有限,可能因为这些任务对知识检索的依赖较大。此外,LoopUS需要对不同任务进行个性化调整,以达到最佳效果。未来的研究可以探索如何进一步优化选择性门控机制以提高适应性。

通俗解读 非专业人士也能看懂

想象一个工厂,LoopUS就像是一个智能生产线。传统生产线需要从头到尾重新设计,而LoopUS通过在现有生产线上添加智能模块,使其能够在不增加工人数量的情况下提高生产效率。每个模块就像是一个聪明的工人,能够根据需要调整生产步骤,确保产品质量稳定提升。这样,工厂不仅节省了成本,还提高了生产效率。

简单解释 像给14岁少年讲一样

嘿,小伙伴!你知道吗,LoopUS就像是你玩游戏时的超级外挂。通常,你需要从头开始练级,但有了LoopUS,它就像是一个神奇的工具,可以让你在不增加游戏时间的情况下快速提升等级。它会在你每次升级时,自动调整你的技能点数,让你在游戏中变得更强大!是不是很酷?

术语表

LoopUS (循环深度上升)

一种将预训练LLM转化为循环架构的后训练框架,通过块分解和选择性门控机制提升推理性能。

用于提高LLM的推理性能,避免从头训练循环模型。

选择性门控 (Selective Gating)

一种机制,通过插入选择性门控,减轻循环模型中的隐藏状态漂移。

用于LoopUS中,确保每次迭代的稳定性。

随机深度监督 (Random Deep Supervision)

一种避免全BPTT高内存消耗的方法,通过随机选择部分迭代进行监督。

用于LoopUS中,保持训练的稳定性。

自适应早退出 (Adaptive Early Exiting)

通过置信头预测是否需要进一步精炼,优化计算资源的使用。

用于LoopUS中,提升推理效率。

困惑度 (Perplexity)

衡量语言模型预测不确定性的指标,数值越低表示模型性能越好。

用于评估LoopUS在WikiText和LAMBADA数据集上的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同任务上进一步优化LoopUS的选择性门控机制,以提高适应性和性能。
  • 2 探索LoopUS在更大规模模型上的应用,验证其在不同任务上的广泛适用性。

应用场景

近期应用

智能客服

LoopUS可以应用于智能客服系统中,通过提升推理性能,提高客户服务的效率和质量。

自动翻译

在自动翻译系统中,LoopUS可以通过优化计算资源的使用,提升翻译的准确性和速度。

远期愿景

智能助手

LoopUS可以用于开发更智能的个人助手,通过提升推理性能,实现更自然的人机交互。

原文摘要

Looped computation shows promise in improving the reasoning-oriented performance of LLMs by scaling test-time compute. However, existing approaches typically require either training recurrent models from scratch or applying disruptive retrofits, which involve substantial computational costs and may compromise pretrained capabilities. To address these limitations, we introduce \textbf{Looped Depth Up-Scaling} (LoopUS), a post-training framework that converts a standard pretrained LLM into a looped architecture. As a key technical contribution, LoopUS recasts the pretrained LLM into an encoder, a looped reasoning block, and a decoder. It operationalizes this latent-refinement architecture through four core components: (1) block decomposition, guided by staged representation dynamics; (2) an input-dependent selective gate to mitigate hidden-state drift; (3) random deep supervision for memory-efficient learning over long recursive horizons; and (4) a confidence head for adaptive early exiting. Collectively, these mechanisms transform a standard non-looped model into a looped form while stabilizing it against both computational bottlenecks and representation collapse. Through stable latent looping, LoopUS improves reasoning-oriented performance without extending the generated traces or requiring recurrent training from scratch. For more details, see https://thrillcrazyer.github.io/LoopUS

cs.LG cs.AI