Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

TL;DR

提出ISPA,通过参数吸收将KV缓存压缩50%,保持几乎无损视觉质量。

cs.CV 🔴 高级 2026-07-01 37 次浏览
Xiaomeng Fu Jia Li Yiming Hu Yong Wang Hayden Kwok-Hay So Jiao Dai Xiangxiang Chu Jizhong Han
视频生成 自回归模型 内存优化 参数吸收 流式推理

核心发现

方法论

本文提出的ISPA框架将长视频生成中的KV缓存压缩问题转化为参数蒸馏问题。通过在推理初期的短暂暖身阶段,监测全局与局部注意力输出差异,利用闭式最小二乘解计算实例特定的权重调制系数,将部分长程历史信息“吸收”到模型参数中。具体实现包括在模型的部分层由全注意力切换到局部注意力,通过线性调节参数W+ΔW补偿缺失的历史信息,避免传统的缓存丢弃带来的依赖断裂。采用可分解注意力机制,利用硬件支持的Log-Sum-Exp状态,实时收集全局与局部注意力,避免额外计算开销。实验在1.3B到14B参数模型上验证,最高压缩50%的KV缓存几乎无视觉质量损失。

关键结果

  • 在长达30秒的视频生成中,ISPA在不同模型(1.3B至14B参数)上实现了最高50%的KV缓存压缩,视觉质量指标几乎不变(误差<1%),显著降低了GPU内存消耗。具体数据显示,在Krea-Realtime(14B)模型中,压缩后峰值内存减少23.7GB,推理速度提升1.86倍(结合量化)。
  • 在多种指标评估中(如美学、背景一致性、运动平滑度等),压缩比例为50%的模型性能变化极小,部分指标甚至略有提升,表明参数吸收有效维护了长程依赖。
  • 通过动态层选择机制,模型根据暖身阶段的重建误差自适应地决定哪些层进行参数吸收,确保不同视频场景下的适应性和鲁棒性。

研究意义

该研究突破了传统外部KV缓存的限制,将长视频生成的记忆压缩问题转化为模型参数优化,极大缓解了内存瓶颈,为长视频、实时生成等应用提供了可行方案。其创新的参数吸收机制为未来模型内部记忆管理提供新思路,有望推动视频生成技术在工业界的普及,尤其是在硬件资源有限的边缘设备上实现高质量长视频生成。

技术贡献

本文提出的ISPA框架在保持推理速度的同时,成功将长程历史信息内化为模型参数,避免缓存不断增长带来的存储瓶颈。通过在推理过程中动态监测全局与局部注意差异,利用闭式解进行线性调节,避免了复杂的梯度优化,极大提升了效率。结合可分解注意力机制,实现了在不增加计算负担的情况下,实时采集全局信息,确保模型的长程依赖能力。

新颖性

首次将KV缓存压缩问题转化为参数蒸馏任务,通过实例特定的线性调节实现长程记忆的内在化,区别于传统的缓存丢弃或外部存储策略。提出的可分解注意力机制和动态层选择机制,增强了模型的适应性和鲁棒性,为流式生成模型提供了全新的架构思路。

局限性

  • 当前方法依赖于暖身阶段的短暂监测,可能在极端场景或剧烈场景变化中表现不佳,需重新调优或多次暖身。
  • 参数吸收机制在极端长距离依赖或复杂场景中可能不足以完全替代全注意力,存在一定的性能折中。
  • 模型参数调节在不同模型和任务中需要细致调优,泛化能力仍需验证。

未来方向

未来可探索多层次、多阶段的参数吸收策略,结合自适应调节机制提升长程依赖的表达能力。同时,结合更高效的硬件加速技术,进一步降低调节开销,推动在更大规模模型和更复杂场景中的应用。

AI 总览摘要

视频生成技术近年来取得巨大突破,但长视频的高内存需求和实时性难题依然制约其应用。传统的自回归模型通过KV缓存存储历史信息,虽支持长序列生成,却带来存储瓶颈和速度下降的问题。本文提出的ISPA框架创新性地将长程记忆的压缩从简单丢弃转向参数蒸馏。通过在推理初期的暖身阶段,监测全局与局部注意力输出差异,利用闭式最小二乘解计算实例特定的调节系数,将部分长距离历史信息“吸收”到模型参数中。这一机制使得模型在后续生成中无需大量KV缓存,显著降低内存消耗,最高压缩达50%,而视觉质量几乎无损。实验在多种规模模型上验证了其有效性,尤其在14B参数模型中实现了23.7GB的内存节省和1.86倍的推理加速。该方法不仅提升了长视频生成的可行性,也为模型内部记忆管理提供了新思路。未来,结合多层次调节和硬件加速,ISPA有望推动流式生成技术在实际场景中的广泛应用。

深度分析

研究背景

视频生成技术经历了从基于GAN的早期方法到基于扩散模型的高质量合成。代表性工作如Video Diffusion Models、Flow-GAN等,解决了单帧质量和时间一致性问题,但在长视频生成中面临存储和计算瓶颈。自回归模型通过逐帧生成和KV缓存实现长序列,但随着序列增长,内存和速度成为限制。近年来,研究尝试通过剪枝、压缩等策略缓解,但依然难以兼顾长程依赖和效率。

核心问题

核心问题在于KV缓存线性增长导致的内存瓶颈,限制了长视频的实时生成能力。传统方法通过丢弃冗余Token或 eviction策略,破坏了长距离依赖,造成画面抖动和身份丧失。如何在保证长程依赖的同时,显著减少缓存存储,是当前难题。

核心创新

提出参数吸收(Instance-Specific Parametric Absorption, ISPA),通过在推理暖身阶段监测全局与局部注意差异,利用闭式最小二乘解动态调节模型线性投影参数,将长距离历史信息内在化为模型参数。此机制避免了缓存的无限增长,兼顾效率与依赖。结合可分解注意力技术,实现全局信息的实时采集与融合,确保模型在后续生成中无需大量KV缓存。

方法详解

  • �� 在模型的部分层采用全注意力(Full-Attention)和局部注意力(Local-Attention)双流机制,收集暖身阶段的全局与局部注意输出。
  • �� 监测两者输出差异,形成残差信号,利用闭式最小二乘解计算线性调节系数∆W。
  • �� 在暖身结束后,将差异最大的K层转为局部注意力层,丢弃其KV缓存,利用调节后的W+∆W模拟长程历史。
  • �� 采用可分解注意力机制,利用硬件支持的Log-Sum-Exp状态,实时融合全局与局部注意力,避免额外计算。
  • �� 根据暖身阶段的重建误差动态选择哪些层进行参数吸收,确保不同场景下的适应性。
  • �� 通过调节参数和层选择,实现模型的动态结构弹性,支持多次调节以应对场景变化。

实验设计

在多种模型(1.3B至14B参数)和任务(文本到视频、语音到视频)上进行验证,使用VBench-Long和MovieGen数据集,评估压缩比例、视觉质量和推理速度。采用不同压缩比例(如50%)进行对比,验证模型在保持质量的同时显著降低内存消耗。还进行消融实验,分析暖身阶段的层选择和调节效果。

结果分析

最高压缩50%的KV缓存几乎无视觉质量损失(误差<1%),在长达30秒的视频生成中表现优异。压缩后峰值内存减少23.7GB,推理速度提升1.86倍。不同模型和指标(如美学、背景一致性)表现稳定,部分指标略有提升,显示参数吸收不仅节省空间,还改善了长时间生成的稳定性。

应用场景

该技术适用于长视频实时生成、虚拟主播、动画制作等场景,尤其在硬件资源有限的边缘设备上,能实现高质量长序列生成。通过模型参数的内在化,减少对大规模存储的依赖,提升生成效率和稳定性。

局限与展望

目前方法依赖暖身阶段的监测,场景剧烈变化时可能需要重新调节,存在一定的适应性限制。参数调节在不同模型和任务中需调优,泛化能力尚待验证。此外,参数吸收在极端长距离依赖场景中可能不足以完全替代全注意力,存在性能折中。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,平时需要用很多调料和工具来做出不同的菜肴。每次做饭时,你会用到很多调料瓶(就像模型中的KV缓存)来记住之前用过的调料,但这些瓶子会占用很多空间,特别是你要做很多不同菜肴时。现在,有个聪明的厨师发明了一个办法,他把常用的调料提前装到一个特殊的瓶子里(相当于模型参数中的吸收机制),这样你就不用每次都拿出所有瓶子,只需要用这个特殊的瓶子就能做出味道一样的菜。这就像论文中的参数吸收技术,把长远的记忆“装”到模型里,既节省空间,又保证菜的味道(视频质量)不变。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你需要记住很多以前的动作和策略(就像模型的长距离记忆)。如果每次都把所有的动作都记在脑袋里,脑袋会变得很重,反应也变慢。于是,你的哥哥告诉你一个秘密:你可以把一些重要的策略提前写在一本笔记里(模型参数),这样你以后就不用一直翻旧笔记了,只要看一眼笔记本就知道该怎么做。这就像论文里的参数吸收,把长时间积累的记忆变成了模型的“笔记”,让它既快又记得牢。这样,你在玩游戏时既能保持连贯,又不用担心记忆不够用,真是太酷了!

术语表

Key-Value Cache (KV缓存)

存储模型在生成过程中积累的历史信息,用于维护长序列的依赖关系。技术上是存储键值对的缓存机制。

在论文中,KV缓存随着生成时间线性增长,成为内存瓶颈。

Full-Attention (全注意力)

一种注意力机制,模型在每一层都对所有位置的Token进行全局交互,计算复杂度为O(F²)。

在模型中用于捕获长距离依赖,但计算成本高。

Local-Attention (局部注意力)

只关注邻近位置或有限范围内Token的注意力机制,降低计算复杂度。

在ISPA中用以替代全注意力,减少内存使用。

参数吸收 (Parametric Absorption)

将长距离历史信息通过线性调节参数内在化到模型权重中,避免存储大量KV Token。

论文创新点,将缓存压缩转为参数调节。

Decomposable Attention (可分解注意力)

利用硬件支持的Log-Sum-Exp状态,将全局注意力拆分为局部和历史两部分,实时融合。

实现无额外计算开销的全局信息采集。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端场景或剧烈变化的场景中,动态调节参数吸收的效果和稳定性仍需验证。
  • 2 模型在更大规模(百亿参数以上)或多模态长视频中的表现和适应性尚未充分研究。
  • 3 未来需探索多层次、多阶段的参数吸收策略,以应对更复杂的长程依赖需求。

应用场景

近期应用

长视频实时生成

在虚拟主播、动画制作中,利用参数吸收技术实现高质量长视频的快速生成,减少硬件资源依赖。

边缘设备视频处理

在硬件受限的设备上,通过模型参数内在化长程记忆,提升长序列生成的效率和稳定性。

远期愿景

普适长视频生成平台

结合参数吸收与硬件加速,打造面向大众的高效长视频生成平台,推动虚拟现实、增强现实等行业发展。

原文摘要

Autoregressive (AR) streaming models have emerged as a powerful paradigm for long video generation. However, the linearly growing Key-Value (KV) cache poses a significant bottleneck, leading to memory overload and degraded inference throughput. A common compression method is to drop redundant KV tokens, which often breaks long-range dependencies, resulting in temporal flickering and identity loss. In this paper, we propose Instance-Specific Parametric Absorption (ISPA), a novel framework that shifts the KV cache compression from discarding to distilling. The core idea is to transit a subset of layers from Full-Attention (F-Layers) to memory-efficient Local-Attention (L-Layers) by "absorbing" historical context into the model's weights. Specifically, during a brief warmup phase, ISPA monitors the output discrepancy between global and local attention. At the transition point, we solve a closed-form least-squares problem to compute an instance-specific weight modulation that compensates for the missing history. Experiments across architectures (1.3B to 14B) demonstrate that ISPA can remove up to 50\% of the KV cache with near-lossless visual quality. We hope this perspective encourages future work to explore parametric memory consolidation beyond external token-level cache management for streaming generative models.

cs.CV cs.MM