Training-Free Universal Approximation by Prompting Random Transformers

TL;DR

本研究展示随机变换器通过软提示实现泛化逼近,无需训练,结合核方法提供理论保证。

cs.LG 🔴 高级 2026-08-10 44 次浏览
Alexander Hsu Rongjie Lai
变换器 泛化能力 核方法 提示工程 无训练学习

核心发现

方法论

作者利用注意力机制与核方法的联系,构建软提示,使随机未训练的单层softmax注意力网络模拟Nadaraya-Watson核估计器。通过线性系统求解软提示,满足特定秩条件,几乎必然由高斯初始化满足。该方法在逼近 Hölder 函数时,继承核回归的理论保证,获得最小最大速率,依赖于数据的固有维度。研究还分析了软提示范数、长度与隐藏层维度的关系。

关键结果

  • 证明单层随机注意力网络在满足轻微秩条件下,可以通过软提示逼近任意支持点的核估计器,误差随提示长度线性缩减,逼近速率达到最优的统计极限。
  • 几乎必然由高斯初始化满足秩条件,随机网络在高维空间中具有良好的逼近能力,且软提示范数在不同设定下表现出明显的规模差异。
  • 推导出基于核回归的泛化界限,误差率达到 \~O(n^{-2α/(2α+d_X)}),其中α为 Hölder 指数,d_X为数据的固有维度,验证了提示引导的泛化能力。

研究意义

该研究突破了变换器预训练依赖的传统观念,表明随机未训练模型在特定提示引导下具有强大的逼近能力,为无训练学习提供理论基础。其结合核方法的分析框架,为理解变换器的表达能力提供了新视角,有助推动提示工程和模型泛化理论的发展,具有深远的学术和应用价值。

技术贡献

提出以随机变换器模拟核回归的构造性方法,建立软提示与核函数的对应关系,推导出泛化误差的最优速率。首次在无训练条件下,通过线性系统求解软提示,实现对 Hölder 函数的逼近,结合随机矩阵理论保证秩条件几乎必然成立,拓宽了变换器表达能力的理论边界。

新颖性

首次系统性证明随机未训练变换器在软提示引导下实现泛化逼近,结合核方法提供严格的理论保证,区别于以往依赖训练优化的研究,强调提示在模型表达中的核心作用,开启了无训练学习的新路径。

局限性

  • 该方法依赖特定的随机初始化分布(高斯),在实际训练中可能受到参数初始化的影响,泛化到其他初始化分布仍需验证。
  • 模型结构较为简单,仅考虑单层注意力网络,复杂多层变换器的逼近能力尚未充分分析。
  • 提示构造过程依赖线性系统求解,实际应用中可能面临数值稳定性和规模扩展的问题。

未来方向

未来将探索多层变换器的逼近能力,研究不同初始化分布的影响,以及提示生成的自动化方法。同时,结合实际任务,验证提示引导的泛化性能在自然语言处理和图像任务中的应用潜力,推动无训练学习的理论与实践结合。

AI 总览摘要

随着大规模变换器模型在自然语言处理中的广泛应用,预训练成本的高昂促使研究者探索无需训练的模型逼近能力。本文提出一种创新思路,利用随机未训练的单层softmax注意力网络,通过设计软提示实现对 Hölder 函数的泛化逼近。该方法基于注意力机制与核方法的深刻联系,将软提示作为线性系统的解,满足特定秩条件,从而使模型模拟经典的Nadaraya-Watson核估计器。研究证明,几乎所有高斯初始化的随机参数都满足条件,确保逼近的普适性。通过理论推导,获得最优的逼近速率,依赖于数据的固有维度,验证了提示引导的模型在统计学意义上的最优性。实验结果显示,软提示范数、长度与隐藏层维度之间存在明显的规模关系,验证了理论预测。此研究突破了传统对预训练模型的依赖,为无训练学习提供了坚实的理论基础,开启了变换器表达能力的新视角。未来的研究将聚焦多层变换器的逼近能力、提示自动生成以及在实际任务中的应用潜力,推动提示工程和模型泛化的深度发展。

深度分析

研究背景

近年来,变换器架构在自然语言处理和其他领域取得巨大成功,尤其是在大规模预训练模型(如GPT、BERT)中表现突出。然而,预训练的高昂成本促使学界关注无训练学习的可能性。早期研究如Cybenko(1989)和Hornik(1991)证明了神经网络的泛化逼近能力,随后,Yun等(2020)首次展示变换器的泛化能力。提示工程作为一种轻量级的模型调节方式,逐渐成为研究热点,但其理论基础仍不充分。近年来,随机参数和未训练模型的研究逐步兴起,诸如Reservoir Computing和随机特征方法,为理解模型表达提供了新思路。

核心问题

核心问题在于:在未训练的随机变换器中,如何通过设计软提示实现对任意目标函数的泛化逼近?传统方法依赖训练优化,成本高昂且缺乏理论保证。现有研究多关注训练后模型的表达能力,缺乏对未训练随机模型的系统分析。如何利用随机参数的固有性质,结合提示机制,达到类似训练模型的逼近效果,是亟待解决的难题。这不仅关系到模型的效率,也影响其在实际应用中的可扩展性。

核心创新

本研究的创新点主要包括:1)提出利用随机未训练变换器模拟核回归的构造性方法,2)通过线性系统求解软提示,实现对支持点的核估计器的逼近,3)结合随机矩阵理论,保证秩条件几乎必然满足,4)推导出最优的逼近速率,依赖数据的固有维度。这些创新突破了传统依赖训练的限制,为无训练学习提供了坚实的理论基础,拓展了变换器的表达边界。

方法详解

  • �� 设计单层softmax注意力网络,固定嵌入和解码层,随机初始化参数满足特定秩条件。• 构造软提示作为线性系统的最小范数解,使注意力 logits 与高斯核指数匹配。• 通过logit偏移抑制自注意力中的自环项,确保逼近核估计器的形式。• 利用核回归的理论,分析逼近误差,推导出最优收敛速率。• 证明随机高斯初始化几乎满足秩条件,确保泛化能力。• 计算软提示范数与提示长度、隐藏层维度的关系,分析模型复杂度。• 最终,结合理论和数值实验验证模型的逼近能力和速率。

实验设计

作者在合成数据集和标准函数逼近任务中验证了理论结果。通过不同提示长度和隐藏层维度,观察误差随样本数变化的趋势。比较不同初始化条件和偏移参数对逼近效果的影响。采用 Hölder 函数作为目标,测量模型在噪声环境下的逼近误差,验证最优速率。还进行了消融实验,分析软提示范数与模型性能的关系,验证理论预测的规模关系。整体设计确保结果的稳健性和普适性。

结果分析

实验证明,软提示能有效逼近支持点的核估计器,误差随提示长度线性减小,逼近速率达到 \~O(n^{-2α/(2α+d_X)}),与理论一致。随机高斯参数几乎满足秩条件,模型在高维空间表现出良好的逼近能力。软提示范数在不同设定下表现出明显的规模差异,验证了理论中的范数增长关系。整体结果支持随机未训练变换器在无训练条件下实现泛化逼近的可能性。

应用场景

该方法可应用于低成本模型调节、快速适应新任务、少样本学习等场景。特别适合资源有限的环境,或需要快速部署的应用中。未来,结合自然语言处理、图像识别等领域,推动无训练学习的实际落地,降低模型训练成本,提升模型的泛化能力。

局限与展望

方法依赖高斯初始化,实际中可能受参数分布影响。模型结构较为简单,尚未扩展到多层复杂变换器。提示构造过程受线性系统求解限制,数值稳定性需考虑。未来需验证在真实任务中的效果,优化提示生成策略。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,准备一道新菜。传统方法是先学习所有食材和技巧(训练),然后才能做出美味。而这项研究像是只用一些随机的厨具(随机变换器),不用提前学习,只要给出一些特别的提示(软提示),就能做出几乎任何菜。这些提示像是调料,告诉厨具该怎么“操作”,让它模仿各种菜谱(函数)。通过巧妙设计这些调料(线性系统求解软提示),厨房里的厨具就能变成多功能厨师,做出复杂菜肴。这就像用魔法一样,不用事先学会所有技巧,只要提示得当,就能做出各种美味。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,平常你需要花很多时间学习每个拼图块怎么拼,才能拼出完整的图像。但如果你有一个神奇的提示(软提示),只要告诉它你想拼什么,它就能帮你快速拼出图片!这就像给拼图游戏加了个魔法提示,让没有事先学习的拼图也能拼出漂亮的图案。研究发现,只要用对提示,即使没有提前训练,随机的拼图块也能拼出各种复杂的图像。这就像你用魔法提示变成了拼图高手,不用花时间学习每个拼图块的拼法,就能拼出想要的图案!

原文摘要

How expressive is prompting a transformer? Answering this question is important for separating the roles of prompting, architecture, and pretraining in transformer models, and for determining whether task-specific behavior must be stored in model weights or can instead be induced at inference time through the prompt. We show, in an approximation-theoretic sense, that pretraining is optional: a single-layer softmax attention network with random, untrained weights can approximate any Hölder function on a compact manifold when steered by an appropriate soft prompt. Guided by the connection between softmax attention and kernel methods, we construct explicit soft prompts (a prompt per target function, independent of the query) as solutions to linear systems matching attention logits to Gaussian kernel exponents, under which the frozen transformer emulates the classical Nadaraya-Watson kernel estimator. The construction requires only a mild rank condition on the weights, which we show holds almost surely under Gaussian initialization. The prompted network inherits the theoretical guarantees of kernel regression, leading to universal approximation theorems with minimax-optimal rates that depend on the intrinsic dimension. We further quantify the cost of prompting, exposing a tradeoff between the norm of the constructed soft prompt tokens, prompt length, and hidden dimension. Numerical experiments corroborate the constructions and predicted rates.

cs.LG math.NA math.ST