排序: 最新 热门 引用
cs.CL 2203.15556

Training Compute-Optimal Large Language Models

本研究提出训练计算最优的大型语言模型方法,发现模型规模与训练数据应同步扩展,成功训练出70B参数的Chinchilla模型。

Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch 等

2022-03-29 24
cs.CV 2203.12119

Visual Prompt Tuning

本研究提出视觉提示调优(VPT),在保持预训练Transformer模型参数不变的情况下,仅引入不到1%的输入空间可训练参数,显著提升多任务视觉识别性能,超越全参数微调。

Menglin Jia, Luming Tang, Bor-Chun Chen 等

2022-03-23 2841 引用 41