Training language models to follow instructions with human feedback
通过人类反馈微调GPT-3,显著提升其遵循指令、真实性和安全性,参数从175B降至1.3B。
Long Ouyang, Jeff Wu, Xu Jiang 等
通过人类反馈微调GPT-3,显著提升其遵循指令、真实性和安全性,参数从175B降至1.3B。
Long Ouyang, Jeff Wu, Xu Jiang 等
SyFES框架自动构建符号密度泛函,GAS22在MGCDB84测试集上表现优越。
He Ma, Arunachalam Narayanaswamy, Patrick Riley 等
ACCEL方法通过编辑关卡不断提高复杂度,显著提升RL代理的能力。
Jack Parker-Holder, Minqi Jiang, Michael Dennis 等
利用GFlowNets进行生物序列设计,结合不确定性估计实现多样性优化。
Moksh Jain, Emmanuel Bengio, Alex-Hernandez Garcia 等
提出DeepNorm稳定极深Transformer,成功扩展至1000层,提升多语翻译性能。
Hongyu Wang, Shuming Ma, Li Dong 等
提出抽象理论,强调保持近优行为、效率学习与降低规划时间。
David Abel
提出非交换性条件下的加权分位数方法,增强预测区间的鲁棒性。
Rina Foygel Barber, Emmanuel J. Candes, Aaditya Ramdas 等
提出可训练的子图检索器(SR),提升多跳知识库问答的检索与推理性能。
Jing Zhang, Xiaokang Zhang, Jifan Yu 等
本研究揭示在上下文学习中,演示样本的正确标签并非关键,模型依赖于示例的格式和分布。
Sewon Min, Xinxi Lyu, Ari Holtzman 等
提出BagPipe系统,通过缓存与预取优化推荐模型训练中的嵌入访问,提升至5.6倍速度。
Saurabh Agarwal, Chengpo Yan, Ziyi Zhang 等
提出一种基于核函数的贝叶斯积分误差上界,适用于噪声和随机采样,特别关注Matérn和SE核。
Xu Cai, Chi Thanh Lam, Jonathan Scarlett
提出SSCD,自监督对比学习模型,用于图像复制检测,显著优于基线和SOTA方法。
Ed Pizzi, Sreya Dutta Roy, Sugosh Nagavara Ravindra 等
本研究发现微调可能扭曲预训练特征,导致在分布外数据表现不佳,提出线性探测后微调(LP-FT)策略改善效果。
Ananya Kumar, Aditi Raghunathan, Robbie Jones 等
提出合并阶梯性质(MSP)作为深度2神经网络SGD学习稀疏函数的必要且近似充分条件。
Emmanuel Abbe, Enric Boix-Adsera, Theodor Misiakiewicz
提出前向梯度方法,利用前向自动微分实现梯度估计,避免反向传播,训练速度提升至原来的两倍。
Atılım Güneş Baydin, Barak A. Pearlmutter, Don Syme 等
提出连续条件GAN(CC-GAN)生成高质量多样化点云,控制尺寸并改善少样本区域表现。
Larissa T. Triess, Andre Bühler, David Peter 等
Ditto用交互前后点云重建关节物体,Shape2Motion整体Chamfer距离0.72。
Zhenyu Jiang, Cheng-Chun Hsu, Yuke Zhu
使用强化学习和行为克隆的计算机控制方法,在MiniWob++基准上达到人类水平。
Peter C Humphreys, David Raposo, Toby Pohlen 等
研究揭示大型生成模型的可预测性与意外性,探讨社会影响。
Deep Ganguli, Danny Hernandez, Liane Lovitt 等
本研究通过构建对数线性关系,量化大规模语言模型的记忆程度,发现模型容量、重复频次和上下文长度显著影响记忆泄露。
Nicholas Carlini, Daphne Ippolito, Matthew Jagielski 等