Carbon Emissions and Large Neural Network Training
本研究评估了T5、Meena、GShard、Switch Transformer和GPT-3等大规模模型的能耗与碳足迹,提出优化策略。
David Patterson, Joseph Gonzalez, Quoc Le 等
本研究评估了T5、Meena、GShard、Switch Transformer和GPT-3等大规模模型的能耗与碳足迹,提出优化策略。
David Patterson, Joseph Gonzalez, Quoc Le 等
引入Waymo开放运动数据集,支持多目标交互运动预测,含570小时高质量标注。
Scott Ettinger, Shuyang Cheng, Benjamin Caine 等
UNISURF结合隐式表面与辐射场,实现无掩码高质量多视角重建。
Michael Oechsle, Songyou Peng, Andreas Geiger
提出两种TSE变体EW和MW,分别衡量模型的系统性和行为倾向,揭示模型在语法一致性上的不足。
Benjamin Newman, Kai-Siang Ang, Julia Gong 等
提出适用于任意矩阵群的等变多层感知机(EMLP)算法,解决复杂群的层构建问题。
Marc Finzi, Max Welling, Andrew Gordon Wilson
提出TransFuser,通过注意力机制融合图像与LiDAR信息,提升自动驾驶性能,Collision减少76%。
Aditya Prakash, Kashyap Chitta, Andreas Geiger
提出LATTICE模型,通过多模态内容挖掘潜在物品关系,提升推荐准确率。
Jinghao Zhang, Yanqiao Zhu, Qiang Liu 等
提出基于动作感知的运动规划与控制系统,实现人形机器人空中翻转等高动态行为。
Matthew Chignoli, Donghyun Kim, Elijah Stanger-Jones 等
使用对比损失和马氏距离检测预训练Transformer的分布外数据,性能接近完美。
Wenxuan Zhou, Fangyu Liu, Muhao Chen
使用约束语言模型实现少样本语义解析,显著超越基线。
Richard Shin, Christopher H. Lin, Sam Thomson 等
提出CLIPScore,无需参考图像描述即可自动评估,最高相关性达74%。
Jack Hessel, Ari Holtzman, Maxwell Forbes 等
提出知识神经元概念,通过知识归因识别存储事实的神经元,验证其对知识表达的正相关性,能在无需微调的情况下编辑特定知识。
Damai Dai, Li Dong, Yaru Hao 等
引入领域条件点互信息,解决表面形式竞争问题,提高零样本任务准确率。
Ari Holtzman, Peter West, Vered Shwartz 等
提出Condenser架构,通过预训练条件化密集表示,显著提升文本检索性能。
Luyu Gao, Jamie Callan
提出ZeRO-Infinity,通过GPU、CPU和NVMe内存突破极限支持数十至百兆参数模型,无需模型重构。
Samyam Rajbhandari, Olatunji Ruwase, Jeff Rasley 等
SR3通过迭代去噪实现图像超分辨率,在CelebA-HQ 8倍放大任务中达50%欺骗率。
Chitwan Saharia, Jonathan Ho, William Chan 等
采用检索增强架构显著降低对话中的知识虚构,最佳模型在两个知识驱动任务中超越SOTA,减少虚假回答60%以上。
Kurt Shuster, Spencer Poff, Moya Chen 等
利用源端和目标端的上下文建模(包括共指解析和多跳推理)显著提升对已验证事实声明的检测,超越SOTA十余分。
Shaden Shaar, Firoj Alam, Giovanni Da San Martino 等
SummScreen数据集用于抽象剧本摘要,挑战性强,包含对话和情节细节。
Mingda Chen, Zewei Chu, Sam Wiseman 等
提出GridToPix,利用格子世界训练终点奖励策略,显著提升Embodied AI任务表现。
Unnat Jain, Iou-Jen Liu, Svetlana Lazebnik 等