Mass-Editing Memory in a Transformer
MEMIT通过多层关联记忆更新,在GPT-J上一次编辑1万条事实,编辑分数达50.7。
Kevin Meng, Arnab Sen Sharma, Alex Andonian 等
MEMIT通过多层关联记忆更新,在GPT-J上一次编辑1万条事实,编辑分数达50.7。
Kevin Meng, Arnab Sen Sharma, Alex Andonian 等
PDEBENCH基准涵盖11类PDE,结合FNO、U-Net、PINN等模型,提供多维评价指标。
Makoto Takamoto, Timothy Praditia, Raphael Leiteritz 等
提出Subequivariant Graph Neural Network,提升物理动态预测准确率3%以上。
Jiaqi Han, Wenbing Huang, Hengbo Ma 等
本研究探讨大规模语言模型(GPT-3)在少样本表格推理中的能力,结合链式思维提示实现显著性能提升。
Wenhu Chen
提出离散时间动力学平均场理论(DMFT)解析高维梯度算法,涵盖SGD、动量和Langevin,推导精确渐近公式。
Cedric Gerbelot, Emanuele Troiani, Francesca Mignacco 等
RankT5通过排名损失微调T5模型,在MS MARCO数据集上提升了1.8%的排名性能。
Honglei Zhuang, Zhen Qin, Rolf Jagerman 等
CTL++基于符号函数组合测试神经网络的系统性泛化能力,结果显示Transformer模型在复杂组合任务中表现不足。
Róbert Csordás, Kazuki Irie, Jürgen Schmidhuber
ERNIE-Layout通过布局知识增强预训练,在文档理解任务上取得了显著提升。
Qiming Peng, Yinxu Pan, Wenjin Wang 等
利用对称性分析,证明过参数化可将伪局部极小转变为鞍点,增强梯度优化效果。
Yossi Arjevani, Michael Field
RING++利用旋转平移不变特征实现稀疏激光点云的全局定位,保证旋转平移的全局收敛。
Xuecheng Xu, Sha Lu, Jun Wu 等
基于172篇文献,提出五类社会技术危害分类体系,助于系统识别算法系统潜在危害。
Renee Shelby, Shalaleh Rismani, Kathryn Henne 等
VLMaps融合预训练视觉-语言特征与3D重建,实现空间精确的自然语言导航。
Chenguang Huang, Oier Mees, Andy Zeng 等
利用神经切线核(NTK)分析对抗样本,揭示鲁棒性与特征关系。
Nikolaos Tsilivis, Julia Kempe
提出MAP模型,通过概率分布编码实现多模态不确定性建模,提升多任务性能。
Yatai Ji, Junjie Wang, Yuan Gong 等
基于因果模型的定性 harm 定义,利用对比因果和默认效用解决 harm 复杂例子。
Sander Beckers, Hana Chockler, Joseph Y. Halpern
本研究比较Transformer在存储在权重与上下文中的信息的泛化差异,发现预训练模型更偏向规则性泛化。
Stephanie C. Y. Chan, Ishita Dasgupta, Junkyung Kim 等
PTR以CQL预训练Bridge Dataset,在真实WidowX机器人上用10–15条示范学习新任务。
Aviral Kumar, Anikait Singh, Frederik Ebert 等
提出Mask-adapted CLIP,通过掩码区域微调提升开放词汇语义分割性能,达成29.6% mIoU。
Feng Liang, Bichen Wu, Xiaoliang Dai 等
TEG-Track结合触觉与视觉,提升未见物体的6D姿态跟踪精度,旋转误差降低30.9%。
Yun Liu, Xiaomeng Xu, Weihang Chen 等
提出端到端训练的联合模型,结合可微分DPR与生成,显著提升OK-VQA性能。
Weizhe Lin, Bill Byrne