排序: 最新 热门 引用
cs.CL 2202.05262

Locating and Editing Factual Associations in GPT

提出基于因果干预的神经元激活定位与模型编辑(ROME),验证中间层MLP存储事实关联,效果优于传统方法。

Kevin Meng, David Bau, Alex Andonian 等

2022-02-11 31
cs.LG 2202.03376

Message Passing Neural PDE Solvers

MP-PDE以消息传递统一经典数值格式,并用推前训练提升长时稳定性。

Johannes Brandstetter, Daniel Worrall, Max Welling

2022-02-08 25
cs.CL 2202.03286

Red Teaming Language Models with Language Models

利用语言模型自动生成测试用例,检测280B参数聊天机器人中的有害回复,采用多方法提升检测效果。

Ethan Perez, Saffron Huang, Francis Song 等

2022-02-07 22