COLD: A Benchmark for Chinese Offensive Language Detection
提出COLD基准,包含37,480句中文攻击性语料,开发COLDETECTOR实现81%准确率。
Jiawen Deng, Jingyan Zhou, Hao Sun 等
提出COLD基准,包含37,480句中文攻击性语料,开发COLDETECTOR实现81%准确率。
Jiawen Deng, Jingyan Zhou, Hao Sun 等
提出C2-CRS,利用粗到细对比学习融合多类型外部数据以提升对话推荐效果。
Yuanhang Zhou, Kun Zhou, Wayne Xin Zhao 等
提出AIS评估框架,利用两阶段标注验证NLG模型输出的可归因性,适用于多任务。
Hannah Rashkin, Vitaly Nikolaev, Matthew Lamm 等
引入QuALITY数据集,利用长文本(约5000词)进行多选问答,模型表现远低于人类。
Richard Yuanzhe Pang, Alicia Parrish, Nitish Joshi 等
提出Gopher模型(280B参数),采用Transformer架构,评估152任务,显著优于SOTA,特别在知识和理解方面。
Jack W. Rae, Sebastian Borgeaud, Trevor Cai 等
提出RETRO,通过检索亿级文本块提升语言模型性能,参数减少25倍。
Sebastian Borgeaud, Arthur Mensch, Jordan Hoffmann 等
本文研究大规模语言模型的对齐策略,重点比较提示、模仿学习、偏好建模的规模效应与样本效率。
Amanda Askell, Yuntao Bai, Anna Chen 等
XLS-R模型基于wav2vec 2.0,使用128种语言的语音数据进行跨语言表示学习。
Arun Babu, Changhan Wang, Andros Tjandra 等
使用Transformer架构的LayoutLM模型提升文档AI任务准确率。
Lei Cui, Yiheng Xu, Tengchao Lv 等
提出同时压缩与校正共现矩阵的EN和PALM方法,提升大词汇量主题推断的鲁棒性。
Moontae Lee, Sungjun Cho, Kun Dong 等
提出BBQ偏见基准,利用手工模板检测问答模型中的社会偏见,发现模型在信息不足时易依赖刻板印象。
Alicia Parrish, Angelica Chen, Nikita Nangia 等
P-Tuning v2通过深层连续提示实现参数效率,性能媲美微调,适用多模型规模与任务。
Xiao Liu, Kaixuan Ji, Yicheng Fu 等
提出基于蒸馏的紧凑多语种评估指标RemBERT,参数仅为原模型三分之一,性能达92.6%。
Amy Pu, Hyung Won Chung, Ankur P. Parikh 等
提出CKL框架,通过INVARIANTLAMA、UPDATEDLAMA、NEWLAMA衡量知识保持、更新与获取,采用参数扩展方法提升效果。
Joel Jang, Seonghyeon Ye, Sohee Yang 等
提出可控神经对话摘要框架,结合个人命名实体规划,提升摘要的多样性与一致性。
Zhengyuan Liu, Nancy F. Chen
提出NTRD框架,通过模板生成与槽填充实现推荐对话,显著优于SOTA,具零样本推荐能力。
Zujie Liang, Huang Hu, Can Xu 等
RnG-KBQA结合排序与生成,显著提升知识库问答的零-shot和泛化能力。
Xi Ye, Semih Yavuz, Kazuma Hashimoto 等
本研究通过追踪神经语言模型(NLM)在不同训练阶段的表现,发现其学习语言现象具有一致的“发展”轨迹,揭示潜在的归纳偏差。
Leshem Choshen, Guy Hacohen, Daphna Weinshall 等
本研究分析Transformer在神经机器翻译中的注意力权重,发现其对词对齐存在偏差,但能解释模型预测。
Javier Ferrando, Marta R. Costa-jussà
PICARD通过增量解析限制预训练语言模型的自动回归解码,有效提升SQL生成的正确率。
Torsten Scholak, Nathan Schucher, Dzmitry Bahdanau