Quick and (not so) Dirty: Unsupervised Selection of Justification Sentences for Multi-hop Question Answering
提出ROCC方法,提升多跳问答准确率,ARC数据集上F1达到56.82%。
Vikas Yadav, Steven Bethard, Mihai Surdeanu
提出ROCC方法,提升多跳问答准确率,ARC数据集上F1达到56.82%。
Vikas Yadav, Steven Bethard, Mihai Surdeanu
BP-Transformer通过二分法实现长文本的高效注意力机制,提升文本分类和翻译性能。
Zihao Ye, Qipeng Guo, Quan Gan 等
提出基于跨度选择的多句论证链接模型,利用RAMS数据集实现68.3%的F1,提升跨句事件论元识别。
Seth Ebner, Patrick Xia, Ryan Culkin 等
TechQA数据集通过IBM技术论坛问题和Technote答案,促进领域适应研究。
Vittorio Castelli, Rishav Chakravarti, Saswati Dana 等
利用BERT模型对1750个隐私政策问答数据集进行问答性能评估,F1达62.6%。
Abhilasha Ravichander, Alan W Black, Shomir Wilson 等
基于Transformer的DialoGPT,训练于1.47亿Reddit对话,达近人类水平。
Yizhe Zhang, Siqi Sun, Michel Galley 等
提出CCNet管道,从Common Crawl中自动提取高质量单语语料,涵盖174种语言。
Guillaume Wenzek, Marie-Anne Lachaux, Alexis Conneau 等
BART结合双向编码器与自回归解码器,通过噪声重建实现多任务预训练,显著提升文本生成与理解性能。
Mike Lewis, Yinhan Liu, Naman Goyal 等
提出了一种基于BERT的弱监督方法,显著提高了摘要的事实一致性检测准确率。
Wojciech Kryściński, Bryan McCann, Caiming Xiong 等
MLQA构建多语种对齐的提取式问答基准,涵盖7种语言,推动跨语问答研究。
Patrick Lewis, Barlas Oğuz, Ruty Rinott 等
提出DistilBERT,通过知识蒸馏减40%参数,性能达97%,推理快60%。
Victor Sanh, Lysandre Debut, Julien Chaumond 等
提出一种基于模型并行的Megatron-LM,训练规模达8.3亿参数,实现76%线性扩展效率。
Mohammad Shoeybi, Mostofa Patwary, Raul Puri 等
提出基于语义相似度的奖励函数SIMILE,改善神经机器翻译训练效果。
John Wieting, Taylor Berg-Kirkpatrick, Kevin Gimpel 等
使用BERT进行序列句子分类,取得四个数据集的最佳结果。
Arman Cohan, Iz Beltagy, Daniel King 等
将推荐视为合作对话游戏,采用自监督的Bot-Play训练策略,显著提升目标导向推荐性能。
Dongyeop Kang, Anusha Balakrishnan, Pararth Shah 等
提出控制任务评估探针的选择性,验证ELMo层级中第二层更具代表性。
John Hewitt, Percy Liang
MoverScore结合上下文嵌入和地球移动距离,实现高语义相关性评价。
Wei Zhao, Maxime Peyrard, Fei Liu 等
提出TabFact数据集,结合Table-BERT与LPA模型实现表格事实验证,准确率达65%,仍远低于人类。
Wenhu Chen, Hongmin Wang, Jianshu Chen 等
本研究分析预训练语言模型(如BERT)在无微调情况下存储的关系知识,显示其在知识检索和问答中的潜力。
Fabio Petroni, Tim Rocktäschel, Patrick Lewis 等
通过几何分析BERT、ELMo、GPT-2的上下文表示,发现其代表性有限,且层级越高越具上下文特异性。
Kawin Ethayarajh