Asking and Answering Questions to Evaluate the Factual Consistency of Summaries
提出QAGS,通过问答检测摘要的事实一致性,显著优于ROUGE等指标。
Alex Wang, Kyunghyun Cho, Mike Lewis
提出QAGS,通过问答检测摘要的事实一致性,显著优于ROUGE等指标。
Alex Wang, Kyunghyun Cho, Mike Lewis
提出DynaBERT,结合自适应宽度与深度,训练包括知识蒸馏,性能与BERT-base相当,优于压缩方法。
Lu Hou, Zhiqi Huang, Lifeng Shang 等
提出衡量多样性指标的框架,通过人类与自动评估的对比验证其有效性,强调内容多样性评估的重要性。
Guy Tevet, Jonathan Berant
采用entmax训练采样,解决训练与测试不匹配问题,实现更高多样性和一致性。
Pedro Henrique Martins, Zita Marinho, André F. T. Martins
提出基于骨架语法的复杂问题语义解析方法SPARQA,显著提升长问句的解析准确率。
Yawei Sun, Lingling Zhang, Gong Cheng 等
SAC方法通过稀疏自适应连接加速自注意力,显著减少内存消耗。
Xiaoya Li, Yuxian Meng, Mingxin Zhou 等
本研究评估BERT和RoBERTa的校准性,采用温度缩放和标签平滑显著改善内外域校准。
Shrey Desai, Greg Durrett
PathVQA利用半自动化流程构建,包含4998图像和32799问答对,推动医学视觉问答研究。
Xuehai He, Yichen Zhang, Luntian Mou 等
本研究提出AraBERT,基于Transformer的阿拉伯语理解模型,显著提升多项NLP任务性能。
Wissam Antoun, Fady Baly, Hazem Hajj
本论文系统综述了BERT的内部机制,分析其语法、语义和世界知识的编码方式,探讨模型改进和压缩技术。
Anna Rogers, Olga Kovaleva, Anna Rumshisky
提出CodeBERT,结合Transformer架构,通过替换标记检测实现多模态预训练,提升NL-PL任务表现。
Zhangyin Feng, Daya Guo, Duyu Tang 等
ConvLab-2整合多模态对话模型,支持端到端评估与诊断,提升任务导向系统性能。
Qi Zhu, Zheng Zhang, Yan Fang 等
REALM结合检索器与预训练模型,显著提升开放域问答准确率(4-16%),实现可解释性与模块化。
Kelvin Guu, Kenton Lee, Zora Tung 等
本综述系统梳理知识图谱的表示学习、知识获取及应用,强调Transformer、GNN等新技术。
Shaoxiong Ji, Shirui Pan, Erik Cambria 等
提出mBART多语种去噪预训练,显著提升低资源MT性能,最高达12BLEU点。
Yinhan Liu, Jiatao Gu, Naman Goyal 等
提出LayoutLM,结合文本和布局信息的预训练模型,提升表单理解等任务性能。
Yiheng Xu, Minghao Li, Lei Cui 等
提出PEGASUS,利用提取空白句子作为预训练目标,显著提升摘要性能。
Jingqing Zhang, Yao Zhao, Mohammad Saleh 等
TutorialVQA数据集用于教程视频问答,包含6000个手动收集的三元组。
Anthony Colas, Seokhwan Kim, Franck Dernoncourt 等
通过自动生成高质量提示词(包括挖掘和释义方法)提升语言模型知识检索准确率,从31.1%提升至39.6%。
Zhengbao Jiang, Frank F. Xu, Jun Araki 等
提出SAMSum语料库,采用人工抽象对话摘要,模型在对话中的ROUGE得分高于新闻,但人工评判相反。
Bogdan Gliwa, Iwona Mochol, Maciej Biesek 等