排序: 最新 热门 引用
cs.CL 2005.14165

Language Models are Few-Shot Learners

通过扩展至1750亿参数的GPT-3实现零-shot、少-shot学习,显著提升任务泛化能力。

Tom B. Brown, Benjamin Mann, Nick Ryder 等

2020-05-29 35
cs.CL 2004.05150

Longformer: The Long-Document Transformer

提出Longformer,采用线性扩展的注意力机制,处理长文档达数千Token,显著优于BERT及RoBERTa。

Iz Beltagy, Matthew E. Peters, Arman Cohan

2020-04-11 35