LongNet: Scaling Transformers to 1,000,000,000 Tokens
提出LongNet,采用扩张注意力实现超10亿Token序列建模,复杂度线性。
Jiayu Ding, Shuming Ma, Li Dong 等
提出LongNet,采用扩张注意力实现超10亿Token序列建模,复杂度线性。
Jiayu Ding, Shuming Ma, Li Dong 等
本文评估两种测量大模型信念的方法,发现均无法有效泛化,提出信念存在的哲学与实证争议。
B. A. Levinstein, Daniel A. Herrmann
本文提出一种量化评估语言模型对全球主观观点代表性的框架,基于GlobalOpinionQA数据集,分析模型偏向性和文化刻板印象。
Esin Durmus, Karina Nguyen, Thomas I. Liao 等
提出位置插值(PI)方法,将RoPE编码的LLaMA模型上下文扩展至32768,仅需1000步微调,显著提升长文本处理能力。
Shouyuan Chen, Sherman Wong, Liangjian Chen 等
InterCode:通过执行反馈标准化和基准化交互式编码,提升代码生成能力。
John Yang, Akshara Prabhakar, Karthik Narasimhan 等
KOSMOS-2为多模态大语言模型,具备对象定位和文本地面能力,显著提升视觉-语言任务表现。
Zhiliang Peng, Wenhui Wang, Li Dong 等
ToolQA通过自动化流程评估LLMs在外部工具使用中的能力,涵盖8个领域,实验显示增强模型显著优于纯内在知识模型。
Yuchen Zhuang, Yue Yu, Kuan Wang 等
提出黑盒LLM置信度估计框架,结合提示、采样与聚合,提升校准与失败预测性能。
Miao Xiong, Zhiyuan Hu, Xinyang Lu 等
LMFlow是一个轻量级工具包,支持大模型的高效微调和推理。
Shizhe Diao, Rui Pan, Hanze Dong 等
Wanda通过输入激活与权重乘积实现无训练剪枝,显著优于传统幅值剪枝。
Mingjie Sun, Zhuang Liu, Anna Bair 等
Block-State Transformer结合SSM和Block Transformer,提升语言建模性能和速度。
Mahan Fathi, Jonathan Pilault, Orhan Firat 等
MiniLLM以反向KLD和在策略蒸馏训练小模型;LLaMA-7B在SelfInst达73.1 GPT-4分、23.2 Rouge-L。
Yuxian Gu, Li Dong, Furu Wei 等
提出三类框架融合大规模语言模型与知识图谱,提升知识理解与推理能力。
Shirui Pan, Linhao Luo, Yufei Wang 等
WebGLM结合GLM和网络搜索,提升问答系统效率,10B参数模型优于13B WebGPT。
Xiao Liu, Hanyu Lai, Hao Yu 等
Mind2Web是首个涵盖137个真实网站、2000余任务的多域数据集,利用小型和大型语言模型实现网页任务执行。
Xiang Deng, Yu Gu, Boyuan Zheng 等
PandaLM为LLM指令调优设计的自动评估基准,结合多维主观指标,达成93.75% GPT-3.5评估能力。
Yidong Wang, Zhuohao Yu, Zhengran Zeng 等
CMExam是首个提供全面医学标注的中文医学考试数据集,GPT-4在该数据集上达到61.6%的准确率。
Junling Liu, Peilin Zhou, Yining Hua 等
Whisper在多种阿拉伯语条件下的表现优于XLS-R,但在未见方言中表现下降。
Bashar Talafha, Abdul Waheed, Muhammad Abdul-Mageed
Video-LLaMA通过视频Q-former和音频Q-former实现音视频理解。
Hang Zhang, Xin Li, Lidong Bing
提出细粒度人类反馈(Fine-Grained RLHF),通过每段生成后奖励和多类别模型提升语言模型训练效果。
Zeqiu Wu, Yushi Hu, Weijia Shi 等