Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions
构建JAMA Clinical Challenge和Medbullets数据集,评估7个LLM在复杂医学问答上的表现。
Hanjie Chen, Zhouxiang Fang, Yash Singla 等
构建JAMA Clinical Challenge和Medbullets数据集,评估7个LLM在复杂医学问答上的表现。
Hanjie Chen, Zhouxiang Fang, Yash Singla 等
BitNet b1.58通过三值量化实现1.58位LLM,性能媲美FP16,成本显著降低。
Shuming Ma, Hongyu Wang, Lingxiao Ma 等
本研究提出大规模语言模型的持续预训练新基准,验证模型在不同规模和域迁移中的表现。
Çağatay Yıldız, Nishaanth Kanna Ravichandran, Nitin Sharma 等
本文系统综述了语言模型数据选择方法,强调分布匹配与多样性,提出统一框架,涵盖预训练、微调等阶段。
Alon Albalak, Yanai Elazar, Sang Michael Xie 等
提出时间对齐方法,通过微调和提示提升LLaMa2模型2022年知识利用率,性能提升达62%。
Bowen Zhao, Zander Brumbaugh, Yizhong Wang 等
SelectIT利用LLM内在不确定性进行指令微调数据筛选,提升模型性能。
Liangxin Liu, Xuebo Liu, Derek F. Wong 等
本研究系统评估大规模语言模型(如GPT、BERT)在多领域的应用潜力,特别关注健康、城市规划、气候与灾害管理。
Pravneet Kaur, Gautam Siddharth Kashyap, Ankit Kumar 等
提出CDD检测模型输出分布峰值,识别大模型数据污染,提升检测准确率21.8%-30.2%。
Yihong Dong, Xue Jiang, Huanyu Liu 等
提出tinyBenchmarks,通过少量示例(100个)高效估算LLMs在MMLU等基准上的性能,误差低于2%。
Felipe Maia Polo, Lucas Weber, Leshem Choshen 等
CriticBench评估大型语言模型在推理批评与修正中的性能,涵盖五大领域,17模型实验显示线性关系与模型规模影响。
Zicheng Lin, Zhibin Gou, Tian Liang 等
LLMBind框架通过双路径机制实现多模态任务整合,性能优异,扩展性强。
Bin Zhu, Munan Ning, Peng Jin 等
提出OlympiadBench,涵盖8,476个奥赛级双语多模科学题,评估GPT-4V等模型的高阶推理能力。
Chaoqun He, Renjie Luo, Yuzhuo Bai 等
本研究提出基于GPT-4的自动数据标注框架,涵盖生成、评估与应用,显著提升标注效率。
Zhen Tan, Dawei Li, Song Wang 等
提出MIRAGE基准和MedRAG工具包,提升GPT-3.5准确率至71.57%,接近GPT-4水平。
Guangzhi Xiong, Qiao Jin, Zhiyong Lu 等
提出重启增量Transformer分析方法,揭示其在局部歧义处理中的状态更新机制。
Brielen Madureira, Patrick Kahardipraja, David Schlangen
本研究提出FLenQA数据集,分析输入长度对大模型推理性能的影响,发现性能在远低于最大长度时显著下降。
Mosh Levy, Alon Jacoby, Yoav Goldberg
通过消除多跳事实捷径的神经元,大幅降低知识编辑失败率,提升多跳推理可靠性。
Tianjie Ju, Yijin Chen, Xinwei Yuan 等
ALLaVA利用GPT4V合成高质量数据,训练轻量级视觉-语言模型达性能接近大型模型。
Guiming Hardy Chen, Shunian Chen, Ruifei Zhang 等
BitDistiller通过自蒸馏提升亚4位LLM性能,显著减少数据和训练资源需求。
Dayou Du, Yijia Zhang, Shijie Cao 等
提出基于持续预训练的数据工程策略,将语言模型的上下文长度扩展至128K,关键在于数据量和多样性平衡。
Yao Fu, Rameswar Panda, Xinyao Niu 等