GPT4GEO: How a Language Model Sees the World's Geography
本研究评估GPT-4在地理知识上的表现,涵盖位置、距离、地形等任务。
Jonathan Roberts, Timo Lüddecke, Sowmen Das 等
本研究评估GPT-4在地理知识上的表现,涵盖位置、距离、地形等任务。
Jonathan Roberts, Timo Lüddecke, Sowmen Das 等
本研究评估LFQA的人工与自动评价,发现无单一指标能准确预测人类偏好。
Fangyuan Xu, Yixiao Song, Mohit Iyyer 等
本研究提出Marked Personas方法,利用自然语言提示无监督测量大模型中的交叉性刻板印象,分析GPT-3.5和GPT-4生成的偏见。
Myra Cheng, Esin Durmus, Dan Jurafsky
提出基于最近邻检索的测试时微调方法,显著提升20+任务性能。
Moritz Hardt, Yu Sun
通过校准框架解决大语言模型评估中的位置偏差,提升与人工一致性达14.3%。
Peiyi Wang, Lei Li, Liang Chen 等
LLM-QAT通过无数据蒸馏实现4-bit量化,提升大语言模型性能。
Zechun Liu, Barlas Oguz, Changsheng Zhao 等
提出Iter-RetGen,通过迭代检索与生成提升多任务问答表现,优于或匹配SOTA。
Zhihong Shao, Yeyun Gong, Yelong Shen 等
提出JEEBench,基于深度领域知识的复杂数学物理化学题,GPT-4表现不足40%。
Daman Arora, Himanshu Gaurav Singh, Mausam
提出RoHT框架,通过层级问句分解树实现异构知识整合,显著优于SOTA。
Jiajie Zhang, Shulin Cao, Tingjia Zhang 等
本研究评估了BERT模型蒸馏中的不同目标函数及初始化层次,发现注意力迁移表现最优,低层初始化显著提升任务性能。
Xinpeng Wang, Leonie Weissweiler, Hinrich Schütze 等
大语言模型在情感分析中表现良好,但在复杂任务中仍有不足。
Wenxuan Zhang, Yue Deng, Bing Liu 等
提出形式化与分类方法,分析3700个越狱提示在多模型上的效果。
Abhinav Rao, Sachin Vashistha, Atharva Naik 等
提出了MetricEval框架,利用测量理论评估NLG指标的可靠性和有效性。
Ziang Xiao, Susu Zhang, Vivian Lai 等
提出AutoCompressors,通过无监督训练将长文本压缩为摘要向量,提升长文本理解与推理能力。
Alexis Chevalier, Alexander Wettig, Anirudh Ajith 等
提出上下文感知解码(CAD),无需额外训练,显著提升多模型的事实一致性,尤其在知识冲突场景中效果突出。
Weijia Shi, Xiaochuang Han, Mike Lewis 等
提出ALCE基准,自动评估大语言模型生成带引用文本的能力,涵盖三维指标。
Tianyu Gao, Howard Yen, Jiatong Yu 等
提出利用大语言模型动态选择CoT与PAL,显著提升推理性能,GSM8K达96.8%。
James Xu Zhao, Yuxi Xie, Kenji Kawaguchi 等
CREATOR通过工具创建实现抽象与具体推理分离,提升在数学和表格问题上的表现。
Cheng Qian, Chi Han, Yi R. Fung 等
提出SciMON框架,通过检索启发源并优化新颖性,提升神经语言模型的科学创新能力。
Qingyun Wang, Doug Downey, Heng Ji 等
FActScore通过将长文本拆解为原子事实,计算支持比例,显著提升事实准确性评估的细粒度和自动化水平。
Sewon Min, Kalpesh Krishna, Xinxi Lyu 等