HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly
HELMET提供七类任务评估长上下文语言模型,改进现有基准。
Howard Yen, Tianyu Gao, Minmin Hou 等
HELMET提供七类任务评估长上下文语言模型,改进现有基准。
Howard Yen, Tianyu Gao, Minmin Hou 等
提出ICR方法利用注意力变化实现高效零样本重排序,减少60%以上延迟。
Shijie Chen, Bernal Jiménez Gutiérrez, Yu Su
ExACT方法结合R-MCTS与探索性学习,在VisualWebArena基准上提升6%-30%。
Xiao Yu, Baolin Peng, Vineeth Vajipey 等
提出VideoCLIP-XL,利用大规模长描述视频数据集和TPCM,显著提升视频长描述理解能力。
Jiapeng Wang, Chengyu Wang, Kunzhe Huang 等
UniSumEval通过细粒度、多维度标注,评估9种最新LLM的摘要性能,填补现有基准不足。
Yuho Lee, Taewon Yun, Jason Cai 等
提出基于散度校准的预训练数据检测方法DC-PDD,显著优于现有技术。
Weichao Zhang, Ruqing Zhang, Jiafeng Guo 等
提出LSCS架构,结合模型参数、显式存储、知识图谱和文本存储,实现持续经验吸收与准确回忆。
Yu Wang, Chi Han, Tongtong Wu 等
提出FRAMES评估数据集,结合事实、检索与推理,评估多源信息整合能力。
Satyapriya Krishna, Kalpesh Krishna, Anhad Mohananey 等
LogicPro利用程序引导学习合成复杂逻辑推理数据,提升多模型性能。
Jin Jiang, Yuchen Yan, Yang Liu 等
提出SciLead,利用大语言模型自动构建科学排行榜,解决手工维护不完整和错误问题。
Furkan Şahinuç, Thy Thy Tran, Yulia Grishina 等
利用大规模代码模型实现无代码协作机器人编程,评估其在工业装配任务中的代码合成能力。
Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen
提出Agent Workflow Memory(AWM),通过诱导和存储可重用的任务流程,显著提升网页导航任务成功率,Mind2Web和WebArena上分别提升24.6%和51.1%。
Zora Zhiruo Wang, Jiayuan Mao, Daniel Fried 等
PingPong基准测试通过用户模拟和多模型评估评估角色扮演语言模型,验证了40余种模型。
Ilya Gusev
E2LLM通过分块压缩长文本,结合预训练编码器与解码器,有效突破“难以兼顾性能、效率与兼容性”的三角困境。
Zihan Liao, Jun Wang, Hang Yu 等
DOLCE框架通过λ和k参数化问题,识别长上下文任务的检索和整体理解能力。
Zi Yang
本研究评估LLMs生成科研新意的能力,发现其新颖性优于专家(p<0.05),但在可行性方面略弱。
Chenglei Si, Diyi Yang, Tatsunori Hashimoto
xLAM系列模型在Berkeley功能调用排行榜中超越GPT-4,提升AI代理任务性能。
Jianguo Zhang, Tian Lan, Ming Zhu 等
提出MMMU-Pro,通过过滤、扩展选项和视觉输入挑战模型,性能下降16.8%-26.9%,提升评估严谨性。
Xiang Yue, Tianyu Zheng, Yuansheng Ni 等
OLMoE使用稀疏专家混合模型,7亿参数中仅1亿被激活,性能超越更大模型。
Niklas Muennighoff, Luca Soldaini, Dirk Groeneveld 等
TinyAgent利用LLMCompiler和高质量数据集,训练出边缘部署的1.1B和7B模型,超越GPT-4-Turbo的函数调用能力。
Lutfi Eren Erdogan, Nicholas Lee, Siddharth Jha 等