RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
RedBench整合37数据集,采用22风险类别和19领域,系统评估LLM漏洞。
Quy-Anh Dang, Chris Ngo, Truong-Son Hy
RedBench整合37数据集,采用22风险类别和19领域,系统评估LLM漏洞。
Quy-Anh Dang, Chris Ngo, Truong-Son Hy
MedDialogRubrics通过多代理系统评估LLM的多轮诊断能力,包含5200例患者案例。
Lecheng Gong, Weimin Fang, Ting Yang 等
提出了延迟承诺解码(DCD),提高扩散语言模型生成准确率1.73%。
Yingte Shu, Yuchuan Tian, Chao Xu 等
提出隐状态中毒攻击(HiSPA),利用短输入触发器在Mamba模型中实现信息篡改,显著削弱模型的长文本检索能力。
Alexandre Le Mercier, Chris Develder, Thomas Demeester
提出mHC,通过投影到双随机矩阵流形,恢复残差连接的恒等映射,提升大规模训练稳定性。
Zhenda Xie, Yixuan Wei, Huanqi Cao 等
提出Encyclo-K,通过动态组合知识陈述进行大模型评估,解决数据污染和多知识点理解难题。
Yiming Liang, Yizhi Li, Yantao Du 等
AutoForge通过自动合成高难度任务环境和ERPO算法提升代理学习效率。
Shihao Cai, Runnan Fang, Jialong Wu 等
提出CAT,通过结构化上下文管理提升长时序软件工程代理的推理能力,达57.6%解决率。
Shukai Liu, Jian Yang, Bo Jiang 等
提出多种分词惩罚函数,量化词拆分对LLM性能影响,实验证明显著。
Sachin Pawar, Manoj Apte, Kshitij Jadhav 等
采用Transformer模型分析塞内加尔低资源语言的NLP进展,识别数据缺口与未来方向。
Derguene Mbaye, Tatiana D. P. Mbengue, Madoune R. Seye 等
Axlerod结合NLP和RAG技术,提升保险代理信息检索准确率至93.18%,缩短搜索时间2.42秒。
Adam Bradley, John Hastings, Khandaker Mamun Ahmed
Memory-T1利用强化学习实现多会话中的时间感知记忆选择,提升长对话的推理能力。
Yiming Du, Baojun Wang, Yifan Xiang 等
Seed-Prover 1.5以Agentic RL和测试时扩展,在PutnamBench达88%。
Jiangjie Chen, Wenxiang Chen, Jiacheng Du 等
提出MMRB2基准,评估多模态奖励模型在文本-图像、编辑、推理任务中的表现,最高API模型Gemini 3 Pro达80%。
Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall 等
本研究提出JustRL,采用单阶段固定超参数训练1.5B模型,性能超越复杂方法,训练稳定且耗费更少计算资源。
Bingxiang He, Zekai Qu, Zeyuan Liu 等
本研究评估6个SpeechLLMs在16个基准上的性能,发现大多能匹配或超越传统级联架构,强调LLM整合的重要性。
Sara Papi, Javier Garcia Gilabert, Zachary Hopton 等
提出以“形式-功能-动态”三维框架系统化归纳代理记忆,涵盖三种主要实现与多样功能。
Yuyang Hu, Shichun Liu, Yanwei Yue 等
FIN-bench-v2通过整合多种基准测试,评估芬兰语大模型的表现,使用2.15B参数模型进行验证。
Joona Kytöniemi, Jousia Piha, Akseli Reunamo 等
AutoTool通过双阶段优化实现动态工具选择,提升LLM推理能力,平均在数学、科学、代码和多模态任务中提升6.4%。
Jiaru Zou, Ling Yang, Yunzhe Qi 等
NL2Repo-Bench通过长远目标任务评估编码智能体的完整软件仓库生成能力,平均测试通过率不足40%。
Jingzhe Ding, Shengda Long, Changxin Pu 等