Item Response Theory for AI Safety
本文引入IRT模型对192个大模型在8个安全基准上的表现进行分析,发现三大潜在能力,显著降低评估成本并支持模型审计。
Joshua Fonseca Rivera, Neil Shah, David Demitri Africa 等
本文引入IRT模型对192个大模型在8个安全基准上的表现进行分析,发现三大潜在能力,显著降低评估成本并支持模型审计。
Joshua Fonseca Rivera, Neil Shah, David Demitri Africa 等
提出TriQua框架,结合基础三元组与修饰符,实现事实评估的细粒度与上下文平衡。
Jin Liu, Steffen Thoma, Achim Rettinger
提出基于专业交付物的角色基础评估框架FinProBench,结合RGRC实现角色标准重用,显著提升财务AI评估效率。
Ben Wang, Kang Zhou, Lifan Guo 等
提出Dispersion–Revision耦合诊断,利用CI指标验证输出散布与认知修正关系。
Molood Arman
提出复数状态空间模型CSP,仅通过状态传播实现确定性状态追踪,达100%准确率。
Xiaohe Li, Yang Lu
提出DocTrace,基于层次化证据图推理的长文档VQA模型,提升准确率和可追溯性。
Le Xiang, Zhicheng Guan, Hong Chen 等
ParEvalLayer用覆盖与Bootstrap判定部分评测是否足以决策;三项基准在15%–25%任务量达到完整评测结论。
Wei-Jung Huang, Bonan Shen
通过可微投影学习可行库存策略,平均最优差距低于1%。
Patrick Helm, Jan-Niklas Doerr, Joren Gijsbrechts 等
提出IBA-Bench评估隐性行为对齐,结合深度检索与轨迹级合成,显著提升个性化LLM代理行为。
Jiajia Song, Bobo Li, Haiwen Yi 等
HPFA框架通过超图和配对路径高效定位LLM推理失败根因,提升准确率64.6%。
Runchuan Zhu, Hongbin Lai, Bowen Jiang 等
提出PCSD,通过局部持久性估算教师信号的可信度,提升强化学习中的自蒸馏效果。
Chunji Lv, Yangguang Wei, Junlin Liu 等
SearchMaster通过自我博弈提升搜索代理的准确率,从38.19%提高到51.52%。
Wentao Tan, Qiong Cao, Jiaqi Wang 等
提出CoNav-UAV,基于Stackelberg博弈的双高低空无人机合作导航,成功率提升30.8点。
Junru Song, Wenhao Zhang, Yang Yang 等
DAPD通过双路径和双源锚定显著改善特权幻觉,平均提升2.00分。
Jianyu Wu, Yizhou Wang, Encheng Su 等
PNPO通过前缀归一化替代累积比率,有效缓解大模型RL中的偏离问题。
Wenhao Zhang, Yibo Xie, Rui Wang 等
KoVRE模型通过双语监督和正负样本挖掘提升韩文文档检索效率。
Yongbin Choi, Gyuho Shim, Youngjoon Jang
提出以人-智能体系统(HAS)视角研究AI科学家,强调人机协同与风险管理。
Patrick Emami, Sameera Horawalavithana, Truc Nguyen 等
提出PMMC框架,将多模态长时记忆从查询时迁移到整合时,提升答案质量与效率。
Jingyu Sun, Yan Lin, Yuyang Xue 等
通过研究模型中层的“等向性悬崖”,揭示大模型决策的几何签名,相关性达0.84。
Okan S. Coskun, Florian Rottach, Carsten Eickhoff 等
AgentSLABench为自主AI代理设计的资源感知评测框架,结合正确性与资源指标。
Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju