排序: 最新 热门 引用
cs.AI 2608.06301

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

引入HarnessOpt-Bench基准,评估5个前沿大型语言模型在昂贵且随机的全流程 harness 优化中的表现,揭示模型差异和潜在提升空间。

Varun Ursekar, Apaar Shanker, Yash Maurya 等

2026-08-07 130
cs.AI 2608.05086

Item Response Theory for AI Safety

本文引入IRT模型对192个大模型在8个安全基准上的表现进行分析,发现三大潜在能力,显著降低评估成本并支持模型审计。

Joshua Fonseca Rivera, Neil Shah, David Demitri Africa 等

2026-08-06 124