排序: 最新 热门 引用
cs.AI 2607.28367

How Benchmarks Mis-Score Computer-Use Agents

研究揭示计算机使用代理的基准测试评分误差,提出四阶段可靠性框架,15.3%失败判决有误。

Zihan Dong, Zhiyuan Ma, Zekun Wang 等

2026-07-30 7
cs.AI 2607.27824

STEREODISCO: Discovering Stereotypicality in LLMs

提出STEREODISCO框架,利用语义差异法系统识别大模型中的刻板印象,发现超出社会心理研究的语义轴。

Farane Jalali Farahani, Corina Dima, Mojtaba Nayyeri 等

2026-07-30 40