排序: 最新 热门 引用
cs.AI 2609.04063

Spurious Advantage Hidden in GRPO

提出SIGNBALANCE,解决GRPO中猜测带来的虚假优势,提升数学和搜索任务表现。

Jiamian Wang, Samyadeep Basu, Koustava Goswami 等

2026-09-04 26
cs.SE 2609.04061

When Models Edit Too Much: On the Fidelity of Minimal Code Edits

本研究提出评估模型过度编辑行为的方法,利用控制AST腐败的基准框架,发现即使在强模型中,过度编辑仍普遍存在,并通过提示和训练策略减缓。

Tongyao Zhu, Wei Hern Lim, Min-Yen Kan

2026-09-04 73