排序: 最新 热门 引用
cs.AI 2605.28807

Calibrating Conservatism for Scalable Oversight

提出CCO,通过集成多重监督信号,利用Conformal Decision Theory实现在线校准,确保AI系统行为符合预设安全目标。

William Overman, Mohsen Bayati

2026-05-28 310