排序: 最新 热门 引用
cs.CL 2606.19336

Learning User Simulators with Turing Rewards

提出基于图灵奖励的强化学习方法Turing-RL,用于训练人类用户模拟器,显著优于传统匹配方法。

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu 等

2026-06-18 205
cs.CL 2606.13634

Operads for compositional reasoning in LLMs

提出运算子框架Q,用于描述问答中的问题分解,结合操作一致性提升多步推理可靠性。

Nathaniel Bottman, Kyle Richardson

2026-06-12 1 引用 594