排序: 最新 热门 引用
cs.AI 2608.19072

What is Missing from AI Post-Training AI: An Empirical Analysis

本文通过对大规模语言模型(LLM)后训练轨迹的实证分析,发现其策略锁定在初始阶段,缺乏在执行中自主策略重评机制,影响AI自我改进能力。

Joy Jia Yin Lim, Xin Huang, Hao Peng 等

2026-08-20 161
cs.LG 2608.18669

Reinforced Planning with Latent World Models

RP1通过学习多步计划优化规则,在视觉导航和机器人任务中实现了比手工设计搜索算法更优的性能,使用千倍更少的模型滚动。

Armin Sommer, Jannik Schilling

2026-08-19 51