排序: 最新 热门 引用
cs.LG 2606.09821

Rethinking the Divergence Regularization in LLM RL

本文提出DRPO,通过平滑优势加权二次正则化改善LLM强化学习中的偏差正则,提升训练稳定性和效率。

Jiarui Yao, Xiangxin Zhou, Penghui Qi 等

2026-06-09 194
cs.LG 2606.09806

Topological Neural Operators

提出拓扑神经算子(TNO),在细胞复形上实现多尺度、多维度的偏微分方程算子学习,显著提升复杂几何域的预测精度。

Lennart Bastian, Samuel Leventhal, Mustafa Hajij 等

2026-06-09 391