排序: 最新 热门 引用
cs.CL 2505.09388

Qwen3 Technical Report

Qwen3结合思考与非思考模式,参数规模达235B,提升多语言、多任务性能。

An Yang, Anfeng Li, Baosong Yang 等

2025-05-14 41
cs.CV 2505.07818

DanceGRPO: Unleashing GRPO on Visual Generation

本文提出DanceGRPO,基于稳定的Group Relative Policy Optimization(GRPO)框架,有效提升视觉生成模型在多任务、多场景下的强化学习性能,实验中最高提升达181%。

Zeyue Xue, Jie Wu, Yu Gao 等

2025-05-13 362 引用 33