排序: 最新 热门 引用
cs.CV 2507.07966

Scaling RL to Long Videos

提出LongVideo-Reason数据集及LongVILA-R1框架,结合多模强化学习实现长视频推理,达65.1%准确率。

Yukang Chen, Wei Huang, Baifeng Shi 等

2025-07-11 41
cs.CV 2507.05595

PaddleOCR 3.0 Technical Report

PaddleOCR 3.0引入PP-OCRv5、PP-StructureV3和PP-ChatOCRv4,提升多语种识别与文档理解能力。

Cheng Cui, Ting Sun, Manhui Lin 等

2025-07-08 158 引用 36
cs.CV 2507.01949

Kwai Keye-VL Technical Report

Kwai Keye-VL为短视频理解设计的8亿参数多模态模型,结合大规模视频数据与创新训练策略。

Kwai Keye Team, Biao Yang, Bin Wen 等

2025-07-03 54