排序: 最新 热门 引用
cs.CV 2505.07062

Seed1.5-VL Technical Report

Seed1.5-VL结合532M视觉编码器与20B参数Mixture-of-Experts实现多模态理解,达38项SOTA。

Dong Guo, Faming Wu, Feida Zhu 等

2025-05-12 42
cs.CV 2505.05071

FG-CLIP: Fine-Grained Visual and Textual Alignment

FG-CLIP通过生成16亿长描述、构建12百万图像区域标注和引入1000万难负样本,显著提升细粒度视觉文本对齐。

Chunyu Xie, Bin Wang, Fanjing Kong 等

2025-05-08 35