排序: 最新 热门 引用
cs.CV 2406.04264

MLVU: Benchmarking Multi-task Long Video Understanding

MLVU基准使用长视频(平均15分钟)评估多任务长视频理解,涵盖9类任务,测试23个MLLM模型,揭示性能提升空间。

Junjie Zhou, Yan Shu, Bo Zhao 等

2024-06-07 262 引用 41
cs.LG 2406.04093

Scaling and evaluating sparse autoencoders

采用k-sparse自编码器控制稀疏性,训练出规模达1600万潜变量的模型,揭示其规模与特征质量的清晰增长规律。

Leo Gao, Tom Dupré la Tour, Henk Tillman 等

2024-06-06 567 引用 43