排序: 最新 热门 引用
cs.CV 2606.14958

MVEB: Massive Video Embedding Benchmark

MVEB基准涵盖23任务,评估33模型,揭示多模态视频嵌入的多样性与局限。

Adnan El Assadi, Roman Solomatin, Isaac Chung 等

2026-06-13 75
cs.CV 2606.14703

Gaze Heads: How VLMs Look at What They Describe

本研究发现VLM中的少数注意头(凝视头)通过追踪描述区域,提供可控的模型行为干预机制,利用漫画和自然图像验证其因果作用。

Rohit Gandikota, David Bau

2026-06-13 216