排序: 最新 热门 引用
cs.CV 2606.15389

Timestep Rescheduling in Diffusion Inversion

提出非均匀时间步调调度策略,有效降低扩散反演误差,提升图像重建与编辑精度。

Shangquan Sun, Ting Gong, Zhirui Liu 等

2026-06-14 46
cs.CV 2606.14958

MVEB: Massive Video Embedding Benchmark

MVEB基准涵盖23任务,评估33模型,揭示多模态视频嵌入的多样性与局限。

Adnan El Assadi, Roman Solomatin, Isaac Chung 等

2026-06-13 74
cs.CV 2606.14703

Gaze Heads: How VLMs Look at What They Describe

本研究发现VLM中的少数注意头(凝视头)通过追踪描述区域,提供可控的模型行为干预机制,利用漫画和自然图像验证其因果作用。

Rohit Gandikota, David Bau

2026-06-13 216
cs.CV 2606.13676

Modality Forcing for Scalable Spatial Generation

提出Modality Forcing,通过单一DiT模型实现稀疏深度数据的联合图像-深度生成,深度预测准确率提升57%。

Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski 等

2026-06-12 329