排序: 最新 热门 引用
cs.CV 2608.05149

CoCo-IR: Contextual Composed Image Retrieval

提出CoCo-IR任务及TIE模型,基于大规模多模态模型实现多轮上下文图像检索,单轮mAP达39.4,四轮R@1达44.1。

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding 等

2026-08-06 123
cs.CV 2608.05145

Objects as Audio-Visual Modal Sound Fields

提出AV-MSF,通过多视角图像和少量冲击声,实现物体冲击声的物理可解释重建,性能优于现有方法。

Zisen Shao, Zihao Wei, Derong Jin 等

2026-08-06 129