Diff-IP2D: Diffusion-Based Hand-Object Interaction Prediction on Egocentric Videos
提出Diff-IP2D,基于扩散模型同时预测手部轨迹与物体意向,显著优于SOTA方法。
Junyi Ma, Jingyi Xu, Xieyuanli Chen 等
提出Diff-IP2D,基于扩散模型同时预测手部轨迹与物体意向,显著优于SOTA方法。
Junyi Ma, Jingyi Xu, Xieyuanli Chen 等
MANTIS通过指令微调提升多图像视觉语言能力,平均提升13点。
Dongfu Jiang, Xuan He, Huaye Zeng 等
EchoScene利用双分支扩散模型在场景图上生成3D室内场景,提升控制性与一致性。
Guangyao Zhai, Evin Pınar Örnek, Dave Zhenyu Chen 等
提出DOCCI数据集,含15k高细节描述,提升图像描述与生成性能。
Yasumasa Onoe, Sunayana Rane, Zachary Berger 等
GS-LRM是一种基于Transformer的高效大规模3D高斯原语重建模型,能在0.23秒内从2-4张稀疏视角图像中重建高质量场景。
Kai Zhang, Sai Bi, Hao Tan 等
提出了一种自注意力评分机制的多页文档视觉问答方法,在无需OCR的情况下实现了最先进的性能。
Lei Kang, Rubèn Tito, Ernest Valveny 等
LM-IGTD通过噪声增强和改良IGTD,将低维混合型表格数据转为图像,提升CNN性能。
Vanesa Gómez-Martínez, Francisco J. Lara-Abelenda, Pablo Peiro-Corbacho 等
提出无参数池化的PLLaVA模型,有效扩展图像预训练模型到视频密集描述,达成SOTA。
Lin Xu, Yilin Zhao, Daquan Zhou 等
ViViDex利用人类视频,通过强化学习和轨迹引导,实现多指机器人手的视觉操控,显著优于现有方法。
Zerui Chen, Shizhe Chen, Etienne Arlaud 等
提出“Align Your Steps”优化扩散模型采样调度,显著提升少步采样质量。
Amirmojtaba Sabour, Sanja Fidler, Karsten Kreis
采用Retinexformer和多尺度融合技术,提升低光照图像质量,PSNR达25.52dB。
Xiaoning Liu, Zongwei Wu, Ao Li 等
MoVA通过粗到细机制适应多模态上下文,提升视觉专家组合的性能。
Zhuofan Zong, Bingqi Ma, Dazhong Shen 等
PhysDreamer通过视频生成学习物理先验,实现静态3D物体的交互动态模拟。
Tianyuan Zhang, Hong-Xing Yu, Rundi Wu 等
本文分析了Fréchet Video Distance(FVD)在内容偏差上的表现,发现其偏重于单帧质量而忽视运动连续性,主要源于特征提取模型的内容偏向。
Songwei Ge, Aniruddha Mahapatra, Gaurav Parmar 等
Blink基准测试14项核心视觉感知任务,采用多模态大模型(如GPT-4V、Gemini)进行评估,平均准确率仅51.26%,远低于人类的95.70%。
Xingyu Fu, Yushi Hu, Bangzheng Li 等
论文提出Viewpoint Control,用多视图3D特征控制定制对象视角,但摘要未报告具体数值。
Nupur Kumari, Grace Su, Richard Zhang 等
提出LAPTOP-Diff,通过层剪枝和归一化蒸馏高效压缩扩散模型,保持性能下降最低4%。
Dingkun Zhang, Sijia Li, Chen Chen 等
提出语义感知注意引导(SAG)框架,结合组织和病理信息提升全切片图像诊断准确率。
Kechun Liu, Wenjun Wu, Joann G. Elmore 等
MK-SGN结合多模态融合和知识蒸馏,实现骨架动作识别,能耗降低98%。
Naichuan Zheng, Hailun Xia, Zeyu Liang 等
提出MMInA基准,评估多跳多模态互联网代理的长程推理能力,数据涵盖1050个真实网站任务。
Shulin Tian, Ziniu Zhang, Liangyu Chen 等