ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer
提出ObjectFolder 2.0,基于隐式神经表示的多感官虚拟物体数据集,规模扩大十倍,支持Sim2Real迁移。
Ruohan Gao, Zilin Si, Yen-Yu Chang 等
提出ObjectFolder 2.0,基于隐式神经表示的多感官虚拟物体数据集,规模扩大十倍,支持Sim2Real迁移。
Ruohan Gao, Zilin Si, Yen-Yu Chang 等
提出了一种基于Transformer的自回归3D形状生成方法,通过语义对齐的形状组合序列实现高效生成。
An-Chieh Cheng, Xueting Li, Sifei Liu 等
GraftNet结合大规模预训练特征与浅层变换显著提升跨域立体匹配泛化能力。
Biyang Liu, Huimin Yu, Guodong Qi
构建多模态知识库OakInk,结合对象赋能和人类交互,包含5万手-物体交互实例,推动姿态估计与交互生成。
Lixin Yang, Kailin Li, Xinyu Zhan 等
OpenDet方法通过扩展低密度潜在区域提高开放集目标检测性能,减少25%-35%错误。
Jiaming Han, Yuqiang Ren, Jian Ding 等
提出了一种时空定位的音视频网络,在MUSIC-AVQA数据集上表现优异。
Guangyao Li, Yake Wei, Yapeng Tian 等
UMT框架在视频片段检索和亮点检测上实现了显著提升,尤其在QVHighlights数据集上表现出色。
Ye Liu, Siyuan Li, Yang Wu 等
VideoMAE采用极高掩码比例(90%-95%)的自监督预训练,显著提升视频识别性能。
Zhan Tong, Yibing Song, Jue Wang 等
本研究提出视觉提示调优(VPT),在保持预训练Transformer模型参数不变的情况下,仅引入不到1%的输入空间可训练参数,显著提升多任务视觉识别性能,超越全参数微调。
Menglin Jia, Luming Tang, Bor-Chun Chen 等
研究综述视觉-语言导航任务,方法与未来方向,强调数据集和评估指标。
Jing Gu, Eliana Stefani, Qi Wu 等
提出CREStereo,采用层级递归网络和自适应相关层,在中、深度学习基准中排名第一,显著提升细节还原能力。
Jiankun Li, Peisen Wang, Pengfei Xiong 等
ELIC提出不均分组空间-通道上下文自适应编码,结合能量压缩特性,实现高速高效图像压缩。
Dailan He, Ziming Yang, Weikun Peng 等
本研究提出基于隐式表示的单图像面部细节重建方法,利用StyleGANv2和物理基础的隐式渲染实现高保真面部细节恢复。
Xingyu Ren, Alexandros Lattas, Baris Gecer 等
TensoRF利用张量分解模型场景辐射场,实现快速、紧凑的高质量重建。
Anpei Chen, Zexiang Xu, Andreas Geiger 等
AutoSDF通过自回归先验实现3D形状的补全、重建和生成,超越现有方法。
Paritosh Mittal, Yen-Chi Cheng, Maneesh Singh 等
利用掩码自监督学习自然图像,训练视觉编码器后冻结,用强化学习训练运动控制器,显著优于监督方法。
Tete Xiao, Ilija Radosavovic, Trevor Darrell 等
本研究揭示FID在特征空间中与ImageNet分类高度相关,易被操控,提出基于Top-N分类匹配的评估偏差分析。
Tuomas Kynkäänniemi, Tero Karras, Miika Aittala 等
DINO结合对比去噪、混合查询初始化和双向前方案,12轮训练达49.4AP,显著优于DN-DETR。
Hao Zhang, Feng Li, Shilong Liu 等
提出SSCD,自监督对比学习模型,用于图像复制检测,显著优于基线和SOTA方法。
Ed Pizzi, Sreya Dutta Roy, Sugosh Nagavara Ravindra 等
提出连续条件GAN(CC-GAN)生成高质量多样化点云,控制尺寸并改善少样本区域表现。
Larissa T. Triess, Andre Bühler, David Peter 等