OpenMask3D: Open-Vocabulary 3D Instance Segmentation
OpenMask3D实现零样本开放词汇3D实例分割,在ScanNet200长尾类上表现显著提升。
Ayça Takmaz, Elisabetta Fedele, Robert W. Sumner 等
OpenMask3D实现零样本开放词汇3D实例分割,在ScanNet200长尾类上表现显著提升。
Ayça Takmaz, Elisabetta Fedele, Robert W. Sumner 等
提出MME基准,评估30个多模态大模型的感知与认知能力,涵盖14个子任务。
Chaoyou Fu, Peixian Chen, Yunhang Shen 等
提出PSF感知变换器(PART)用于极简高质全景成像,提升图像质量。
Qi Jiang, Shaohua Gao, Yao Gao 等
MotionGPT通过微调大模型实现多模态人类运动生成,支持文本和单帧姿势控制。
Yaqi Zhang, Di Huang, Bin Liu 等
R2A框架在零样本视频问答中超越Flamingo-80B,参数仅1.3B。
Junting Pan, Ziyi Lin, Yuying Ge 等
DreamSim利用合成数据训练,提升对人类视觉相似度的感知,超越传统像素级指标。
Stephanie Fu, Netanel Tamir, Shobhita Sundaram 等
LVLM-eHub评估8个大型视觉语言模型,揭示过拟合和对象幻觉问题,提出多轮推理框架。
Peng Xu, Wenqi Shao, Kaipeng Zhang 等
NAVI是一个类别无关的图像集,配备高质量3D模型和精确摄像机参数,支持多场景3D重建与对应任务。
Varun Jampani, Kevis-Kokitsi Maninis, Andreas Engelhardt 等
提出ARGO1M数据集和CIR方法,实现跨场景、地点动作识别的泛化,优于现有方法。
Chiara Plizzari, Toby Perrett, Barbara Caputo 等
AssistGPT结合PEIL策略,通过多模态工具实现复杂视觉任务的自主规划与学习。
Difei Gao, Lei Ji, Luowei Zhou 等
提出TF++,解决端到端驾驶模型中的偏见,提升Longest6得分11分。
Bernhard Jaeger, Kashyap Chitta, Andreas Geiger
Valley模型结合ViT-L/14与三种时间建模模块,构建702k视频文本对齐和73k指令数据,显著提升视频理解能力。
Ruipu Luo, Ziwang Zhao, Min Yang 等
提出Aria Digital Twin(ADT)数据集,包含200条真实场景序列,支持3D目标检测、追踪等任务。
Xiaqing Pan, Nicholas Charron, Yongqian Yang 等
利用基础模型实现零-shot风格化3D资产生成,无需详细对象描述。
Ian Huang, Vrishab Krishna, Omoruyi Atekha 等
M$^3$IT数据集优化视觉语言模型,含40个数据集和80种语言。
Lei Li, Yuwei Yin, Shicheng Li 等
本研究提出DIFT,利用预训练扩散模型的隐含特征,无需监督即可实现语义、几何和时序对应,超越弱监督方法。
Luming Tang, Menglin Jia, Qianqian Wang 等
RAM模型通过大规模图像-文本对训练,实现高精度零样本图像标注。
Youcai Zhang, Xinyu Huang, Jinyu Ma 等
VideoComposer利用运动向量和时空条件编码实现可控视频合成,支持多模态条件控制。
Xiang Wang, Hangjie Yuan, Shiwei Zhang 等
DiffLL通过小波条件扩散模型提升低光图像质量,效率提高70倍。
Hai Jiang, Ao Luo, Songchen Han 等
FlowCam通过像素对齐场景流在无相机位姿下训练3D辐射场,提升了视频数据的3D重建能力。
Cameron Smith, Yilun Du, Ayush Tewari 等