On-the-fly Reconstruction for Large-Scale Novel View Synthesis from Unposed Images
提出一种实时大规模场景的无姿态图像即时重建方法,结合快速初始姿态估计与高效高斯原语采样,实现30分钟内完成场景重建,PSNR达21.7dB。
Andreas Meuleman, Ishaan Shah, Alexandre Lanvin 等
提出一种实时大规模场景的无姿态图像即时重建方法,结合快速初始姿态估计与高效高斯原语采样,实现30分钟内完成场景重建,PSNR达21.7dB。
Andreas Meuleman, Ishaan Shah, Alexandre Lanvin 等
提出基于3D伪标签的语义对应学习方法,显著提升SPair-71k性能,超越4%。
Olaf Dünkel, Thomas Wimmer, Christian Theobalt 等
提出PAM模型,结合SAM 2与大语言模型,实现图像视频区域理解,提升速度与效率。
Weifeng Lin, Xinyu Wei, Ruichuan An 等
本方法“Follow-Your-Creation”利用视频修复模型实现单目视频的4D内容生成与编辑,显著提升多视角一致性。
Yue Ma, Kunyu Feng, Xinhua Zhang 等
Struct2D通过感知引导的二维结构化输入,实现无需显式3D输入的空间推理,提升MLLMs性能。
Fangrui Zhu, Hanhui Wang, Yiming Xie 等
提出Contour Errors(CE) ego-centric匹配指标,解决3D多目标追踪中IoU与CPD的局限。
Sharang Kaul, Simon Bultmann, Mario Berk 等
Rex-Thinker通过链式思维推理实现对象指代,提升精度和解释性。
Qing Jiang, Xingyu Chen, Zhaoyang Zeng 等
利用Temporal-RLT框架,通过奖励设计和数据选择提升视频理解效率,显著减少训练数据。
Hongyu Li, Songhao Han, Yue Liao 等
ShapeLLM-Omni利用3D VQVAE实现3D内容理解与生成,构建3D-Alpaca数据集。
Junliang Ye, Zhengyi Wang, Ruowen Zhao 等
提出UMA:基于多层面表面对齐的超细节人体虚拟人建模方法,显著提升4K渲染细节。
Heming Zhu, Guoxing Sun, Christian Theobalt 等
ArtiScene利用图像中介,无需训练,实现基于文本的艺术3D场景生成。
Zeqi Gu, Yin Cui, Zhaoshuo Li 等
TW-GRPO框架通过聚焦思维和密集奖励提升视频推理,CLEVRER准确率达50.4%。
Jisheng Dang, Jingze Wu, Teng Wang 等
提出RT-X Net,利用跨注意力机制融合RGB与热成像信息,显著提升低光照图像质量。
Raman Jha, Adithya Lenka, Mani Ramanagopal 等
提出VG LLM,利用3D视觉几何编码器从视频中学习3D先验,显著提升场景理解与空间推理能力。
Duo Zheng, Shijia Huang, Yanyang Li 等
ScaleLong通过多时间尺度问题设计,评估长视频理解能力,揭示U形性能曲线。
David Ma, Huaqing Yuan, Xingjian Wang 等
提出GenCAD-Self-Repairing,通过扩散引导与自修复提升CAD生成的可行性,从10%提升至65%以上。
Chikaha Tsuji, Enrique Flores Medina, Harshit Gupta 等
LODGE提出基于层级的3D高斯点云快速渲染方法,有效降低GPU内存和计算时间。
Jonas Kulhanek, Marie-Julie Rakotosaona, Fabian Manhardt 等
VScan通过双阶段剪枝策略显著提升大视觉-语言模型的推理速度,保持95.4%的性能。
Ce Zhang, Kaixin Ma, Tianqing Fang 等
EPiC通过遮罩源视频实现高精度锚点视频,无需点云或相机姿态估计,提升3D相机控制效率。
Zun Wang, Jaemin Cho, Jialu Li 等
提出ViewSpatial-Bench,评估多视角空间定位,模型性能提升46.24%。
Dingming Li, Hongxing Li, Zixuan Wang 等