Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors
提出基于高置信深度传播与法线先验的稀疏视角表面重建方法,显著优于现有技术。
Liang Han, Bangcai Wei, Junsheng Zhou 等
提出基于高置信深度传播与法线先验的稀疏视角表面重建方法,显著优于现有技术。
Liang Han, Bangcai Wei, Junsheng Zhou 等
Decomposable Probe以三层扰动揭示:潜变量层识别整流流,分数层反映蒸馏目标。
Patrick Mu Haojie
BVS结合贝叶斯优化和多模态大语言模型,实现对超高分辨率图像的细粒度感知,显著提升精度和效率。
Geng Li, Yuxin Peng
SafeGuard结合多智能体感知与推理,提升社会风险视频检测准确率18.7%。
Wenlin Wu, Sheng Zhou, Peipei Song 等
CONFLUX以3D潜扩散和强化学习生成可控胸部CT,FID达32.3,优于MAISI的74.6。
Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge 等
提出了跨设备协作测试时适应方法,结合零阶优化和模型合并,在CIFAR10-C上减少了18.3%的错误率。
Yu Mitsuzumi, Akisato Kimura, Yasuhiro Fujiwara 等
EMA利用DiT的Massive Activations,DG提升细节,MREP改善密集表征;MA干预后BLIP/CLIP胜率仍为0.462/0.512。
Chaofan Gan, Zicheng Zhao, Yuanpeng Tu 等
R3D通过场景构建和工具调用实现基于RGB-D视频的3D空间推理,达73.5%准确率。
Maxwell Horton, Wei Lu, Quan Tran 等
UniCaMo通过3D-grounded噪声空间实现对象与摄像机运动的同步控制,提升视频质量与一致性。
Long Vu, Tan Ngo, Animesh Karnewar 等
提出了一种在标准化对象坐标空间中进行生成视图合成的全局姿态控制方法,显著提高图像质量和一致性。
Zhibing Li, Amogh Gupta, Behnoosh Parsa 等
LongEgoRefer基准测试长时自我中心视频指代表达理解,挑战现有模型。
Shunya Kato, Taiki Miyanishi, Shuhei Kurita 等
PWM-ArtGen通过学习视觉动态与运动参数的联合分布,实现单图多关节物体生成,显著优于基线。
Wentao Zheng, Ancong Wu
ReQuest通过不确定性驱动的关键帧选择提高长视频问答准确率。
Minkuk Kim, Suyong Yun, Young Tae Kim 等
LASER通过视觉注意力保持与抑制Sink,有效缓解LVLMs的视觉遗忘问题。
Bowen Yuan, Zijian Wang, Yadan Luo 等
ICDepth通过In-Context Conditioning和SAND-Attention实现视频深度估计,数据效率提升6-13倍。
Xuanhua He, Jiaxin Xie, Mingzhe Zheng 等
提出PanoGaussian,将单目4D场景合成扩展至未见区域,保持几何一致性。
Yuankun Yang, Yi Wei, Wenyang Zhou 等
DriveTeach-VLA通过DVD和2D-TGP优化视觉语言行动模型,Navsim上PDMS达90.4。
Yuguang Yang, Canyu Chen, Zhewen Tan 等
VLAFlow通过联合训练和未来潜在对齐实现视觉-语言-动作模型的稳定迁移。
Guoyang Xia, Fengfa Li, Hongjin Ji 等
MVFusion-GS通过运动-方差引导的时间注意力提升动态高质量高斯点云重建。
Jianwei Hu, Tingxuan Huang, Hengyu Zhou 等
提出O3-D数据集,通过深度排序任务评估视觉-语言模型的深度理解能力,深度识别准确率仅47-56%。
Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos