PixNerd: Pixel Neural Field Diffusion
PixNerd提出端到端像素空间扩散模型,利用神经场实现大块细节建模,达成ImageNet 256×256 FID 2.15。
Shuai Wang, Ziteng Gao, Chenhui Zhu 等
PixNerd提出端到端像素空间扩散模型,利用神经场实现大块细节建模,达成ImageNet 256×256 FID 2.15。
Shuai Wang, Ziteng Gao, Chenhui Zhu 等
提出Alpha-CLIP和SMS分数优化OV-3DIS,ScanNet200上mAP提升至32.7%。
Sanghun Jung, Jingjing Zheng, Ke Zhang 等
X-Omni结合强化学习,提升离散自回归图像生成质量,实现图像与文本的统一理解与生成。
Zigang Geng, Yibing Wang, Yeyao Ma 等
基于深度学习的内窥镜深度估计,采用单目和立体方法,关键数据集包括合成与真实场景。
Ke Niu, Zeyun Liu, Xue Feng 等
FROSS采用2D场景图升维为3D,利用高斯分布实现实时在线3D语义场景图生成,显著提升速度和效率。
Hao-Yu Hou, Chun-Yi Lee, Motoharu Sonogashira 等
提出RGA3模型,结合STOM和SAM2实现视频中对象的指示与定位,提升多轮交互性能。
Haochen Wang, Qirui Chen, Cilin Yan 等
提出层级化多平台GUI评估框架MMBench-GUI,涵盖内容理解、元素定位、任务自动化与协作。
Xuehui Wang, Zhenyu Wu, JingJing Xie 等
提出DINO-world,基于DINOv2特征预测未来帧,提升视频理解与规划能力。
Federico Baldassarre, Marc Szafraniec, Basile Terver 等
TAGC按图像平均颜色自适应定γ,无需手调即可增强暗光图像。
Ghufran Abualhail Alhamzawi, Ali Saeed Alfoudi, Ali Hakem Alsaeedi 等
NEAT仅更新归一化层,以不到0.01%参数缓解VLM否定理解的双重概念偏移。
Haochen Han, Alex Jinpeng Wang, Fangming Liu 等
提出基于深度估计、相机校准的2D到3D数据提升方法,生成约200万场景,显著提升空间理解性能。
Xingyu Miao, Haoran Duan, Quanhao Qian 等
Ultra3D利用VecSet和Part Attention实现高效高保真3D生成,速度提升6.7倍。
Yiwen Chen, Zhihao Li, Yikai Wang 等
利用EAST+CRNN在Aria眼镜数据中实现环境鲁棒的场景文本识别,CER从0.65降至0.48。
Joseph De Mathia, Carlos Francisco Moreno-García
提出了一种结合稠密深度图的LiDAR-视觉里程计方法,在KITTI数据集上表现优异。
JunYing Huang, Ao Xu, DongSun Yong 等
DUSt3R、MASt3R和VGGT在稀疏航拍图像集上实现了高达50%的点云完整性提升。
Xinyi Wu, Steven Landgraf, Markus Ulrich 等
PositionIC通过BMPDS和可见性注意机制实现高保真图像定制,提升空间精度和身份一致性。
Junjie Hu, Tianyang Han, Kai Ma 等
提出PhysX-3D,通过PhysXNet和PhysXGen实现物理基础的3D资产生成,涵盖五个物理属性维度。
Ziang Cao, Zhaoxi Chen, Liang Pan 等
Dark-EvGS结合事件相机与3D高斯点云实现低光环境下的多视角亮帧重建。
Jingqian Wu, Peiqi Duan, Zongqiang Wang 等
通过上下文和任务感知扩散器实现任务导向的人类抓取合成,显著提升抓取质量。
An-Lun Liu, Yu-Wei Chao, Yi-Ting Chen
提出FOCAL,利用基础模型在推理时实现图像变换的典型视图,从而增强模型鲁棒性。
Utkarsh Singhal, Ryan Feng, Stella X. Yu 等