Advances in 4D Representation: Geometry, Motion, and Interaction
使用NeRFs和3DGS进行4D表示生成和重建,提升动态场景理解。
Mingrui Zhao, Sauradip Nag, Kai Wang 等
使用NeRFs和3DGS进行4D表示生成和重建,提升动态场景理解。
Mingrui Zhao, Sauradip Nag, Kai Wang 等
VFM-VAE利用冻结VFM作为编码器,设计新解码器提升图像重建,显著加速LDM训练,达到gFID 1.62。
Tianci Bi, Xiaoyi Zhang, Yan Lu 等
Glyph通过视觉-文本压缩实现长上下文扩展,达3-4倍压缩率,性能媲美Qwen3-8B。
Jiale Cheng, Yusen Liu, Xinyu Zhang 等
提出基于语境的伪标签评分框架,实现零样本视频摘要,F1达57.58(SumMe)
Yuanli Wu, Long Zhang, Yue Du 等
VISTA通过多智能体自我优化,提升视频生成质量,达60%胜率。
Do Xuan Long, Xingchen Wan, Hootan Nakhost 等
XModBench评估Gemini 2.5 Pro模型的跨模态一致性,发现其在空间和时间推理上准确率不足60%。
Xingrui Wang, Jiang Liu, Chao Huang 等
提出基于原理的原生视觉-语言模型NEO,利用390M图文样本实现像素与词汇的高效对齐,突破模块化模型限制。
Haiwen Diao, Mingxuan Li, Silei Wu 等
WithAnyone模型通过对比损失和MultiID-2M数据集实现可控且身份一致的图像生成。
Hengyuan Xu, Wei Cheng, Peng Xing 等
提出生成式通用验证器,基于ViVerBench,提升视觉验证能力8.3点。
Xinchen Zhang, Xiaoying Zhang, Youbin Wu 等
采用FusionNet、SG-LLIE等多模型融合,提升低光图像质量,最高PSNR达26.35。
Xiaoning Liu, Zongwei Wu, Florin-Alexandru Vasluianu 等
本文提出Mask-GRPO,将强化学习引入Masked生成模型,显著提升文本到图像生成性能,基于Show-o模型在标准基准上取得优异表现。
Yifu Luo, Xinhao Hu, Keyu Fan 等
DepthVLA通过预训练深度模块增强空间推理,显著提升机器人操控性能。
Tianyuan Yuan, Yicheng Liu, Chenhao Lu 等
EgoSocial利用多模态数据检测社交干预时机,提升OLMM的表现(干预时机准确率提升45.6%)
Xijun Wang, Tanay Sharma, Achin Kulshrestha 等
DriveVLA-W0通过世界建模预测未来图像,利用密集自监督信号显著提升自主驾驶模型的规模化性能,验证在大规模数据集上表现优异。
Yingyan Li, Shuyao Shang, Weisong Liu 等
AnyUp是一种通用特征上采样方法,无需重训练,可适应任何视觉特征,性能领先。
Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona 等
DrivingScene采用静态-动态两阶段训练,利用残差流网络实现实时高质量动态场景重建。
Qirui Hou, Wenzhang Sun, Chang Zeng 等
提出一种新机器学习框架,识别自动驾驶中的角落案例,提升检测准确性。
Sebastian Schmidt, Julius Körner, Stephan Günnemann
提出一种无需真实图像的实例级生成方法,显著提升多领域ILR性能。
Yankun Wu, Zakaria Laskar, Giorgos Kordopatis-Zilos 等
FlexTraj提出基于点轨迹的多粒度视频生成框架,支持无对齐控制。
Zhiyuan Zhang, Can Wang, Dongdong Chen 等
提出基于引导扩散模型的 hyperspectral 数据增强方法,提升森林分类准确率。
Mattia Ferrari, Lorenzo Bruzzone