ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving
ForgeDrive通过视觉-动作双向交叉条件生成,在NAVSIM上实现90.3 EPDMS,统一驾驶模拟与规划。
Xuchang Zhong, He Zheng, Chenxu Zhao 等
ForgeDrive通过视觉-动作双向交叉条件生成,在NAVSIM上实现90.3 EPDMS,统一驾驶模拟与规划。
Xuchang Zhong, He Zheng, Chenxu Zhao 等
提出View-PNDF,通过选择性神经元实现多视角胸片报告一致性,显著提升生成质量。
Yucheng Chen, Jinjing Zhu, Yang Yu 等
引入“图灵式标签模仿游戏”框架,通过TTN实现零样本伪标签筛查,提升多模型性能。
Brent A. Griffin, Jason J. Corso
RTSM方法在稀疏标签的域适应目标检测中提升1.7到18.3 AP50。
Lijun Zhang, Ruinian Xu, Mudit Agrawal
提出BrainJanus模型,融合脑、视觉和语言模态,通过离散Token实现多模态理解与生成。
Haitao Wu, Qirui Zhang, Zhouheng Yao 等
VisReflect通过潜在视觉反射提升长视觉上下文中的细粒度感知,图像基准提升4.1%,视频基准提升1.8%。
Xiaoqian Shen, Mohamed Elhoseiny
提出Blind Gap和Visual Gain指标,揭示交通事故视频问答中的视觉依赖问题。
Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim 等
LatEnt Noise maSk (Lens)通过减少冗余视觉信息提升多模态大语言模型的推理能力,提升了VQA数据集2.4-6.4分。
Kai Jiang, Ruishu Zhu, Siqi Huang 等
InnerZoom通过单次前向传递实现高效准确的GUI定位,显著提升了基准测试成绩。
Chen Liu, Ling Chen, Hanzhang Zhou 等
提出Nemotron-Labs-Diffusion-Image,结合可动态修正的离散掩码扩散模型,提升高分辨率图像生成质量,达成0.90的GenEval评分。
Shufan Li, Greg Heinrich, Hanrong Ye 等
通过冻结OpenVLA策略,使用线性探测器检测视觉分布转移下的故障信号,AUROC达0.972。
Dipesh Tharu Mahato, Rachel Ren
提出MultiDepth-3k基准,使用Laplacian视觉提示(LVP)探讨单目深度模型的几何层偏好,DAv2-L模型在ML-SRA上达到75.5%。
Xiaohao Xu, Feng Xue, Xiang Li 等
MIRROR利用Gromov–Wasserstein正则化,将语言中的关系几何结构迁移到视觉表示中,提升多模态关系推理。
Hong-Han Wang, Yuntao Wang, Hu Ding
提出一种自监督学习框架,仅用八张相位移图像学习次表面散射表示。
Arjun Majumdar, Raphael Braun, Andreas Engelhardt 等
TASKER算法通过任务驱动和场景感知的关键帧提取提升视频理解性能,EgoSchema提高2.0%。
Sunqi Fan, Qingle Liu, Runqi Yin 等
TrafficAlign通过视频合成场景,利用DSL验证,微调LLMs以匹配真实交通分布,提升自动驾驶模型安全性。
Zhi Tu, Liangkun Niu, Tianyi Zhang
提出DLGStream,通过双不透明度和变形场实现高效开放词汇自由视点流媒体,平均帧大小43KB。
Zhihui Ke, Yuyang Liu, Xiaobo Zhou 等
Ground4D结合VGGT几何初始化与动态高斯点云优化,实现单目视频的4D场景重建与高质量新视角合成。
Qing Zhao, Weijian Deng, Pengxu Wei 等
提出CoGS,基于分解的高斯点云方法,提升单目视频中人-物场景重建精度。
Jerrin Bright, John Zelek
Obliviate方法在自回归图像生成中有效删除概念,RAB基准上裸露率从91.58%降至3.15%。
Hossein Shakibania, Jonas Henry Grebe, Tobias Braun 等