Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning
提出基于表示和几何增强的统一离散驾驶标记器,提升自主驾驶中的场景重建与规划性能。
Ziyang Yao, Zeyu Zhu, YunCheng Jiang 等
提出基于表示和几何增强的统一离散驾驶标记器,提升自主驾驶中的场景重建与规划性能。
Ziyang Yao, Zeyu Zhu, YunCheng Jiang 等
TLG通过时间逻辑定位提升视频问答准确率24.5%,达到71.37%。
Ali Alavi
提出交互式视频世界建模框架,强调动作控制、长时记忆与实时响应,推动多场景应用。
Jiuming Liu, Chaojun Ni, Mengmeng Liu 等
提出解耦残差去噪扩散模型(DRDD),通过两阶段独立扩散实现高效统一图像到图像转换,显著提升数据利用率。
Ziyue Lin, Jiahe Hou, Hongyu Xia 等
MBench通过实体、环境和因果三维度评估视频世界模型的长时记忆能力,涵盖12个子维度。
Shengjun Zhang, Zhang Zhang, Simin Huang 等
提出Wan2.2视频扩散模型的少步蒸馏与低比特量化,提升部署效率。
Jinyang Du, Shenghao Jin, Ziqian Xu 等
提出基于结构推理的pause-and-think数据集,微调4B模型实现58%准确率,参数少于前沿模型59倍。
Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma 等
CAFOSat利用深度学习与GradCAM优化标注,涵盖20州45,000图像块,支持CAFO基础设施识别。
Oishee Bintey Hoque, Nibir Chandra Mandal, Mandy L Wilson 等
Zamba2-VL结合SSM与Transformer,参数规模1.2B-7B,显著提升推理速度。
Hassan Shapourian, Kasra Hejazi, Olabode M. Sule 等
StressDream通过优化初始噪声引导视频世界模型,提升策略评估的稳健性。
Junwon Seo, Sushant Veer, Ran Tian 等
Lumos-Nexus通过两阶段训练和UPFB实现高效频率桥接,提升视频生成的视觉质量与推理能力。
Jiazheng Xing, Hangjie Yuan, Lingling Cai 等
提出SOCO基准,利用100类、超1百万对齐点,系统评估视觉基础模型的语义对象对应能力,揭示模型在跨类别和细粒度理解中的不足。
Olaf Dünkel, Basavaraj Sunagad, Haoran Wang 等
C4G提出基于时间条件的紧凑高斯查询,利用全局特征聚合实现无场景优化的4D动态场景重建,显著减少高斯数目。
Mungyeom Kim, Minkyeong Jeon, Honggyu An 等
VolFill利用变分扩散模型从单视图RGB图像重建完整场景的3D几何,采用TUDF网格压缩和结构化表面提取。
Tuan Duc Ngo, Chuang Gan, Evangelos Kalogerakis
引入神经Token重建(NTR)框架,通过 masked latent reconstruction 改善端到端自主驾驶中的场景Token瓶颈,提升性能。
Jiahui Li, Jiawei Sun, Zixiang Ren 等
iVGR通过强化学习将视觉定位能力内化到文本推理中,显著提升MLLMs性能。
Chang-Bin Zhang, Yujie Zhong, Qiang Zhang 等
VideoMLA采用低秩潜在KV缓存,显著降低92.7%的内存,用于长时长视频生成,保持高质量。
Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral 等
NeuROK通过学习低维潜在空间实现4D动态模拟,利用变换器编码器-解码器架构在大规模数据集上训练,突破传统物理模型限制。
Chen Geng, Guangzhao He, Yue Gao 等
YoCausal利用逆向视频和认知科学启发的双层指标,评估13个视频扩散模型的因果理解能力。
You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee 等
引入GPIC,包含约280亿像素的庞大图像语料库,用于推动视觉生成模型的发展。
Keshigeyan Chandrasegaran, Kyle Sargent, Suchir Agarwal 等