DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
DriveWorld-VLA通过在潜在空间中融合VLA与世界模型,实现自主驾驶的场景预测与决策,达成91.3 PDMS。
Feiyang jia, Lin Liu, Ziying Song 等
DriveWorld-VLA通过在潜在空间中融合VLA与世界模型,实现自主驾驶的场景预测与决策,达成91.3 PDMS。
Feiyang jia, Lin Liu, Ziying Song 等
提出BridgeNav,基于视觉和指令的室内外无先验导航,成功率达89.55%。
Yuxiang Zhao, Yirong Yang, Yanqing Zhu 等
提出GT-SVJ,将视频生成模型转为能捕捉时间动态的奖励模型,利用对比学习提升效率。
Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki 等
VISTA通过轨迹跟随偏好优化增强VLA模型的视觉条件,提升成功率3.15%。
Yiye Chen, Yanan Jian, Xiaoyi Dong 等
VISTA-Bench揭示视觉化文本与纯文本模型的显著模态差距,基于多任务评估模型理解能力。
Qing'an Liu, Juntong Feng, Yuhao Wang 等
SparVAR通过稀疏性加速VAR模型,生成1024x1024图像仅需1秒。
Zekun Li, Ning Wang, Tongxin Bai 等
QVLA通过通道级量化策略,在LIBERO中将VRAM需求减少至29.2%,性能保持98.9%。
Yuhao Xu, Yantai Yang, Zhenyang Fan 等
提出CompTok,基于Diffusion的视觉标记器,增强组合性,利用信息GAN目标提升可控性。
Bingchen Zhao, Qiushan Guo, Ye Wang 等
UnifiedReward-Flex通过上下文自适应推理提升视觉生成的个性化奖励模型。
Yibin Wang, Yuhang Zang, Feng Han 等
提出Causal Forcing,通过AR教师引导ODE初始化,解决视频扩散模型的架构差距,提升生成质量。
Hongzhou Zhu, Min Zhao, Guande He 等
Mind-Brush通过动态知识驱动的工作流提升图像生成,Qwen-Image在Mind-Bench上从0.02提升到0.31。
Jun He, Junyan Ye, Zilong Huang 等
ObjEmbed通过多模态对象嵌入实现图像与文本的精细对齐,在18个基准上表现优异。
Shenghao Fu, Yukun Su, Fengyun Rao 等
提出BDG框架结合MAS-GLCM与扩散模型,实现多任务通用图像修复,提升保真度。
JiaKui Hu, Zhengjian Yao, Lujia Jin 等
DuoGen框架通过数据策划和架构设计,实现通用交错多模态生成,提升文本质量和图像一致性。
Min Shi, Xiaohui Zeng, Jiannan Huang 等
PLADIC利用预训练视频扩散模型实现多物体身份保持与布局控制。
Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer 等
提出FaceDefense,通过方向性属性编辑与Diffusion损失实现隐形抗脸换技术,提升防御效果。
Yilong Huang, Songze Li
提出Vision-DeepResearch,通过多轮、多实体、多尺度视觉文本搜索,增强多模态大模型的深度研究能力,支持数十步推理与数百次引擎交互。
Wenxuan Huang, Yu Zeng, Qiuchen Wang 等
PLANING采用三角-高斯混合表示,实现流式3D重建,提升速度与精度。
Changjian Jiang, Kerui Ren, Xudong Li 等
UDBM提出一种基于不确定性引导的扩散桥模型,单步实现多任务图像恢复,显著优于SOTA。
Luwei Tu, Jiawei Wu, Xing Luo 等
MPF-Net通过层次化偏差和微观时序波动检测高保真AI视频伪造,利用Manifold Projection Fluctuations实现高效识别。
Xinan He, Kaiqing Lin, Yue Zhou 等