Evidential Neural Radiance Fields
提出证据神经辐射场(Evidential NeRF),可同时估算数据和模型不确定性,提升场景重建与可信度。
Ruxiao Duan, Alex Wong
提出证据神经辐射场(Evidential NeRF),可同时估算数据和模型不确定性,提升场景重建与可信度。
Ruxiao Duan, Alex Wong
提出RaWMPC,无需专家监督,通过风险感知预测控制实现自主驾驶的泛化能力。
Jiangxin Sun, Feng Xue, Teng Long 等
ToProVAR通过三维熵感知语义分析和稀疏优化实现3.4倍加速。
Jiayu Chen, Ruoyu Lin, Zihao Zheng 等
提出LegoOcc,基于语言嵌入高斯模型实现室内场景单目开源占用预测,IoU达59.50。
Changqing Zhou, Yueru Luo, Han Zhang 等
提出PhysicEdit,通过物理状态转移建模实现更真实的图像编辑,提升物理合理性5.9%。
Liangbing Zhao, Le Zhuo, Sayak Paul 等
LongVideo-R1通过层级推理与目标导向导航,实现低成本长视频理解,提升效率与准确率。
Jihao Qiu, Lingxi Xie, Xinyue Huo 等
提出SimLBR,通过Latent Blending Regularization实现对真实图像的紧决策边界,显著提升跨生成器泛化能力。
Aayush Dhakal, Subash Khanal, Srikumar Sastry 等
MeanFuser采用高斯混合噪声和MeanFlow实现端到端多模态轨迹生成,提升效率与鲁棒性。
Junli Wang, Yinan Zheng, Xueyi Liu 等
JavisDiT++通过MS-MoE和TA-RoPE实现高质量音视频生成,超越现有方法。
Kai Liu, Yanhao Zheng, Kai Wang 等
SymPL框架通过符号化布局显著提升视觉语言模型的空间推理能力,尤其在allocentric视角下。
Jaeyun Jang, Seunghui Shin, Taeho Park 等
UniMatch通过粗到细的语言引导实现跨类别3D形状匹配,显著提升匹配精度。
Qinfeng Xiao, Guofeng Mei, Bo Yang 等
SafeDrive结合稀疏世界模型与细粒度安全推理,实现端到端驾驶的高安全性,PDMS达91.6%。
Jungho Kim, Jiyong Oh, Seunghoon Yu 等
VETime通过视觉-时间对齐和动态融合,实现零样本时间序列异常检测,显著提高定位精度。
Yingyuan Yang, Tian Lan, Yifei Gao 等
提出自监督语义桥(SSB)框架,结合外部语义先验实现无配准图像转换,超越现有Diffusion方法。
Jiaming Liu, Felix Petersen, Yunhe Gao 等
研究揭示视觉语言模型在非文本视觉元素的空间推理中存在局限,文本识别路径表现优于视觉路径。
Yuval Levental
研究通过视觉提示优化框架,揭示视觉-语言模型的决策偏好,实验显示优化可显著改变选择概率。
Manuel Cherep, Pranav M R, Pattie Maes 等
EditCtrl通过局部和全局控制模块实现实时视频生成编辑,计算效率提升10倍。
Yehonathan Litman, Shikun Liu, Dario Seyb 等
AnchorWeave通过检索局部空间记忆显著改善长时视频生成的一致性。
Zun Wang, Han Lin, Jaehong Yoon 等
DriveFine结合掩码扩散模型与自我修正,实现高精度稳健的自动驾驶决策。
Chenxu Dang, Sining Ang, Yongkang Li 等
提出多尺度动力学机制和高斯序列表示,提升单目视频4D重建精度。
Can Li, Jie Gu, Jingmin Chen 等