Causally Steered Diffusion for Automated Video Counterfactual Generation
提出CSVC框架,利用因果知识引导扩散模型生成具有因果一致性的反事实视频,提升效果与质量。
Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios 等
提出CSVC框架,利用因果知识引导扩散模型生成具有因果一致性的反事实视频,提升效果与质量。
Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios 等
结合大语言模型(如GPT-3)与图像分割技术,提出面向智能交通的多模态方法,显著提升场景理解能力。
Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma
Vid-CamEdit通过生成渲染和几何估计实现视频相机轨迹编辑,提升了新视角视频生成的质量。
Junyoung Seo, Jisang Han, Jaewoo Jung 等
TR2M利用图像和文本预测像素级尺度变换,将相对深度转为绝对深度,提升跨域泛化能力。
Beilei Cui, Yiming Huang, Long Bai 等
提出基于三平面的多摄像头标记策略,减少72% tokens,提升50%推理速度。
Boris Ivanovic, Cristiano Saltori, Yurong You 等
提出DAVID-XR1,结合细粒度缺陷标注与链式推理,实现可解释的AI生成视频检测,提升泛化能力。
Yifeng Gao, Yifan Ding, Hongyu Su 等
结合SAM和双层遮挡模型,实现X光违禁品的高精度遮挡感知实例分割。
Yunhan Ren, Ruihuang Li, Lingbo Liu 等
提出QuadricFormer,基于超二次曲面实现高效3D场景占据预测,性能优于现有方法。
Sicheng Zuo, Wenzhao Zheng, Xiaoyong Han 等
VINCIE模型通过视频学习上下文图像编辑,取得多轮编辑基准的领先成绩。
Leigang Qu, Feng Cheng, Ziyan Yang 等
CreatiPoster通过多层协议模型生成可编辑的图形设计,结合背景合成实现高质量多样化输出。
Dexiang Hong, Zhao Zhang, Weidong Chen 等
VRBench评估长视频多步推理能力,包含960个视频和8,243个问答对。
Jiashuo Yu, Yue Wu, Meng Chu 等
VideoExplorer通过动态推理和时间定位实现长视频理解,显著优于现有方法。
Huaying Yuan, Zheng Liu, Junjie Zhou 等
用Rectified Flow把3D手部轨迹变成声音,听感常与真声难分。
Yiming Dou, Wonseok Oh, Yuqing Luo 等
提出双体积包装策略实现高效部分级3D生成,无需分割先验。
Jiaxiang Tang, Ruijie Lu, Zhaoshuo Li 等
提出4DGT基于4D高斯变换器的动态场景重建模型,完全在真实单目视频上训练,显著提升重建速度和效果。
Zhen Xu, Zhengqin Li, Zhao Dong 等
提出Self Forcing,通过自回归展开训练,解决视频生成中的暴露偏差,实现实时流媒体生成,性能优于传统方法。
Xun Huang, Zhengqi Li, Guande He 等
ZeroVO算法在多种环境下实现零样本泛化,提升30%以上。
Lei Lai, Zekai Yin, Eshed Ohn-Bar
SpatialLM结合点云与大模型,提出结构化室内场景理解,达布局估算和3D检测新高。
Yongsen Mao, Junhao Zhong, Chuan Fang 等
ReCogDrive结合VLM和扩散规划器,实现端到端自主驾驶,提升安全性和稳定性。
Yongkang Li, Kaixin Xiong, Xiangyu Guo 等
提出VLM4TS结合ViT4TS实现无训练TSAD,F1提升24.6%。
Zelin He, Sarah Alnegheimish, Matthew Reimherr