VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks
提出VPA-Guard,结合检索增强与自我演化,有效防御视觉提示攻击,降低攻击成功率44.2%。
Yining Sun, Haoyu Kang, Jiajun Wu 等
提出VPA-Guard,结合检索增强与自我演化,有效防御视觉提示攻击,降低攻击成功率44.2%。
Yining Sun, Haoyu Kang, Jiajun Wu 等
提出BLOCK方法,通过替换模型瓶颈层实现对SD3.5等前沿生成模型的概念去除,效果优异。
Aditya Kumar, Pierre Joly, Adam Dziedzic 等
C3-Bench构建了涵盖51个真实场景的多域变化描述基准,结合LLM评估实现细粒度性能分析。
Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim
提出Teach-to-Reason(T2R)框架,通过自我竞争教师和对比监督提升胸部X光VQA中的推理质量。
Xiao Han, Hao Liu, Zhimin Bao 等
FLUX3D利用Diffusion-Aligned Structured Latents和稀疏结构感知扩散框架,实现高保真3D高斯点云生成,显著优于SOTA方法。
Haorui Ji, Weizhe Liu, Hongdong Li 等
TuringViT通过Turing线性注意、VISTA-Curation和动态分辨率预训练,实现高效、低成本的SOTA视觉变换器。
Qiman Wu, Hanlin Chen, Lyujie Chen 等
提出一种基于语义浏览的可控多样性图像生成方法,通过引入丰富文本表示实现结构化、多维度的图像探索。
Sara Dorfman, Maya Vishnevsky, Omer Dahary 等
提出自我过滤的迭代方法,利用CLIP模型在动态筛选数据集上训练,提升视觉-语言模型性能。
Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss 等
InteractiveAvatar利用LSVM和RRM实现长时段视觉一致性与意图感知的实时虚拟人像生成。
Quanyue Song, Yishan He, Yanfei Zhang 等
提出Sol视频推理引擎,利用五大技术实现视频扩散模型的全栈加速,提升2倍性能。
Yitong Li, Junsong Chen, Haopeng Li 等
Multi4D通过多层竞争分配实现高保真动态高斯点云,兼顾运动一致性与细节还原。
Rui Wang, Quentin Lohmeyer, Siyu Tang 等
UnityShots基于LTX-2.3实现多镜头音视频生成,利用双槽记忆和边界门控保持跨镜头一致性。
Jiehui Huang, Yuechen Zhang, Bin Xia 等
提出DVDrive,通过划分视角增强多视角感知,实现Instruction-conditioned轨迹预测,提升精度。
Zijian Fu, Xiangyang Chu, Mengshi Qi 等
用径向基函数网络替代MLP投影头,提升自监督学习的表示质量。
Andreas Schliebitz, Heiko Tapken, Martin Atzmueller
FLM-Occ通过前馈似然最大化提高室内占用预测效率,仅用32个超二次曲面实现3.7倍速度提升。
Guangcheng Chen, Lihuang Fang, Huaqi Tao 等
JanusMesh是一种零样本、快速生成双语义3D视觉幻觉的框架,利用交叉空间去噪实现几何融合,仅需3-5分钟。
Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang 等
UNIEGO采用多教师代理中介,通过层级蒸馏融合九个多模态、多视角和基础模型,显著提升自我中心视频理解性能。
Wenhao Chi, Arkaprava Sinha, Dominick Reilly 等
提出空间推测解码(SSD),通过二维空间预测加速图像自回归生成,最高提速13.3倍。
Shilong Xiang, Zirui Zhang, Lijun Yu 等
CalTennis是一个包含超11百万帧多视角网球视频的基准数据集,用于评估单目到3D姿态估计,揭示深度和足部接触的挑战。
Ilona Demler, Xinran Xie, Blake Werner 等
本研究提出利用自我中心人类视频作为预训练数据源,超越机器人轨迹,提升机器人任务泛化能力。
Juncheng Ma, Jianxin Bi, Yufan Deng 等