CARTO: Category and Joint Agnostic Reconstruction of ARTiculated Objects
CARTO提出单图像多类别关节无关的3D重建,达20.4%提升。
Nick Heppert, Muhammad Zubair Irshad, Sergey Zakharov 等
CARTO提出单图像多类别关节无关的3D重建,达20.4%提升。
Nick Heppert, Muhammad Zubair Irshad, Sergey Zakharov 等
提出Anti-DreamBooth,通过添加微妙噪声阻止个性化文本到图像模型的恶意训练。
Thanh Van Le, Hao Phung, Thuan Hoang Nguyen 等
EVA-CLIP通过预训练EVA模型、LAMB优化和掩码技术,大幅提升零-shot图像识别性能,最大参数规模达5.0B。
Quan Sun, Yuxin Fang, Ledell Wu 等
WinCLIP在MVTec-AD数据集上实现了91.8%的零样本异常分类AUROC。
Jongheon Jeong, Yang Zou, Taewan Kim 等
提出基于参数混合的平坦极小值优化框架OKDPH,提升在线知识蒸馏的泛化能力。
Tianli Zhang, Mengqi Xue, Jiangtao Zhang 等
YOSO提出单次端到端实时全景分割,采用动态卷积实现高效性能。
Jie Hu, Linyan Huang, Tianhe Ren 等
DBARF通过隐式代价函数自监督优化相机姿态,提升GeNeRF泛化能力。
Yu Chen, Gim Hee Lee
Make-It-3D利用2D扩散模型实现单图高保真3D重建,采用两阶段优化,显著优于先前方法。
Junshu Tang, Tengfei Wang, Bo Zhang 等
DreamBooth3D结合DreamBooth与DreamFusion,从少量图片实现个性化文本到3D生成,达成高质量、可编辑的3D模型。
Amit Raj, Srinivas Kaza, Ben Poole 等
基于Stable Diffusion的零样本文本视频生成方法,利用运动编码和跨帧注意力实现时间一致性。
Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan 等
提出基于域对齐和时空正则的知识迁移策略,有效提升SNN在事件数据上的泛化能力。
Xiang He, Dongcheng Zhao, Yang Li 等
NUWA-XL通过“扩散上的扩散”生成超长视频,推理时间减少94.26%。
Shengming Yin, Chenfei Wu, Huan Yang 等
提出基于部件级隐式表示的级联扩散模型,实现高质量3D形状生成与无条件部分编辑。
Juil Koo, Seungwoo Yoo, Minh Hieu Nguyen 等
提出CAT-Seg基于成本聚合的开放词汇语义分割方法,通过微调CLIP编码器实现对已知和未知类别的像素级识别,显著优于现有方法。
Seokju Cho, Heeseong Shin, Sunghwan Hong 等
Text2Tex利用深度感知扩散模型,从文本提示逐步生成高质量3D纹理。
Dave Zhenyu Chen, Yawar Siddiqui, Hsin-Ying Lee 等
MM-REACT结合ChatGPT与视觉专家,实现多模态推理,突破现有模型限制。
Zhengyuan Yang, Linjie Li, Jianfeng Wang 等
Zero-1-to-3利用扩散模型实现单图3D视角变换与重建,零样本泛化能力强。
Ruoshi Liu, Rundi Wu, Basile Van Hoorick 等
本研究提出基于StyleGAN的抽象素描到逼真图像的解耦训练框架,显著提升生成质量。
Subhadeep Koley, Ayan Kumar Bhunia, Aneeshan Sain 等
提出了一种前瞻性密集视觉可供性方法,提升了可变形物体操作的效率。
Ruihai Wu, Chuanruo Ning, Hao Dong
HIVE通过人类反馈优化指令式视觉编辑,利用奖励模型提升编辑准确性。
Shu Zhang, Xinyi Yang, Yihao Feng 等