Content-Based Search for Deep Generative Models
提出基于内容的深度生成模型检索方法,通过多模态特征匹配优化模型选择。
Daohan Lu, Sheng-Yu Wang, Nupur Kumari 等
提出基于内容的深度生成模型检索方法,通过多模态特征匹配优化模型选择。
Daohan Lu, Sheng-Yu Wang, Nupur Kumari 等
Phenaki模型通过文本生成任意长度视频,使用因果注意力和双向掩码Transformer。
Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans 等
Bayesian Prompt Learning以变分推断正则化提示空间,在15个基准上提升未见提示泛化。
Mohammad Mahdi Derakhshani, Enrique Sanchez, Adrian Bulat 等
VICRegL结合全局与局部特征学习,提升检测与分割性能,保持分类表现。
Adrien Bardes, Jean Ponce, Yann LeCun
Spotlight模型通过视觉语言结合实现移动UI理解,超越现有方法。
Gang Li, Yang Li
提出DINOSAUR,通过自监督特征重建实现无监督对象表示,优于现有模型,能扩展到COCO等真实数据。
Maximilian Seitzer, Max Horn, Andrii Zadaianchuk 等
Make-A-Video方法将文本转为视频,利用文本图像数据和无监督视频数据。
Uriel Singer, Adam Polyak, Thomas Hayes 等
GET3D通过结合差分表面建模与2D GAN,从图像中生成复杂拓扑、高细节的纹理3D网格。
Jun Gao, Tianchang Shen, Zian Wang 等
提出U3HS实现未知类别目标的全景分割,无需先验知识,显著提升未知目标检测能力。
Stefano Gasperini, Alvaro Marcos-Ramiro, Michael Schmidt 等
提出AiRLoc基于强化学习的空中目标定位模型,显著优于启发式方法,能在灾区场景中实现高效搜索。
Aleksis Pirinen, Anton Samuelsson, John Backsund 等
MapTR采用结构化Transformer,基于Permutation-Equivalent建模,实现实时高精度HD地图构建,mAP提升5.0,速度8倍。
Bencheng Liao, Shaoyu Chen, Xinggang Wang 等
DreamBooth通过微调扩散模型,实现少量图片绑定唯一标识,支持多场景生成。
Nataniel Ruiz, Yuanzhen Li, Varun Jampani 等
冷扩散:通过无噪声变换逆转任意图像变换,提升生成模型的多样性。
Arpit Bansal, Eitan Borgnia, Hong-Min Chu 等
使用ViT结合8点算法进行相对姿态预测,提升有限数据下的性能。
Chris Rockwell, Justin Johnson, David F. Fouhey
提出可调节非线性激活的RAN模型,提升硬件效率,RAN-e和RAN-i在ImageNet和硬件上表现优异。
Kartikeya Bhardwaj, James Ward, Caleb Tung 等
RelPose方法通过能量模型预测单物体相对旋转,提升稀疏图像下的3D重建效果。
Jason Y. Zhang, Deva Ramanan, Shubham Tulsiani
MonoViT结合Transformer与卷积,基于自监督学习实现高精度单目深度估计,KITTI性能优越。
Chaoqiang Zhao, Youmin Zhang, Matteo Poggi 等
提出基于交叉注意力控制的Prompt-to-Prompt图像编辑方法,实现无需掩码的文本引导局部和全局编辑。
Amir Hertz, Ron Mokady, Jay Tenenbaum 等
提出文本反演方法,利用少量图片在冻结的文本-图像模型中学习新词嵌入,支持个性化生成。
Rinon Gal, Yuval Alaluf, Yuval Atzmon 等
ViP3D采用3D代理查询实现端到端视觉轨迹预测,显著优于传统方法。
Junru Gu, Chenxu Hu, Tianyuan Zhang 等