Swin Transformer V2: Scaling Up Capacity and Resolution
Swin Transformer V2以残差后归一化、余弦注意力和Log-CPB扩展至30亿参数,ImageNet-V2达84.0%。
Ze Liu, Han Hu, Yutong Lin 等
Swin Transformer V2以残差后归一化、余弦注意力和Log-CPB扩展至30亿参数,ImageNet-V2达84.0%。
Ze Liu, Han Hu, Yutong Lin 等
iBOT利用在线分词器进行掩码图像建模,达成82.3%线性探测精度。
Jinghao Zhou, Chen Wei, Huiyu Wang 等
提出RSE-RL模型,利用变分自编码器和软演员-评论家策略,递归提升图像质量,优于传统方法。
Chandrajit Bajaj, Yi Wang, Yunhao Yang
M2CP多模态半监督框架在ModelNet40上仅2%标注即达79.86%准确率。
Zhimin Chen, Longlong Jing, Yang Liang 等
基于HRNet的自监督单目深度估计网络DIFFNet,通过内部特征融合与注意力机制提升KITTI性能。
Hang Zhou, David Greenwood, Sarah Taylor
StyleNeRF结合NeRF与风格生成,实现高分辨率、多视角一致的3D感知图像合成。
Jiatao Gu, Lingjie Liu, Peng Wang 等
提出一种基于Transformer的模型,能快速生成高保真视觉引导声音。
Vladimir Iashin, Esa Rahtu
NeRS通过神经表面表示实现稀疏视角下的真实场景3D重建,保证水密性并建模视角相关反射。
Jason Y. Zhang, Gengshan Yang, Shubham Tulsiani 等
Ego4D利用庞大自我视频数据集,提出多任务理解模型,推动第一人称视觉感知发展。
Kristen Grauman, Andrew Westbury, Eugene Byrne 等
ATISS用自回归Transformer生成室内布局,3D-FRONT上更真实且最快提速8倍。
Despoina Paschalidou, Amlan Kar, Maria Shugrina 等
DiffusionCLIP利用扩散模型实现文本引导的图像操控,提升ImageNet数据集上的表现。
Gwanghyun Kim, Taesung Kwon, Jong Chul Ye
CLIP-Forge通过两阶段训练实现零样本文本生成3D形状,无需配对标签。
Aditya Sanghi, Hang Chu, Joseph G. Lambourne 等
提出基于语言条件的路径点预测模型,提升连续环境下指令导航成功率4%。
Jacob Krantz, Aaron Gokaslan, Dhruv Batra 等
CrossCLR通过引入样本影响性分析改善多模态视频-文本嵌入,显著提升检索和描述性能。
Mohammadreza Zolfaghari, Yi Zhu, Peter Gehler 等
PDC-Net+通过概率模型实现精确的密集对应和置信度估计,提升几何匹配性能。
Prune Truong, Martin Danelljan, Radu Timofte 等
提出Paint4Poem数据集,用于古诗意境绘画生成,结合AttnGAN和MirrorGAN模型进行评估。
Dan Li, Shuai Wang, Jie Zou 等
Pix2Seq将目标检测转为序列生成任务,通过像素输入学习描述目标,达成与专用模型竞争的性能。
Ting Chen, Saurabh Saxena, Lala Li 等
ActionCLIP通过视频文本匹配实现零-shot动作识别,Kinetics-400达83.8%准确率。
Mengmeng Wang, Jiazheng Xing, Yong Liu
HM3D是包含1000个大型真实室内场景的高保真3D数据集,显著优于现有数据集,提升AI导航性能。
Santhosh K. Ramakrishnan, Aaron Gokaslan, Erik Wijmans 等
基于RAFT架构的多层递归场变换,提升立体匹配精度与实时性能。
Lahav Lipson, Zachary Teed, Jia Deng