EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction
EfficientViT通过多尺度线性注意力实现高分辨率密集预测,GPU延迟减少13.9倍。
Han Cai, Junyan Li, Muyan Hu 等
EfficientViT通过多尺度线性注意力实现高分辨率密集预测,GPU延迟减少13.9倍。
Han Cai, Junyan Li, Muyan Hu 等
提出3DILG,用不规则潜在网格提升3D形状重建与生成效果。
Biao Zhang, Matthias Nießner, Peter Wonka
Imagen利用大规模预训练Transformer文本编码器与扩散模型结合,实现7.27的SOTA FID,显著提升图像质量。
Chitwan Saharia, William Chan, Saurabh Saxena 等
提出深度迁移学习框架,解决图像分类中源目标数据差异问题,提升少样本性能。
Jo Plested, Musa Phiri, Tom Gedeon
提出标签不变增强策略,在图表示空间中生成最难样本,提升半监督图分类性能。
Han Yue, Chunhui Zhang, Chuxu Zhang 等
提出区域感知度量学习(RAML)结合Meta-Channel Aggregation(MCA),在开源语义分割中实现SOTA性能。
Hexin Dong, Zifan Chen, Mingze Yuan 等
FRIH算法通过细粒度区域感知实现图像谐调,在iHarmony4数据集上PSNR达38.19 dB。
Jinlong Peng, Zekun Luo, Liang Liu 等
提出SparseTT,用稀疏Transformer提升目标追踪精度,达40FPS,训练时间缩短75%。
Zhihong Fu, Zehua Fu, Qingjie Liu 等
FixNet通过物理模拟和功能预测修复3D对象,提升准确率62.3%。
Yining Hong, Kaichun Mo, Li Yi 等
提出自校准光照(SCI)框架,实现低光照图像快速、稳健增强,显著提升质量与效率。
Long Ma, Tengyu Ma, Risheng Liu 等
提出sim-2-sim迁移方法,提升VLN-CE成功率12%,采用VLN BERT模型实现。
Jacob Krantz, Stefan Lee
ELEVATER是首个评估语言增强视觉模型的基准和工具包,涵盖55个数据集和多种效率指标。
Chunyuan Li, Haotian Liu, Liunian Harold Li 等
提出自混合图像(SBI)用于深伪检测,提升跨域泛化能力。
Kaede Shiohara, Toshihiko Yamasaki
提出对比式数据采集平衡ArtEmis,提升情感描述的细节与多样性。
Youssef Mohamed, Faizan Farooq Khan, Kilichbek Haydarov 等
提出两阶段模型:利用CLIP潜在空间生成图像,提升多样性与细节控制。
Aditya Ramesh, Prafulla Dhariwal, Alex Nichol 等
TopFormer采用多尺度Token金字塔结构,提升移动端语义分割精度5%,实现低延迟。
Wenqiang Zhang, Zilong Huang, Guozhong Luo 等
提出NAFNet,无需非线性激活函数,超越SOTA,PSNR在GoPro达33.69dB,成本仅8.4%。
Liangyu Chen, Xiaojie Chu, Xiangyu Zhang 等
UniCL方法在图像-文本-标签空间实现统一对比学习,零样本识别提升14.5%。
Jianwei Yang, Chunyuan Li, Pengchuan Zhang 等
提出视频扩散模型,结合3D U-Net架构,实现高质量长视频生成。
Jonathan Ho, Tim Salimans, Alexey Gritsenko 等
提出开源视觉地理定位基准框架,分析不同组件对性能和资源的影响。
Gabriele Berton, Riccardo Mereu, Gabriele Trivigno 等