Panoptic Out-of-Distribution Segmentation
提出PoDS架构,提升Cityscapes-OOD和BDD100K-OOD数据集的POD-Q指标。
Rohit Mohan, Kiran Kumaraswamy, Juana Valeria Hurtado 等
提出PoDS架构,提升Cityscapes-OOD和BDD100K-OOD数据集的POD-Q指标。
Rohit Mohan, Kiran Kumaraswamy, Juana Valeria Hurtado 等
提出PerCo模型,利用迭代扩散模型实现超低比特率图像无损还原,压缩率达0.003比特/像素。
Marlène Careil, Matthew J. Muckley, Jakob Verbeek 等
提出一种无场景特定外观优化的伪泛化动态视图合成方法,依赖几何和时间一致的深度估计。
Xiaoming Zhao, Alex Colburn, Fangchang Ma 等
OpenLEAF结合LLM和T2I模型,实现高质量图文生成,提升一致性。
Jie An, Zhengyuan Yang, Linjie Li 等
Uni3D利用端到端预训练的2D ViT模型,规模达10亿参数,实现3D点云与图像文本对齐,显著提升多任务性能。
Junsheng Zhou, Jinsheng Wang, Baorui Ma 等
CoinSeg通过对比类别内外的表征,采用多重高斯分布模型,提升增量语义分割性能,实验在Pascal VOC和ADE20K上优于SOTA,长远场景表现突出。
Zekang Zhang, Guangyu Gao, Jianbo Jiao 等
FLATTEN引入光流引导注意力,显著提升文本到视频编辑中的视觉一致性。
Yuren Cong, Mengmeng Xu, Christian Simon 等
提出MAGVIT-v2视频Tokenizer,通过新颖量化方法和共享词表,超越Diffusion模型,提升生成、压缩和识别性能。
Lijun Yu, José Lezama, Nitesh B. Gundavarapu 等
NOPE评估视觉语言模型中的对象幻觉,发现所有模型在NegP数据集上的准确率均低于10%。
Holy Lovenia, Wenliang Dai, Samuel Cahyawijaya 等
MagicDrive利用多视角3D几何控制实现高保真街景生成,提升3D感知任务性能。
Ruiyuan Gao, Kai Chen, Enze Xie 等
通过微调2D扩散模型实现视角感知,Aligning Geometric Priors(AGP)显著提升文本转3D的一致性,达85%以上。
Weiyu Li, Rui Chen, Xuelin Chen 等
GPT-Driver利用GPT-3.5将运动规划转化为语言模型,实现在nuScenes数据集上优异表现,误差仅0.84米。
Jiageng Mao, Yuxi Qian, Junjie Ye 等
DriveGPT4结合多模态大语言模型,实现端到端可解释的自主驾驶,利用BDD-X数据集进行训练,显著优于现有方法。
Zhenhua Xu, Yujia Zhang, Enze Xie 等
LVD利用大语言模型生成动态场景布局,结合无训练指导的扩散模型实现高质量视频生成。
Long Lian, Baifeng Shi, Adam Yala 等
通过GPT-4V(ision)分析多模态模型能力,揭示其在多领域任务中的表现和潜力。
Zhengyuan Yang, Linjie Li, Kevin Lin 等
提出RIS-CQ基准和DUMOGA模型,提升复杂语义理解和目标定位性能。
Wei Ji, Li Li, Hao Fei 等
提出HoloAssist,基于多模态数据的协作任务数据集,用于增强交互式AI助手能力。
Xin Wang, Taein Kwon, Mahdi Rad 等
DreamGaussian利用生成式高斯点云实现高效3D内容生成,2分钟内生成高质量带纹理网格。
Jiaxiang Tang, Jiawei Ren, Hang Zhou 等
Show-1结合像素和潜在扩散模型,实现高效文本到视频生成,GPU内存仅15G。
David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu 等
TinyCLIP通过 affinity mimicking 和 weight inheritance,将CLIP模型压缩50%,保持性能。
Kan Wu, Houwen Peng, Zhenghong Zhou 等