Cognition Transferring and Decoupling for Text-supervised Egocentric Semantic Segmentation
提出CTDN方法,通过文本监督实现自我中心语义分割,显著提升精度。
Zhaofeng Shi, Heqian Qiu, Lanxiao Wang 等
提出CTDN方法,通过文本监督实现自我中心语义分割,显著提升精度。
Zhaofeng Shi, Heqian Qiu, Lanxiao Wang 等
EndoDepth基准评估单目深度预测模型在内窥镜中的鲁棒性,提出mDERS指标和SCARED-C数据集。
Ivan Reyes-Amezcua, Ricardo Espinosa, Christian Daul 等
PPLNs通过参数化分段线性函数提升事件相机的时序视觉推理性能,实验显示在转向预测等任务上表现优异。
Chen Song, Zhenxiao Liang, Bo Sun 等
RNG利用神经高斯点云实现快速可重光的3D重建,支持复杂材质和软边界,训练仅需1.3小时。
Jiahui Fan, Fujun Luan, Jian Yang 等
Emu3通过单一Transformer模型,仅用下一词预测,跨模态性能超越SDXL和LLaVA-1.6。
Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo 等
MinerU利用PDF-Extract-Kit实现多样文档高精度内容提取,结合规则优化。
Bin Wang, Chao Xu, Xiaomeng Zhao 等
Search3D通过层级结构实现开放词汇的3D场景细粒度分割,提升多层次搜索能力。
Ayca Takmaz, Alexandros Delitzas, Robert W. Sumner 等
提出MoGenTS,基于空间-时间联合建模的离散运动生成方法,FID在HumanML3D降低26.6%。
Weihao Yuan, Weichao Shen, Yisheng He 等
Molmo是开源的视觉-语言模型,利用PixMo数据集实现72B参数性能超越闭源模型。
Matt Deitke, Christopher Clark, Sangho Lee 等
提出了一种姿态引导的运动模型,生成细粒度且运动一致的手语视频,显著提高了细节和时间一致性。
Tongkai Shi, Lianyu Hu, Fanhua Shang 等
提出深度估计鲁棒性基准与DERS指标,评估内窥镜模型在合成腐蚀下性能。
An Wang, Haochen Yin, Beilei Cui 等
OneBEV利用单一全景图实现鸟瞰图语义映射,达51.1% mIoU。
Jiale Wei, Junwei Zheng, Ruiping Liu 等
提出一种自下而上的无类别图像分割方法,使用均值漂移聚类,在ADE20K上提升31%。
Sebastian Dille, Ari Blondal, Sylvain Paris 等
基于协方差矩阵的深度学习模型,用于地下埋藏物分类,提升鲁棒性。
Douba Jafuno, Ammar Mian, Guillaume Ginolhac 等
提出Oryx,支持任意分辨率的空间-时间理解,结合OryxViT和动态压缩技术。
Zuyan Liu, Yuhao Dong, Ziwei Liu 等
提出MMSearch,结合MMSearch-Engine实现大模型多模搜索,评估其在14个子领域的性能。
Dongzhi Jiang, Renrui Zhang, Ziyu Guo 等
OmniGen为统一图像生成模型,支持文本到图像、编辑等多任务,架构简洁,具知识迁移能力。
Shitao Xiao, Yueze Wang, Junjie Zhou 等
Playground v3通过深度融合大语言模型(Llama3-8B)实现文本与图像的高精度对齐,显著提升prompt遵循性。
Bingchen Liu, Ehsan Akhgari, Alexander Visheratin 等
提出多模态框架,整合运动、音频和外观特征,在ARGO1M数据集上实现最先进性能。
Cagri Gungor, Adriana Kovashka
提出LoCU框架,系统分析漫画理解中的视觉-语言任务与数据,强调数据稀缺与任务定义不足。
Emanuele Vivoli, Mohamed Ali Souibgui, Andrey Barsky 等