CAD-Coder: An Open-Source Vision-Language Model for Computer-Aided Design Code Generation
提出CAD-Coder,基于LLaVA微调的开源视觉语言模型,能直接生成可编辑的CadQuery代码。
Anna C. Doris, Md Ferdous Alam, Amin Heyrani Nobari 等
提出CAD-Coder,基于LLaVA微调的开源视觉语言模型,能直接生成可编辑的CadQuery代码。
Anna C. Doris, Md Ferdous Alam, Amin Heyrani Nobari 等
提出CP-GS框架,通过逐步扩展单视角参考图像,实现多视角一致的3D高斯点云个性化,显著优于现有方法。
Yuxuan Wang, Xuanyu Yi, Qingshan Xu 等
Sparc3D结合稀疏变形Marching Cubes与稀疏卷积VAE,实现高分辨率3D模型重建。
Zhihao Li, Yufei Wang, Heliang Zheng 等
UniVG-R1结合推理和强化学习,提升多模态视觉定位,性能提升9.1%。
Sule Bai, Mingxing Li, Yong Liu 等
提出Pensieve两阶段训练策略,无需标定参数,实现高质量新视角合成。
Ruoyu Wang, Yi Ma, Shenghua Gao
CoSeP利用类别可分性空间进行剪枝,通过聚类自动确定层级剪枝比例,提升模型效率。
David Levin, Gonen Singer
PI-VAD通过多模态增强RGB特征,在三大数据集上实现视频异常检测的最先进精度。
Snehashis Majhi, Giacomo D'Amicantonio, Antitza Dantcheva 等
BusterX利用MLLM进行视频伪造检测,采用200K高质量数据集和强化学习,显著提升检测准确率和解释能力。
Haiquan Wen, Yiwei He, Zhenglin Huang 等
LogicOCR通过自动生成多样化图像,评估LMM在文本丰富图像中的逻辑推理能力,达成73%的生成成功率。
Maoyuan Ye, Haibin He, Qihuang Zhong 等
ContextAR模型通过多条件嵌入实现高效图像生成,超越扩散模型。
Yixiao Chen, Zhiyuan Ma, Guoli Jia 等
SpatialCrafter通过视频扩散模型从稀疏视图重建3D场景,提升重建精度。
Songchun Zhang, Huiyao Xu, Sitong Guo 等
EgoDex利用Apple Vision Pro采集829小时多任务手部动作视频,推动机器人学习复杂操控。
Ryan Hoque, Peide Huang, David J. Yoon 等
DPSeg结合双重提示和代价体积学习,显著提升开集语义分割性能。
Ziyu Zhao, Xiaoguang Li, Linjia Shi 等
提出Prior Depth Anything框架,结合稀疏测量和深度预测,生成高精度密集的度量深度图。
Zehan Wang, Siyu Chen, Lihe Yang 等
MathCoder-VL以代码对齐视觉与数学,在MathVista几何子集达73.6%。
Ke Wang, Junting Pan, Linda Wei 等
MIRAGE基准测试评估模型在计数、关系和计数与关系任务上的空间感知能力。
Chonghan Liu, Haoran Wang, Felix Henry 等
ResULIC结合语义残差编码与压缩感知扩散模型,实现极低比特率图像压缩,LPIPS和FID节省超66%。
Anle Ke, Xu Zhang, Tong Chen 等
本文提出DanceGRPO,基于稳定的Group Relative Policy Optimization(GRPO)框架,有效提升视觉生成模型在多任务、多场景下的强化学习性能,实验中最高提升达181%。
Zeyue Xue, Jie Wu, Yu Gao 等
Step1X-3D通过混合VAE-DiT和扩散模型生成高质量可控的3D资产,数据集达200万。
Weiyu Li, Xuanyang Zhang, Zheng Sun 等
Seed1.5-VL结合532M视觉编码器与20B参数Mixture-of-Experts实现多模态理解,达38项SOTA。
Dong Guo, Faming Wu, Feida Zhu 等