MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
MagicMirror通过340K标注数据和GRPO训练的VLM实现细粒度图像伪影评估,显著提升模型缺陷检测能力。
Jia Wang, Jie Hu, Xiaoqi Ma 等
MagicMirror通过340K标注数据和GRPO训练的VLM实现细粒度图像伪影评估,显著提升模型缺陷检测能力。
Jia Wang, Jie Hu, Xiaoqi Ma 等
OnlineHOI框架在Core4D和OAKINK2数据集上实现了在线人-物交互生成与感知的最先进结果。
Yihong Ji, Yunze Liu, Yiyao Zhuo 等
InterAct通过统一优化框架提升3D人-物交互数据质量,数据集扩展至30.70小时。
Sirui Xu, Dongting Li, Yucheng Zhang 等
Dark-ISP通过直接处理Bayer RAW图像提升低光物体检测性能,实验结果优于现有方法。
Jiasheng Guo, Xin Gao, Yuxiang Yan 等
RewardDance通过奖励规模化实现视觉生成模型的性能提升,参数规模达26亿,显著优于SOTA。
Jie Wu, Yu Gao, Zilyu Ye 等
EVDI++利用事件相机进行视频去模糊和插值,提升视频质量。
Chi Zhang, Xiang Zhang, Chenxu Jiang 等
VIRAL方法通过对齐视觉表示提升多模态大模型在视觉任务上的表现,平均提升9.4%。
Heeji Yoon, Jaewoo Jung, Junwan Kim 等
UFC方法通过少量样本实现扩散模型的空间控制,性能接近全监督基线。
Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim 等
FlowSeek结合深度基础模型与运动基,实现低资源高精度光流估计。
Matteo Poggi, Fabio Tosi
提出MDT-dist,用少步蒸馏实现3D流模型,从25步降至1-2步。
Zanwei Zhou, Taoran Yi, Jiemin Fang 等
OneCAT为纯解码器自回归模型,实现多模态理解、生成与编辑,省略外部视觉编码器。
Han Li, Xinyu Peng, Yaoming Wang 等
Kwai Keye-VL 1.5采用慢快视频编码策略,扩展上下文长度至128K,结合多阶段预训练和后训练优化,显著提升视频理解能力。
Biao Yang, Bin Wen, Boyang Ding 等
FantasyHSI通过图形多智能体框架实现任何场景中的4D人类合成,显著提高任务完成度。
Lingzhou Mu, Qiang Wang, Fan Jiang 等
POINTS-Reader采用无蒸馏的两阶段自动化方法,利用合成数据和自我优化,显著提升文档转换性能。
Yuan Liu, Zhongyin Zhao, Le Tian 等
提出GPSToken,利用高斯参数实现图像区域的空间自适应非均匀标记,提升重建与生成性能。
Zhengqiang Zhang, Rongyuan Wu, Lingchen Sun 等
VoxHammer是一种无需训练的3D空间精确、连贯编辑方法,基于逆向轨迹和特征替换。
Lin Li, Zehuan Huang, Haoran Feng 等
Drawing2CAD采用序列到序列模型,从SVG矢量图生成参数化CAD模型。
Feiwei Qin, Shichao Lu, Junhao Hou 等
JCo-MVTON通过多模态扩散变换器实现无掩码虚拟试穿,DressCode数据集上性能领先。
Aowen Wang, Wei Li, Hao Luo 等
UniGen框架通过CoMoE模块和WeaveNet机制实现高效可控图像生成,在Subjects-200K和MultiGen-20M数据集上表现优异。
Guoqing Zhang, Xingtong Ge, Lu Shi 等
MV-RAG结合检索与多视图扩散,有效提升出域概念的3D生成质量。
Yosef Dayani, Omer Benishu, Sagie Benaim