Wonder3D++: Cross-domain Diffusion for High-fidelity 3D Generation from a Single Image
Wonder3D++利用跨域扩散模型,从单图高效生成高细节3D网格,融合多视角法线与色彩信息。
Yuxiao Yang, Xiao-Xiao Long, Zhiyang Dou 等
Wonder3D++利用跨域扩散模型,从单图高效生成高细节3D网格,融合多视角法线与色彩信息。
Yuxiao Yang, Xiao-Xiao Long, Zhiyang Dou 等
提出Viewpoint学习,通过两阶段微调激活多模态大模型的空间推理能力,利用Viewpoint-100K数据集实现显著提升。
Xiaoyu Zhan, Wenxuan Huang, Hao Sun 等
MotionStream实现单GPU实时视频生成,达29FPS,结合运动控制与长视频推断技术。
Joonghyuk Shin, Zhengqi Li, Richard Zhang 等
GUI-AIMA通过对齐多模态注意力实现高效GUI定位,平均准确率达61.5%。
Shijie Zhou, Viet Dac Lai, Hao Tan 等
VinciCoder通过粗到细视觉强化学习统一多模态代码生成,提升代码执行率和视觉一致性。
Xuanle Zhao, Deyang Jiang, Zhixiong Zeng 等
提出一种基于3D高斯表示和运动扩散先验的对象感知4D人类运动生成框架。
Shurui Gui, Deep Anil Patel, Xiner Li 等
提出分阶段DMD,通过子区间得分匹配,提升多步蒸馏性能,验证在图像视频生成中的优越性。
Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu 等
HyperClick通过自我批判强化学习提升GUI定位的可信度,显著提高了信心对齐。
Shaojie Zhang, Pei Fu, Ruoceng Zhang 等
本研究评估Veo-3视频模型在12个推理维度上的零样本推理能力,发现其在短期空间一致性表现良好,但在长远因果和抽象逻辑方面有限。
Ziyu Guo, Xinyan Chen, Renrui Zhang 等
提出CATG,基于约束流匹配的端到端自主驾驶轨迹生成框架,有效避免模式崩溃,融入安全约束。
Lin Liu, Guanyi Yu, Ziying Song 等
提出PLD框架,通过残差RL和分布感知数据采集,显著提升VLA模型性能。
Wenli Xiao, Haotian Lin, Andy Peng 等
SplitFlow通过流分解与聚合实现无逆向的文本引导图像编辑,提升语义保真度和属性解缠结。
Sung-Hoon Yoon, Minghan Li, Gaspard Beaudouin 等
本研究提出FreeArt3D,无需训练即可利用预训练静态3D扩散模型(如Trellis)实现高质量关节物体生成,结合Score Distillation Sampling扩展至3D-4D空间。
Chuhao Chen, Isabella Liu, Xinyue Wei 等
提出TIRE方法,通过追踪、修补、重投实现个性化3D/4D生成,显著提升身份保持。
Shuhong Zheng, Ashkan Mirzaei, Igor Gilitschenski
提出资源高效的VLAs设计框架,包括模型压缩、训练优化与数据采集,显著降低计算成本。
Zhaoshu Yu, Bo Wang, Pengpeng Zeng 等
提出Video-Thinker,结合grounding与captioning,通过强化学习实现视频推理,显著优于基线模型。
Shijian Wang, Jiarui Jin, Xingjian Wang 等
HoloCine通过窗口交叉注意力和稀疏跨镜头自注意力实现多镜头长视频的全局一致性,显著提升叙事连贯性。
Yihao Meng, Hao Ouyang, Yue Yu 等
提出Open-o3-Video,结合显式时空证据实现视频推理,构建高质量数据集STGR,提升模型性能14.4% mAM。
Jiahao Meng, Xiangtai Li, Haochen Wang 等
UI-Ins通过多视角指令推理提升GUI定位,UI-I2E-Bench上达87.3%。
Liangyu Chen, Hanzhang Zhou, Chenglin Cai 等
提出DaMo,通过神经网络预测多模态大模型微调中的最优数据混合比例,提升性能3.38%。
Kai Shi, Jun Yang, Ni Yang 等