StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views
StructSplat是一种无需相机参数的端到端3D高斯重建框架,显著优于现有方法。
Jia-Chen Zhao, Beiqi Chen, Xinyang Chen 等
StructSplat是一种无需相机参数的端到端3D高斯重建框架,显著优于现有方法。
Jia-Chen Zhao, Beiqi Chen, Xinyang Chen 等
提出并实现了并行展开近似法(PRA),在ImageNet-1K上实现了1.94的FID。
Jiayi Xu, Di He, Guolin Ke
提出了一种名为CSD的内容感知推测解码算法,在MS-COCO上加速图像生成4.33倍。
Mingcheng Wang, Junbo Qiao, Yunchen Li 等
Video-MME-Logical基准测试揭示了MLLMs在视频时序逻辑推理上的显著差距。
Hohin Kwan, Hongyu Li, Ray Zhang 等
VulcanVoxel通过3D占用场重建刀片插入的空间可行性,提升到达率至0.89。
Tianyu Li, Harpreet Sawhney, Minju Jung 等
SAM2Matting将VOS追踪器扩展至高保真视频抠图,单纯图像训练实现SOTA性能。
Ruiqi Shen, Guangquan Jie, Chang Liu 等
提出DexAC-WM结构化动作表示,解决高维动作异质性,显著提升高-DoF世界模型性能。
Zizhao Yuan, Zhengtu Liang, Taowen Wang 等
提出迭代自我提升的安全码本,利用模型自我判断改善生成安全性。
Yunqi Xue, Zhijiang Li, Philip Torr 等
SubdivAR通过自回归预测提升网格细分精度,减少Hausdorff距离18.8%。
Huipeng Guo, Zikai Song, Hang Long 等
Unison通过内部一致性、引导理解与生成、互惠增强等指标,系统评估统一多模态模型的协同理解与生成能力。
Jinyu Liu, Xincheng Shuai, Henghui Ding 等
提出SharpMoE,通过利用干净潜在特征实现高精度路由,显著提升视觉生成性能。
Haoyou Deng, Keyu Yan, Chaojie Mao 等
PortraitGen以真实样本驱动GRPO,并结合OmniReward与AI-Portrait,在1000张PortraitBench上显著提升人像真实感。
Xiaomin Li, Qian Liang, Yinan Li 等
引入PhysEditWorld,基于UE5重放实现物理参数(如重力)可控的游戏场景数据集,支持物理编辑与模型评估。
Bin Hu, Yanwen Ma, Jiehui Huang 等
提出DiCoBench,基于高分辨率多图差异与共性视觉线索的细粒度感知基准,挑战现有多模态大模型。
Geng Li, Yuxin Peng
提出PhyEditBench,基于真实视频的物理推理评估,揭示现有模型在物理理解上的不足。
Shengbin Guo, Shaokang He, Chaoyue Meng 等
基于物理信息神经网络的自监督学习模型SimPhysNet,实现激光焊穿透预测,使用200张标注图像达96.06%准确率。
Sen Li, Xiaoying Liu, Xiaojian Xu 等
UniTeD提出联合时间扩散模型,实现感知与规划的端到端融合,显著提升鲁棒性。
Bo Zhao, Xinting Zhao, Naifan Li 等
提出SSMNBench,基于单视角充分性与多视角必要性诊断多模态大语言模型的跨视角理解能力。
Tianchen Guo, Chen Liu, Ling Chen 等
LCG利用稀疏关系注意力生成长上下文一致图像,提升一致性和可扩展性。
Zihao Wang, Yijia Xu, Haoze Zheng 等
ScaleHP通过显式实例尺度优化相机空间手势估计误差,FreiHand数据集CS-MPJPE达35.8mm。
Ruitao Jing, Xingyu Chen, Hongyang Li 等