LiveLight: Real-time Streaming Video Relighting with Interactive Control
LiveLight实现实时视频重光照,结合3D光照控制,显著提升用户交互体验。
Yue Ma, Jiangming Wang, Yucheng Wang 等
LiveLight实现实时视频重光照,结合3D光照控制,显著提升用户交互体验。
Yue Ma, Jiangming Wang, Yucheng Wang 等
G-Skin结合2D视觉模型,利用3D高斯骨架控制实现高保真动画,突破数据稀缺难题。
Yuxin Yao, Kendong Liu, Shiqi Zhou 等
MeanFlow方法在极低光与运动模糊下实现统一RAW恢复,提升PSNR达7.42dB。
Zepu Wang, Jingze Liang, Weijie Xiao 等
提出LIA-MTR模块实现线性复杂度跨模态序列路由,提升高分辨率视觉-语言模型性能。
Ashfak Yeafi, Mehedi Hasan, Md Khairul Islam
提出D²-4DGS,结合双重深度先验实现稀疏摄像头下的动态4D高斯点云合成,提升PSNR1.33dB。
Jijian Zhao
STAR-VLM以nuScenes雷达监督训练VLM,速度MAE降至1.20 m/s,运动准确率达0.94。
Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai 等
本研究揭示预训练检测变换器(如DETR)在无3D监督下能线性和非线性编码物体深度与位置信息。
Robin Kim, Colin Samplawski, Benjamin M. Marlin
VaRS-Doc通过潜在自探测实现多样化文档表示,提升视觉文档检索性能,达到最新水平。
Haocheng Wang, Tongkun Guan, Wei Shen 等
提出NovaCov,基于集合选择的流视频令牌压缩方法,保持99.6%准确率,降低46%延迟。
Moxu Duan, Jingwen Fu, Yuwang Wang
AIMold通过MoldCAD数据集实现复杂模具设计的自动化,包含4,934个CAD模型。
Pengyun Qiu, Shuo Wang, Zeyuan Chen 等
严格留院外验证显示:Beta-Binomial与目标逻辑回归优于自适应选择,Brier为0.0853与0.0855。
Pengyang Yu, Yiou Wang, Zhongping Dong 等
提出ID-约束提升单目深度估计在横滚干扰下的鲁棒性,显著改善性能。
Kaihua Tang, Ziqing Xia, Xiaoxu Zheng 等
P2Voxel通过金字塔枢轴体素化实现高效3D网格重建,显著减少存储需求。
Zhenhong Sun, Haozhe Liu, Yifu Wang 等
视频生成器难以推进不可逆过程,提出进展和静止率协议以评估。
Jian Xu, Yanning Wu, Delu Zeng 等
提出FD-loss后训练方法,通过表示空间弗雷切距离优化离散生成器,显著提升图像生成质量。
Jinhua Zhang, Yisong Lin, Wei Long 等
AOCT-MSQR检索框架免训练实现视频溯源,GenVidBench达20.5% Rank-1、16.6% mAP。
Renxi Cheng, Chaolei Han, Jie Gui 等
ShadowDancer通过学习视频与影子对,构建统一动态表示,实现任意动作的帧级控制。
Jin Cao, Zian Meng, Kaipeng Zhang
TARS以高噪声阶段学习相机运动,R-Prec达83.18%、T-Prec达72.76%。
Jiwen Liu, Shujuan Li, Xiaohan Li 等
本研究系统评估194个视觉-语言模型在偏差鲁棒性上的表现,发现模型规模对多属性偏差影响有限,数据质量更关键。
Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos
CineWeaver无需训练,通过位置编码、注意力、分镜路由和锚点记忆实现长时、多镜头、可控视频生成;摘要未给出数值指标。
Yuyang Huang, Yabo Chen, Wenrui Dai 等