Spatial Calibration of Diffuse LiDARs
提出一种基于背景减除的空间校准方法,估算散射式LiDAR像素的有效支持区域及相对空间敏感度。
Nikhil Behari, Ramesh Raskar
提出一种基于背景减除的空间校准方法,估算散射式LiDAR像素的有效支持区域及相对空间敏感度。
Nikhil Behari, Ramesh Raskar
提出WanderDream,通过世界模型实现无主动探索的场景推理,包含15.8K视频和158K问答。
Ruiping Liu, Yufan Chen, Yuheng Zhang 等
LATO通过拓扑保持的稀疏体素VAE,生成高效且结构良好的3D网格。
Tianhao Zhao, Youjia Zhang, Hang Long 等
提出自适应聚合与像素级重缩放技术,提升训练无关扩散分割器的规模化能力,显著增强模型生成能力的利用。
Benyuan Meng, Qianqian Xu, Zitai Wang 等
提出Skeleton-to-Image编码(S2I),利用预训练视觉模型实现异构骨架数据的自监督学习。
Siyuan Yang, Jun Liu, Hao Cheng 等
InnoAds-Composer通过单阶段三条件控制,提升电商海报生成的效率与质量,关键指标提升显著。
Yuxin Qin, Ke Cao, Haowei Liu 等
基于Mip-NeRF架构,结合自适应加权MSE,利用LWIR高光谱数据实现气体羽流3D重建与检测,训练样本减少50%。
Scout Jarman, Zigfried Hampel-Arias, Adra Carr 等
提出VideoHV-Agent,基于假设验证的多智能体框架,提升长视频理解的准确性和可解释性。
Zheng Wang, Haoran Chen, Haoxuan Qin 等
Pointer-CAD通过指针机制解决B-rep模型几何选择问题,将分割误差降低至极低水平。
Dacheng Qi, Chenyu Wang, Jingwei Xu 等
提出VAS指标揭示多模冷启动中注意力偏差,AVAR框架提升7%性能。
Ruilin Luo, Chufan Shi, Yizhen Zhang 等
DriveMVS利用稀疏LiDAR作为几何提示,融合多源信息实现高精度、多视角和时序一致的自主驾驶深度估计。
Qihao Sun, Jiarun Liu, Ziqian Ni 等
InfinityStory以背景一致与多主体转场实现长视频生成,VBench达88.94/82.11。
Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen 等
提出PhyPrompt,基于RL的两阶段提示优化框架,提升物理合理性,7B模型实现40.8%联合成功率。
Shang Wu, Chenwei Xu, Zhuofan Xia 等
MoD-DPO通过解耦模态优化减少跨模态幻觉,提升准确率至88.19%。
Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani
提出RL3DEdit,通过强化学习利用VGGT奖励实现多视角一致的3D场景编辑,提升效率与质量。
Jiyuan Wang, Chunyu Lin, Lei Sun 等
提出BrandFusion多智能体框架,实现文本生成视频中的品牌无缝嵌入,提升识别度和自然性。
Zihao Zhu, Ruotong Wang, Siwei Lyu 等
UniTalking框架通过多模态Transformer块实现高保真语音和同步视频生成,超越现有开源方法。
Hebeizi Li, Zihao Liang, Benyuan Sun 等
FlexiMMT实现多对象多运动转移,使用运动解耦掩码注意机制,提升了23%的运动保真度。
Yuze Li, Dong Gong, Xiao Cao 等
SOLACE通过内在自信信号提升文本生成图像的质量,减少外部监督需求。
Seungwook Kim, Minsu Cho
提出Fourier角度对齐(FAA)提升遥感目标检测中的旋转角度预测精度,实验在DOTA和HRSC数据集取得优异结果。
Changyu Gu, Linwei Chen, Lin Gu 等