RealX3D: A Physically-Degraded 3D Benchmark for Multi-view Visual Restoration and Reconstruction
RealX3D通过多视角视觉恢复和重建基准测试,展示在物理退化下的显著性能下降。
Shuhong Liu, Chenyu Bao, Ziteng Cui 等
RealX3D通过多视角视觉恢复和重建基准测试,展示在物理退化下的显著性能下降。
Shuhong Liu, Chenyu Bao, Ziteng Cui 等
提出CME-CAD框架,结合多专家强化学习实现高精度可编辑CAD代码生成,基于17300+实例数据。
Ke Niu, Haiyang Yu, Zhuofan Chen 等
提出DA360,基于ViT学习尺度偏移,实现360°全景深度的尺度不变估计,生成高质量点云。
Hualie Jiang, Ziyang Song, Zhiqiang Lou 等
提出了一种基于视觉自回归(VAR)的单目深度估计方法,仅需74K样本微调,取得了室内数据集的最新性能。
Amir El-Ghoussani, André Kaup, Nassir Navab 等
Dream-VL和Dream-VLA利用扩散语言模型实现视觉-语言和视觉-语言-动作任务的突破。
Jiacheng Ye, Shansan Gong, Jiahui Gao 等
CoAgent采用计划-合成-验证-编辑流程,利用实体记忆和闭环反馈显著提升长视频的连贯性与视觉一致性。
Qinglin Zeng, Kaitong Cai, Ruiqi Chen 等
VULCAN利用工具增强多智能体实现3D物体多步布局,显著优于基线。
Zhengfei Kuang, Rui Lin, Long Zhao 等
Yume-1.5采用联合时空-通道建模(TSCM)实现长视频生成,提升推理速度和稳定性,达成实时交互效果。
Xiaofeng Mao, Zhen Li, Chuanhao Li 等
AutoPP通过统一设计和元素渲染实现自动生成与优化产品海报,利用IDPO提升CTR。
Jiahao Fan, Yuxin Qin, Wei Feng 等
GeCo通过融合运动和深度先验,提供几何一致性评估,揭示视频生成中的失真和遮挡不一致。
Leslie Gu, Junhwa Hur, Charles Herrmann 等
SemanticGen通过在语义空间生成视频,提升长视频生成速度与质量,采用双阶段Diffusion模型。
Jianhong Bai, Xiaoshi Wu, Xintao Wang 等
本研究首次系统分析视频扩散Transformer(DiT)特征在点追踪中的鲁棒性,发现其优于ResNet,提出DiTracker实现高效零样本追踪。
Soowon Son, Honggyu An, Jisu Nam 等
CRAFT框架通过连续推理和反馈调优显著提升多模态文本到图像生成的准确性和可控性。
V. Kovalev, A. Kuvshinov, A. Buzovkin 等
提出OpenBench基准,利用多传感器数据评估MLLMs的空间推理能力,发现其在开放环境中表现不足。
Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang 等
VA-π通过变分策略对像素生成模型进行后训练优化,显著提升FID至7.65,改善图像质量。
Xinyao Liao, Qiyuan He, Kai Xu 等
StoryMem通过Memory-to-Video机制,将预训练单镜头扩散模型转化为多镜头长视频讲故事工具,显著提升跨镜头一致性。
Kaiwen Zhang, Liming Jiang, Angtian Wang 等
Signal-SGN++通过拓扑增强的时间-频率脉冲图网络实现骨架动作识别,能耗显著降低。
Naichuan Zheng, Xiahai Lun, Weiyi Li 等
RadarGen利用扩散模型,从多视角摄像头生成逼真的汽车雷达点云,结合BEV表示与预训练模型引导。
Tomer Borreda, Fangqiang Ding, Sanja Fidler 等
Mitty基于扩散变换器实现端到端人类示范视频到机器人执行视频的生成。
Yiren Song, Cheng Liu, Weijia Mao 等
提出LongShOTBench,结合长视频多模态推理,采用基于评分的诊断机制,评估105模型,最高达66.64%。
Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou 等