A Unified Transformer-Based Framework with Pretraining For Whole Body Grasping Motion Generation
提出一种基于Transformer的全身抓取运动生成框架,在GRAB数据集上表现优异。
Edward Effendy, Kuan-Wei Tseng, Rei Kawakami
提出一种基于Transformer的全身抓取运动生成框架,在GRAB数据集上表现优异。
Edward Effendy, Kuan-Wei Tseng, Rei Kawakami
World4Drive通过意图感知的潜在世界模型实现端到端自主驾驶,无需感知标注,提升18.1%的L2误差, collision降低46.7%。
Yupeng Zheng, Pengxuan Yang, Zebin Xing 等
提出Inf-Bench框架评估视觉语言模型的空间变形推理能力,结果显示当前模型在3D任务上表现欠佳。
Jiahuan Zhang, Shunwen Bai, Tianheng Wang 等
提出一种高效的深度和空间变化图像模拟方法,提升了12MP真实场景的去模糊效果。
Xinge Yang, Chuong Nguyen, Wenbin Wang 等
MOVi-MC-AC以六视角视频提供580万实例,支持遮挡分割、内容补全与跨视角重识别。
Alexander Moore, Amar Saini, Kylie Cancilla 等
NavMorph利用自我演化世界模型,提升连续环境下视觉-语言导航的适应性与性能。
Xuan Yao, Junyu Gao, Changsheng Xu
OmniVCus利用多模态控制条件实现多主体视频定制,采用Diffusion Transformer架构。
Yuanhao Cai, He Zhang, Xi Chen 等
VolumetricSMPL通过Neural Blend Weights实现10倍推理速度提升。
Marko Mihajlovic, Siwei Zhang, Gen Li 等
DIVE采用迭代推理结合语义分解,在CVRR-ES基准中达81.44%准确率,夺冠。
Umihiro Kamoto, Tatsuya Ishibashi, Noriyuki Kugo
TR²C以MCR²和时间连续性联合学习表示与亲和矩阵,在五个数据集上达到最高97.96% ACC和98.96% NMI。
Xianghan Meng, Zhengyu Tong, Zhiyuan Huang 等
DFVEdit利用条件差分流向量实现视频零-shot编辑,提升20倍速度,减少85%内存。
Lingling Cai, Kang Zhao, Hangjie Yuan 等
AdaDeDup结合密度与模型反馈,实现大规模目标检测数据的自适应剪枝,有效减少20%数据,性能几乎不变。
Feiyang Kang, Nadine Chang, Maying Shen 等
提出Surfel-Indexed View Memory(VMem)实现长时场景一致性,提升视频生成效率。
Runjia Li, Philip Torr, Andrea Vedaldi 等
本研究提出基于频域波let增强的伪视频检测方法,显著提升模型在多模型和压缩条件下的泛化能力。
Riccardo Corvi, Davide Cozzolino, Ekta Prashnani 等
提出OpenBench评估模型理解开放语义能力,结合OVSNet实现状态最优,显著优于现有方法。
Yong Liu, SongLi Wu, Sule Bai 等
本文揭示视觉语言模型中的新型符号机制,利用空间索引实现对象绑定,解决绑定问题。
Rim Assouel, Declan Campbell, Yoshua Bengio 等
Show-o2模型通过自回归建模和流匹配提升多模态理解与生成能力。
Jinheng Xie, Zhenheng Yang, Mike Zheng Shou
采用多尺度Transformer与频域融合,提升阴影去除性能,PSNR达25.90。
Florin-Alexandru Vasluianu, Tim Seizinger, Zhuyun Zhou 等
Hunyuan3D 2.1通过Hunyuan3D-DiT和Hunyuan3D-Paint生成高保真3D资产,提升了几何细节和材质质量。
Team Hunyuan3D, Shuhui Yang, Mingxin Yang 等
提出PeRL,通过序列置换和多阶段策略提升多图推理的强化学习性能,显著优于基线。
Yizhen Zhang, Yang Ding, Shuoshuo Zhang 等