Demystifing Video Reasoning
通过Chain-of-Steps机制,视频生成模型在扩散去噪步骤中展现推理能力。
Ruisi Wang, Zhongang Cai, Fanyi Pu 等
通过Chain-of-Steps机制,视频生成模型在扩散去噪步骤中展现推理能力。
Ruisi Wang, Zhongang Cai, Fanyi Pu 等
MessyKitchens通过MOD算法实现了高精度的单目3D场景重建,显著提升了物体间接触的物理合理性。
Junaid Ahmed Ansari, Ran Ding, Fabio Pizzati 等
SegviGen利用3D生成模型进行3D部件分割,仅需0.32%标注数据即可提升40%交互分割性能。
Lin Li, Haoran Feng, Zehuan Huang 等
M^3方法结合多视图基础模型和单目高斯喷射SLAM,实现64.3% ATE RMSE降低。
Kerui Ren, Guanghao Li, Changjian Jiang 等
PKINet-v2结合异向条形卷积与方形核,实现遥感目标检测的多尺度与几何适应,提升效率与精度。
Xinhao Cai, Liulei Li, Gensheng Pei 等
MSRAMIE利用结构化多模态推理提升多指令图像编辑性能,达成15%以上改进。
Zhaoyuan Qiu, Ken Chen, Xiangwei Wang 等
EVPV以视觉前提可靠性门控PRM,在VisualProcessBench达67.46 Macro-F1,显著提升Best-of-8重排。
Junxin Wang, Dai Guan, Weijie Qiu 等
DualPrim通过正负超二次体实现紧凑的3D重建,提升结构表达能力。
Xiaoxu Meng, Zhongmin Chen, Bo Yang 等
提出了一种GPU并行化的可微分最直测地线算法,提升了3D网格学习的效率和准确性。
Hippolyte Verninas, Caner Korkmaz, Stefanos Zafeiriou 等
PUMA模型在动态环境中实现了6.3%的成功率提升,结合历史光流和世界查询。
Heng Fang, Shangru Li, Shuhan Wang 等
GlyphPrinter通过区域分组直接偏好优化提升字形精度,超越现有方法。
Xincheng Shuai, Ziye Li, Henghui Ding 等
Tri-Prompting方法在多视角主体一致性和运动精度上显著优于Phantom和DaS。
Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen 等
HSImul3R通过物理反馈优化实现稳定的人-场景交互3D重建,显著提升模拟稳定性。
Yukang Cao, Haozhe Xie, Fangzhou Hong 等
FreeTalk是一种情感驱动的3D说话头动画框架,支持任意拓扑结构。
Federico Nocentini, Thomas Besnier, Claudio Ferrari 等
RieMind通过构建几何场景图(3DSG)实现静态室内场景的空间推理,显著优于传统VLM方法,平均提升达16%。
Fernando Ropero, Erkin Turkoz, Daniel Matos 等
提出STALL,无需训练,通过空间-时间似然性检测生成视频,显著优于现有方法。
Omer Ben Hayun, Roy Betser, Meir Yossef Levi 等
VLA-Thinker通过动态图像推理提升视觉-语言-动作模型,在LIBERO上成功率达97.5%。
Chaoyang Wang, Wenrui Bao, Sicheng Gao 等
提出Tucker Adaptation(TuKA)实现多层次导航知识的高阶张量表示,有效支持全日多场景终身VLN。
Xudong Wang, Gan Li, Zhiyu Liu 等
提出RetimeGS,通过显式定义3D高斯的时间行为,有效缓解4D高斯投影中的时间伪影。
Xuezhen Wang, Li Ma, Yulin Shen 等
Visual-ERM通过细粒度视觉奖励提升视觉到代码任务性能,显著超越现有模型。
Ziyu Liu, Shengyuan Ding, Xinyu Fang 等