TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2通过多模态大语言模型实现长视频多区域时间定位,采用基于Wasserstein距离的奖励机制,显著优于现有模型。
Yuhan Zhu, Changlian Ma, Xiangyu Zeng 等
TimeLens2通过多模态大语言模型实现长视频多区域时间定位,采用基于Wasserstein距离的奖励机制,显著优于现有模型。
Yuhan Zhu, Changlian Ma, Xiangyu Zeng 等
EditCLEVR: 提供对象中心表示的组合忠实性基准,评估语义编辑后的表现。
Anuraag Gadehothur Karnam, Tarunesh Sathish
提出ParaCAD,基于自回归模型直接生成支持原生参数曲面的B-Rep,提升几何精度。
Dafei Qin, Rui Xu, Zeyu Shen 等
提出PSDPO方法,在VideoPhy-2上物理合理性提升至2倍,同时保持VBench上的语义一致性。
Siwei Meng, Yawei Luo, Shu Zhang 等
提出跨分支冲突保护框架CCS,有效阻止面部身份被未授权编辑,提升保护强度。
Weiwei Tan, Junxian Li, Rui Wang 等
Scene-SAM3D在不需微调的情况下,提升多视角3D场景生成质量,Replica数据集上CD减少43.8%。
Yuqi Zhang, Yadan Luo, Xiangyu Sun 等
提出PAVXploreRL,通过奖励驱动训练显式优化物理合理性、动作遵循和视觉保真,提升世界模型性能。
Han Wang, Zijun Wang, Shuoshuo Xue 等
基于耦合神经形状(CNS)表示的类别无关3D编辑框架,结合神经特征体积优化。
Jingyu Hu, Weilong Yan, Zhengzhe Liu 等
MDND结合可微与不可微方法,实现形状对应的无监督学习,显著提升非等距形状的匹配精度。
Qinsong Li, Jing Meng, Haibo Wang 等
提出IoU-PD,利用真实边界框作为训练中的特权信息,提升多模态大模型的视觉定位精度。
Xiuyuan Zhu, Ke Lu, Hao Wu 等
TanGO利用切空间指导和优化,实现无训练3D编辑,显著减少结构伪影。
Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo 等
HyMobileAgent通过数据与环境共扩展实现高效GUI代理,AndroidWorld成功率82.6%。
Hy Vision Team, Huawen Shen, Zhengyang Tang 等
AdaTurn通过预算感知的测试时刻调节显著提升低预算下的视觉推理性能。
Susan Liang, Chao Huang, Filippos Bellos 等
Uni-AdaVD通过正交值分解实现视觉生成中的概念擦除,实验表明其在多种生成模型上表现优异。
Qifan Zhou, Yuan Wang, Yanbin Hao 等
G2SR利用多视几何实现快速、低存储的高精度Gaussian表面重建,达69-89次/秒。
Dasong Gao, Vivienne Sze, Sertac Karaman
提出GMoT模块,通过运动感知和门控机制提升微表情视频推理性能,达成67.32% Top-1准确率。
Taorui Wang, Wei Xia, Hui Ma 等
UniPhys通过统一物理语义自动生成仿真资产,构建了40K规模数据集,达成状态最优。
Xian Li, Rong Wei, Lujie Yang 等
FOLIO是一种无训练的流媒体视频语义记忆系统,结合短期视觉缓冲与长时语义组织,提升理解精度。
Haoyang Fan, Dhruv Parikh, Anvitha Ramachandran 等
提出Hy-Embodied-VLM-1.0,结合动作中心能力分类,优化预训练数据和模型架构,显著提升实体代理的多任务表现。
Ziyi Wang, Xumin Yu, Yongming Rao 等
UniVR以VR-GRPO直接在视觉空间学习推理,在VR-X上较Emu3.5提升18.4%。
Zhongwei Ren, Yunchao Wei, Yao Zhao 等