MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second
MoVieS利用像素对齐高斯原语,结合运动显式监督,实现1秒内单目动态场景4D重建。
Chenguo Lin, Yuchen Lin, Panwang Pan 等
MoVieS利用像素对齐高斯原语,结合运动显式监督,实现1秒内单目动态场景4D重建。
Chenguo Lin, Yuchen Lin, Panwang Pan 等
IGD采用多模态理解与生成,基于参数预测与扩散模型,实现可编辑的多场景图形设计。
Yadong Qu, Shancheng Fang, Yuxin Wang 等
提出CoPart基于局部部分潜变量的3D生成框架,利用Partverse数据集实现细粒度控制与多部分一致性。
Shaocong Dong, Lihe Ding, Xiao Chen 等
本研究提出VFMTok,基于冻结视觉基础模型的区域自适应量化,显著提升图像重建与生成质量。
Anlin Zheng, Xin Wen, Xuanyang Zhang 等
RegGS通过3D高斯注册解决稀疏视图重建问题,在RE10K数据集上表现优异。
Chong Cheng, Yu Hu, Sicheng Yu 等
提出STTM无训练加速视频LLMs,利用多粒度时空冗余,提升速度与精度。
Jeongseok Hyun, Sukjun Hwang, Su Ho Han 等
提出LongVideo-Reason数据集及LongVILA-R1框架,结合多模强化学习实现长视频推理,达65.1%准确率。
Yukang Chen, Wei Huang, Baifeng Shi 等
FlexGaussian结合混合精度量化和属性判别剪枝,无需训练实现3D高效压缩,压缩比达96.4%,适用移动端。
Boyuan Tian, Qizhe Gao, Siran Xianyu 等
Tora2通过解耦个性化提取和门控自注意实现多实体视频的外观与运动定制,显著提升细节保留和多模态对齐。
Zhenghao Zhang, Junchao Liao, Xiangyu Meng 等
PaddleOCR 3.0引入PP-OCRv5、PP-StructureV3和PP-ChatOCRv4,提升多语种识别与文档理解能力。
Cheng Cui, Ting Sun, Manhui Lin 等
OpenWorldSAM扩展SAM2,结合多模态嵌入实现开放词汇图像分割,训练仅4.5M参数。
Shiting Xiao, Rishabh Kabra, Yuhang Li 等
DreamVLA通过预测动态区域、深度和语义,建立感知-预测-行动闭环,提升机器人操控性能。
Wenyao Zhang, Hongsi Liu, Zekun Qi 等
Point3R通过显式空间指针记忆实现流式密集3D重建,性能优于或接近SOTA。
Yuqi Wu, Wenzhao Zheng, Jie Zhou 等
LiteReality通过场景理解与模型检索,将RGB-D扫描转化为紧凑逼真的3D场景,支持交互与渲染。
Zhening Huang, Xiaoyang Wu, Fangcheng Zhong 等
DexVLG模型使用单视角RGBD输入预测灵巧抓取姿势,成功率超过76%。
Jiawei He, Danshi Li, Xinqiang Yu 等
Kwai Keye-VL为短视频理解设计的8亿参数多模态模型,结合大规模视频数据与创新训练策略。
Kwai Keye Team, Biao Yang, Bin Wen 等
提出Look-Back方法,通过模型自我引导在推理中隐式“回顾”视觉信息,显著提升多模态推理性能。
Shuo Yang, Yuwei Niu, Yuyang Liu 等
HOI-Dyn框架通过轻量级Transformer模型提升人-物交互生成质量,显著减少物体运动不一致性。
Lin Wu, Zhixiang Chen, Jianglin Lan
提出REG,通过引入高层类别标记,显著提升扩散模型训练速度和生成质量。
Ge Wu, Shen Zhang, Ruijing Shi 等
UniGlyph利用像素级文本分割和自适应引导,提升中英文视觉文本生成的精度与细节。
Yuanrui Wang, Cong Han, Yafei Li 等