Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation
Vorch-IR是一种支持单人和双人多模态身份替换的统一视频生成框架,基于LTX2模型实现。
Yaole Wang, Xiaoyu Chen, Xin Ma 等
Vorch-IR是一种支持单人和双人多模态身份替换的统一视频生成框架,基于LTX2模型实现。
Yaole Wang, Xiaoyu Chen, Xin Ma 等
提出CoCo-IR任务及TIE模型,基于大规模多模态模型实现多轮上下文图像检索,单轮mAP达39.4,四轮R@1达44.1。
Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding 等
提出AV-MSF,通过多视角图像和少量冲击声,实现物体冲击声的物理可解释重建,性能优于现有方法。
Zisen Shao, Zihao Wei, Derong Jin 等
利用基础视觉模型实现跨物种动物姿态追踪,超越传统标注依赖。
Le Li, Daniela Ivanova, Nicolas Pugeault
MAGIC框架结合图结构标签传播与几何校准,有效缓解SSCIL中的特征漂移与标签不可靠问题。
Yousef Abdi, Mohammad Asadpour, Yousef Seyfari
ToolArtist通过后训练的统一多模态模型,实现动态协调推理、工具调用与图像生成,显著优于固定流程方法。
Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun 等
提出CLIP-CC-Bench,用于评估长篇视频描述的语义匹配,结合五模型集成,覆盖17个视频理解模型。
Mukhtiar Ali, Harsh Dubey, Sugam Mishra 等
DyLaR通过动态潜在推理提升视频问答准确率至58.2%,每个查询生成少于20个词。
Haotian Xia, Zilin Xiao, Junbo Zou 等
AgenticVAU采用多智能体探索验证,提升视频异常理解准确率,超越零-shot和强化学习基线。
Yuxiang Duan, Huining Li, Ao Li 等
SEER以查询特定证据提升空间分类,GQA冻结测试较Full提升3.94个百分点。
Feixiang Liu, Likun Wang, Qiang Qiu 等
使用测试时增强技术提高表格到图像分类器在分布转移下的鲁棒性,复合策略效果最佳。
Malena Loza, Felipe Grijalva, Eva Milara 等
提出结构引导Transformer(SGFormer),通过Triple-Structure-Attention模块提升局部特征匹配的鲁棒性,显著缓解注意力偏离问题。
Runyu Zhu
EditFlow3D实现了3D资产的自动局部编辑,同时保持轨迹一致性。
Rui Nie, Chuang Wang, Haitao Zhou 等
提出基于Rank增强线性注意的统一融合框架,适应不同光学配置,PSNR达34-40dB。
Yiming Gong, Kai Wang
V-FIND通过定位稀疏神经元,提升视频伪造检测性能,达成外部基准的高准确率。
Shichao Kan, Chengpeng Hong, Jingtong Dou 等
提出In-Context Collapse机制,利用适配器修复视觉-语言融合中的崩溃问题,显著提升16-shot准确率。
Mohammad Rostami
ChunkVAE通过局部块压缩和拼接实现高效3D建模,支持从512³到1536³的分辨率扩展。
Kaiyi Zhang, Zhihao Liang, Haolin Liu 等
AdaThinkV通过自适应策略优化视频推理中的Token使用,提升准确率至40.79%,节省22.7%Token。
Jingqi Tian, Haoji Zhang, Lin Chen 等
提出SpatioLM,通过非侵入式模块提升VLM空间推理能力,达成71.6分。
Jing Wu, Jianhua Wu, Jiayi Guan 等
提出PartMat,基于单一全局潜在空间实现材质感知的3D零件分解,显著提升准确性与效率。
Guangming Fu, Jin Song, Yiyun Fei 等