Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering
引入跨分支语义引导,验证理解与生成空间是否统一,发现理解向生成迁移有效,反向效果有限。
Yu Wang, Sharon Li
引入跨分支语义引导,验证理解与生成空间是否统一,发现理解向生成迁移有效,反向效果有限。
Yu Wang, Sharon Li
MoSAIC通过对齐干预监督实现局部运动风格转移,减少错误并提高响应。
Nazanin Amini, Kevin Desai
MODUS为解码器单一模型,实现任意模态间的多模态预测,支持多任务应用。
Mingqiao Ye, Zhaochong An, Zhitong Gao 等
Argus-Unified利用预训练VLM,采用混合视觉Token实现图像理解与生成,成本低达$2000。
Weiming Zhuang, Jiabo Huang, Jingtao Li 等
I2VShield通过生成对抗攻击保护隐私,减少计算成本,提升DiT模型防御效果。
Yimao Guo, Zuomin Qu, Wei Lu
CLBench-V评估多模态上下文学习,最佳模型得分仅0.2847。
Lai Wei, Chengqi Li, Jiapeng Li 等
PerceptionBench评估多模态大语言模型的视觉感知能力,16个模型最高准确率仅59.7%。
Zichao Lin, Yifeng Xie, Bowen Qu 等
Mage-VL通过Codec驱动的稀疏编码,显著提升实时多模态流感知效率,减少75%视觉Token,达成3.5倍速度提升。
Senqiao Yang, Kaichen Zhang, Zhaoyang Jia 等
CameraAnything通过Plücker光线和3D RoPE实现多维摄像机参数联合控制,支持视角、焦距、分辨率变换。
Yixuan Li, Yanhong Zeng, Ka Leong Cheng 等
仅微调末三层ViT并采用HYBRID16,2B模型16帧达68.8%时序mIoU。
Jiameng Zhang, Srikanth Madikeri
提出MSVS-VAE,基于多尺度锚点VecSet实现高保真3D重建,速度提升10倍,紧凑度提升10倍。
Dehao Hao, Kaiyi Zhang, Tanghui Jia 等
TaoMate采用锚点引导的持久记忆机制,实现长时音视频连续生成,保持一致性和同步。
Qijun Gan, Chenwei Zhang, Meiguang Jin 等
PlanCraft结合逐步草图和空间约束,实现住宅平面布局的自动生成,FID降低61.1%。
Pengyu Zeng, Yuqin Dai, Jun Yin 等
UltraViT通过优化视觉编码器提高设备上大模型的速度,达到1.7倍提升。
Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati 等
SCALE通过自监督生成多层布局文本,结合规则引导提升先进节点局部DRV修复成功率达97%。
Chia-Tung Ho, Haoyu Yang, Guanglei Zhou 等
提出Trans-Unet,通过3D点云到2D映射结合CNN与自注意力,实现脑皱褶高保真预测。
Geran Zhao, Xiaotian Li, Poorya Chavoshnejad 等
提出ConVBench评估复杂视觉推理,结合GRPO强化学习显著提升LVLM一致性与准确率。
Liqiang Jing, Xiong Zhou, Siddharth Varia 等
DAPM模型实现无人机单目深度估计,适用于任意高度、俯仰、滚动和视场,达到最先进性能。
Tong Ling, Wenhui Diao, Yingchao Feng 等
Geo3R是一种无需训练的几何推理框架,有效缓解多模态大模型的空间推理幻觉,提升准确率超10%。
Mingyu Wang, Weilin Jin, Wenbo Li 等
提出ViSTR-Bench,评估多模态大模型在动态场景中空间-时间推理能力,涵盖Motion Perception等四维任务。
Han Li, Si Liu, Zehao Huang 等