H3-World: Turning Language Understanding into World Control
H3-World利用MiniMax-H3视频生成器实现基于自然语言的精确世界控制,无需专门动作模块。
Danze Chen, Zeqing Wang, Ziyue Lin 等
H3-World利用MiniMax-H3视频生成器实现基于自然语言的精确世界控制,无需专门动作模块。
Danze Chen, Zeqing Wang, Ziyue Lin 等
通过层级探测V-JEPA 2和VideoMAE-v2模型中的时空表示,揭示摄像机运动、物理理解和异常检测的编码特性。
Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan 等
Gekko通过比较交叉视图重建误差提升3D特征,无需3D标注,超越CroCo。
Thibaut Loiseau, Guillaume Bourmaud, Vincent Lepetit
TempCloze通过视频中缺失中段识别,揭示视频时序推理的主要瓶颈在对齐能力。
Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu 等
CameraEditor通过视频扩散模型实现相机参数控制,提升几何精度。
Xin Shen, Chengyou Jia, Keshuo Xing 等
通过基础图像模型的单一提示实现水印清洗,显著降低了水印的可靠性。
Jidong Yang, Qi Li, Wei Zong 等
SciGram框架生成1.4M视觉指令,提升科学图解理解性能,超越SOTA。
Raul Ortega, José Manuel Gómez-Pérez
HELIOS通过无监督数据集实现城市场景昼夜光照转换,提升结构一致性。
Hala Djeghim, Nathan Piasco, Luis Roldão 等
提出一种基于相位频谱的攻击框架,在多模态大语言模型上实现了90%以上的攻击成功率。
Daizong Liu, Junhao Dong, Zhiyuan Ma 等
StreamScout通过逐步增强时间线视图,提高流媒体视频理解效率,减少59%令牌消耗。
Ce Zhang, Jing Bi, Jinxi He 等
提出BRF-GS,基于3D高斯点云的高光谱双向反射模型与图像生成,结合混合BRDF核实现复杂方向性反射。
Yiling Yao, Wenjuan Zhang, Bowen Wang 等
DreamX-Creator采用Gated Cross-Modal Attention实现7B模型的2K原生同步音视频生成。
Jiashu Zhu, Yanhao Zheng, Ruitian Tian 等
提出一种基于音频的对抗性防御方法,保护3D说话人脸生成的视觉保真度。
Rui-Qing Sun, Chen-Hao Cui, Hui-Yang Zhao 等
使用LoRA微调的OCR模型将手写陶器记录转为结构化数据,错误率降至1.5%以下。
Gissu Valentina Naghavi, Dominik Hagmann, Martin Kampel 等
Cen-Prune通过中心化几何校正提高视觉标记修剪的多样性,提升LVLMs性能。
Shunjie Wen, Jaeyeon Lee, Dong-Wan Choi
提出离散扩散桥(DDB),通过混合吸收和信息引导噪声调度解决图像生成中的时空错位问题。
Xing Xie, Jiawei Liu, Shijun Zhou 等
RIDGE通过时间信号选择长视频帧,在四个基准上表现最佳。
Shanqing Xu, Meng Luo, Mengchen Qian 等
3D-MRL通过嵌套表示学习提升3D形状的零样本识别精度至50.9%。
Márcus Lobo, Vitor Matias, Jeová Farias 等
RAGDiffusion++通过宏观检索和微观对齐生成高保真服装图像,FID降低14.3%。
Yuhan Li, Xianfeng Tan, Fangao Zeng 等
GoM框架通过场景分离验证和目标扩散适应提高单图像多视图合成的泛化能力,排名第一。
Jie Li, Xingchen Zou, Yuxuan Liang