Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models
提出Fork-Merge Decoding方法,在不额外训练下提升音视频大模型的多模态理解。
Chaeyoung Jung, Youngjoon Jang, Jongmin Choi 等
提出Fork-Merge Decoding方法,在不额外训练下提升音视频大模型的多模态理解。
Chaeyoung Jung, Youngjoon Jang, Jongmin Choi 等
AVCD通过对比解码减少音视频大语言模型中的幻觉,提升了AVHBench数据集上的准确率。
Chaeyoung Jung, Youngjoon Jang, Joon Son Chung
提出ImgEdit数据集与基准,结合多阶段管线训练高质量图像编辑模型,显著优于现有方法。
Yang Ye, Xianyi He, Zongjian Li 等
HunyuanVideo-Avatar通过多模态扩散变压器生成高保真音频驱动的多角色动画。
Yi Chen, Sen Liang, Zixiang Zhou 等
DriveX通过Omni Scene Modeling在自监督下学习场景动态,提升3D点云预测和多任务性能。
Chen Shi, Shaoshuai Shi, Kehua Sheng 等
CreatiDesign结合多条件扩散变换器,实现多源异构元素的高精度图形设计控制。
Hui Zhang, Dexiang Hong, Maoke Yang 等
本综述首次系统分析了基于推理的图像与视频分割方法,涵盖26个最新模型,提出多阶段推理机制与知识融合。
Yiqing Shen, Chenjia Li, Fei Xiong 等
提出CoT-RVS,零样本链式推理视频分割,显著优于现有方法。
Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang
TextFlux为基于DiT的多语种场景文本合成模型,无需OCR,训练数据仅为竞争方法的1%。
Yu Xie, Jielei Zhang, Pengyu Chen 等
提出FSDrive,利用视觉时空链式推理实现自主驾驶中的未来场景预测与轨迹规划。
Shuang Zeng, Xinyuan Chang, Mengwei Xie 等
提出OphNet-3D,基于多视角RGB-D实现眼科手术中手与器械的动态3D重建,达成手势误差2mm,交互误差23%。
Ming Hu, Zhengdi Yu, Feilong Tang 等
Direct3D-S2通过空间稀疏注意力机制实现了高效的3D生成,训练速度提升显著。
Shuang Wu, Youtian Lin, Feihu Zhang 等
CrossLMM通过双重交叉注意机制显著压缩长视频序列,性能几乎不变。
Shilin Yan, Jiaming Han, Joey Tsai 等
KRIS-Bench基于教育认知理论,评估模型在知识推理中的表现,涵盖22任务和7推理维度。
Yongliang Wu, Zonghui Li, Xinting Hu 等
提出OneDC,一步扩散图像压缩,结合语义蒸馏,压缩比降低39%,解码速度提升20倍。
Naifu Xue, Zhaoyang Jia, Jiahao Li 等
通过轻量级微调探测概念擦除方法的可逆性,发现现有方法仅实现表面抑制。
Ping Liu, Chi Zhang
提出Visual CounterFact数据集与PvP机制,控制视觉-知识优先级,模型在颜色和大小预测中99.3%成功转向反事实。
Michal Golovanevsky, William Rudman, Michael Lepori 等
提出像素空间推理框架,结合好奇心驱动强化学习,7B模型在视觉推理任务中达84%最高准确率。
Haozhe Wang, Alex Su, Weiming Ren 等
STAR-R1通过强化学习提升多模态大模型的空间推理能力,跨视图场景下性能提升23%。
Zongzhao Li, Zongyang Ma, Mingze Li 等
BAGEL模型通过大规模多模态预训练实现复杂推理,超越开源模型。
Chaorui Deng, Deyao Zhu, Kunchang Li 等