CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
提出CORE框架,通过reranker蒸馏提升多模态大模型的组合推理能力,Rank-KL达82.7%平均。
Tingyu Song, Mingxin Li, Yanzhao Zhang 等
提出CORE框架,通过reranker蒸馏提升多模态大模型的组合推理能力,Rank-KL达82.7%平均。
Tingyu Song, Mingxin Li, Yanzhao Zhang 等
提出WorldReward,基于VLM的配对偏好奖励模型,融合动作一致性与视觉质量评估。
Yibin Wang, Zehan Wang, Junshu Tang 等
使用正交匹配追踪算法在长视频中选择帧,提升6.9分。
Prakhar Khatri
使用自然语言描述图像子集差异,提出AD-Diff Bench基准。
Julian Truetsch, Felix Hauser, Christoph Stiller 等
CoFiE通过粗到细的证据选择框架,在多个基准上实现了效率与准确性的最佳平衡,达到78.86%的准确率。
Jing Jiang, Yiran Ling, Ruonan Li 等
Drive-HWM采用层级慢快世界模型,结合多步未来表示与即时动作预测,显著提升自主驾驶性能。
Zhaoxin Fan, Tianbao Zhang, Wenjun Wu 等
FlashRender通过相机控制的视频MeanFlow实现快速生成渲染,降低采样成本25倍。
Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung
DM-Align联合蒸馏与偏好对齐,4-NFE下VBench达84.40。
Jiuzhou Lin, Junlong Wu, Fei Zuo 等
提出反思感知偏好优化(RA-GRPO),结合逆扩散反射机制提升视觉生成的语义一致性与真实感。
Junlong Wu, Jiuzhou Lin, Jia Sun 等
RoboTok利用3D手轨迹学习互联网视频检索,提升机器人操控示范匹配。
Howard Qian, Yiting Chen, Yunfei Xie 等
SolarWM利用多源数据引擎和原生适配框架,训练长时序视频世界模型,支持实时交互。
Junchao Huang, Guian Fang, Shengju Qian 等
提出RIG-BENCH,系统评估视觉推理生成能力,涵盖四大任务域,揭示模型推理与生成的差距。
Yutong Liu, Nan Huang, Xu Cao 等
SR-Edit通过自我精炼实现区域感知图像编辑,显著提高非编辑区域的保留精度。
Andong Wang, Zehua Chen, Yuxuan Jiang 等
提出VMetaphor-Bench,首次系统评估文本生成视觉隐喻的能力,揭示11个模型在跨域映射上仍存显著挑战。
Chuer Chen, Zichen Wang, Yi He 等
VIPS基于伪仿真评估V2I合作自动驾驶,结合真实数据实现高效鲁棒性测试。
Hoonhee Cho, Jae-Young Kang, Giwon Lee 等
CA-OPD以教师置信度修正学生轨迹,ScreenSpot-Pro提升9.50分,OCRBench-v2英文提升6.72分。
Menghao Li, Linjie Mu, Yin Wang 等
DPA方法通过解耦产品无关的异常表示,实现零样本异常生成,提升检测性能。
Hang Yao, Yansheng Fu, Ming Liu 等
InstEditSeg通过指令驱动的图像编辑实现息肉和皮肤病变的分割,显著提高跨域泛化能力。
Ziquan Liu, Zhewei Zhu, Xuyang Shi
ZipTok3D通过紧凑前缀实现高保真3D重建,ShapeNet仅需一个token。
Mingda Lin, Weijie Wang, Zeyu Zhang 等
SpatialGuard通过结构化布局和验证机制,提升复杂3D空间文本到图像生成的空间一致性。
Ziyun Qian, Zizhi Chen, Yizhou Liu 等