VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
VideoAgent2通过不确定性感知的链式推理,提升长视频理解性能,平均超越前沿方法13.1%。
Zhuo Zhi, Qiangqiang Wu, Minghe shen 等
VideoAgent2通过不确定性感知的链式推理,提升长视频理解性能,平均超越前沿方法13.1%。
Zhuo Zhi, Qiangqiang Wu, Minghe shen 等
JarvisIR利用VLM控制多专家修复模型,提升恶劣天气下的自主感知性能,达成50%性能提升。
Yunlong Lin, Zixu Lin, Haoyu Chen 等
ScreenSpot-Pro基于高分辨率专业环境,提出ScreenSeekeR提升GUI定位准确率至48.1%。
Kaixin Li, Ziyang Meng, Hongzhan Lin 等
提出RISEBench基准,评估多模态模型在推理引导的视觉编辑中的表现,最高准确率仅28.8%。
Xiangyu Zhao, Peiyuan Zhang, Kexian Tang 等
SkyReels-A2利用视频扩散变换器实现多元素可控视频生成,保持元素一致性。
Zhengcong Fei, Debang Li, Di Qiu 等
提出WoTE框架,利用BEV世界模型实现端到端自主驾驶中的在线轨迹评估,显著提升性能。
Yingyan Li, Yuqi Wang, Yang Liu 等
Ross3D通过跨视角和全局重建增强3D场景理解,显著优于SOTA,提升性能。
Haochen Wang, Yucheng Zhao, Tiancai Wang 等
SpaceR结合RLVR和地图想象,利用151k数据提升视频空间推理能力,超越GPT-4o。
Kun Ouyang, Yuanxin Liu, Haoning Wu 等
SuperDec利用超二次曲面 primitives 实现3D场景紧凑表示,训练在ShapeNet,泛化到ScanNet++和Replica。
Elisabetta Fedele, Boyang Sun, Leonidas Guibas 等
KOFFVQA: 韩国语言的大型视觉语言模型自由问答基准,提供客观评估。
Yoonshik Kim, Jaeyoon Jung
提出DiT4SR,结合双向注意机制和局部信息注入,有效提升真实场景下图像超分性能。
Zheng-Peng Duan, Jiawei Zhang, Xin Jin 等
提出Magiv3模型,将漫画元素识别与文本生成结合,实现无障碍漫画叙事。
Ragav Sachdeva, Andrew Zisserman
提出增强实例回放(EIR),通过动态类别组合和背景融合,有效缓解持续语义分割中的背景偏移与灾难性遗忘。
Hongmei Yin, Tingliang Feng, Fan Lyu 等
提出Video-R1模型,结合T-GRPO算法和图像视频混合数据,显著提升视频推理性能。
Kaituo Feng, Kaixiong Gong, Bohao Li 等
LeX-Art通过高质量数据合成和模型微调,提升文本图像生成中的文本渲染精度,PNED提升79.81%。
Shitian Zhao, Qilong Wu, Xinyue Li 等
Wan采用扩散变换器架构,训练规模达14B参数,显著提升视频生成性能。
Team Wan, Ang Wang, Baole Ai 等
提出VILBench,结合73.6K视觉-语言过程奖励数据,评估VLLMs的细粒度奖励能力。
Haoqin Tu, Weitao Feng, Hardy Chen 等
DINeMo通过无3D标注,利用大模型伪对应学习神经网格模型,显著提升零-shot 3D姿态估计性能。
Weijie Guo, Guofeng Zhang, Wufei Ma 等
提出AVUT基准,聚焦音频内容理解与音视频对齐,解决文本捷径问题。
Yudong Yang, Jimin Zhuang, Guangzhi Sun 等
OpenFunGraph方法通过基础模型生成功能性3D场景图,显著优于Open3DSG和ConceptGraph。
Chenyangguang Zhang, Alexandros Delitzas, Fangjinhua Wang 等