RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
RULER-Bench评测视频生成规则推理,SOTA仅48.87%
Xuming He, Zehao Fan, Hengjia Li 等
RULER-Bench评测视频生成规则推理,SOTA仅48.87%
Xuming He, Zehao Fan, Hengjia Li 等
提出Temporal Dynamics Enhancer提升SNNs时序建模能力,mAP50-95达57.7%和47.6%。
Fan Luo, Zeyu Gao, Xinhao Luo 等
SPARK以VLM、DiT和可微运动学从单图重建可仿真的关节物体,CD达0.3959。
Yumeng He, Ying Jiang, Jiayin Lu 等
FRAMER方法利用频率对齐自蒸馏和扩散先验提升图像超分辨率,显著提高PSNR和SSIM。
Seungho Choi, Jeahun Sung, Jihyong Oh
FR-TTS通过填充奖励优化NTP图像生成,显著提升生成质量。
Hang Xu, Linjiang Huang, Feng Zhao
SpaceMind采用摄像头引导的模态融合,实现RGB图像的3D空间推理,超越SOTA指标。
Ruosen Zhao, Zhikang Zhang, Jialei Xu 等
提出STVG-o1框架,通过强化微调实现无需架构改动的多模态大模型精确时空定位,提升HCSTVG-v1性能7.3%。
Xin Gu, Haoji Zhang, Qihang Fan 等
∞-RoPE通过块相对旋转和KV刷新实现无限视频生成与细粒度动作控制。
Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan 等
iMontage利用预训练视频模型,通过引入图像内容多样性,实现多对多高动态场景生成。
Zhoujie Fu, Xianfang Zeng, Jinghong Lan 等
ReaDe采用“推理-描述”范式,通过两阶段优化显著提升视频指令理解与生成控制精度。
Shengqiong Wu, Weicai Ye, Yuanxing Zhang 等
DinoLizer基于DINOv2,结合LoRA微调,能有效检测生成式修复中的VAE与扩散伪迹,提升20% IoU。
Minh Thong Doi, Vincent Itier, Jan Butora 等
提出Cross-Modal验证框架,构建VeriSciQA,涵盖20200+高质量科学图表问答数据。
Yuyi Li, Daoyuan Chen, Zhen Wang 等
GigaWorld-0结合视频生成与3D建模,作为数据引擎提升 embodied AI 的泛化能力。
GigaWorld Team, Angen Ye, Boyuan Wang 等
提出高效可迁移的最优传输方法——Min-Sliced Transport Plans,提升多任务匹配效率。
Xinran Liu, Elaheh Akbari, Rocio Diaz Martin 等
Zhang等提出IF-Edit,无需微调,利用预训练视频扩散模型实现指令驱动的图像编辑,提升非刚性和推理任务表现。
Zechuan Zhang, Zhenyuan Chen, Zongxin Yang 等
提出COVT框架,通过连续视觉令牌增强VLM的空间推理能力,提升性能达16%。
Yiming Qin, Bomin Wei, Jiaxin Ge 等
LAST通过视觉链路增强空间与时间推理,提升VLM在3D和长视频理解中的表现。
Shuai Wang, Daoan Zhang, Tianyi Bai 等
提出ViCoDR,通过多视角一致性学习显著提升视频3D一致性。
Duolikun Danier, Ge Gao, Steven McDonagh 等
提出自适应视觉基模块,通过正交滤波减少视觉token数量,实现更高效的表示学习。
Shawn Young, Xingyu Zeng, Lijian Xu
InfiniBench通过LLM引导、集群优化和任务感知摄像头路径,实现无限可定制的3D场景生成,提升空间推理评估能力。
Haoming Wang, Qiyao Xue, Wei Gao