PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models
PTQ4ARVG框架实现了对ARVG模型的6位量化,保持竞争性能。
Xuewen Liu, Zhikai Li, Jing Zhang 等
PTQ4ARVG框架实现了对ARVG模型的6位量化,保持竞争性能。
Xuewen Liu, Zhikai Li, Jing Zhang 等
DeepSeek-OCR 2通过DeepEncoder V2实现视觉因果流,提升OmniDocBench v1.5性能3.73%。
Haoran Wei, Yaofeng Sun, Yukun Li
Youtu-Parsing通过高并行解码实现文档解析,速度提升5-11倍,在OmniDocBench等基准上达到SOTA性能。
Haoyu Cao, Kun Yin, Yunfei Wu 等
HINT采用层级交互建模的自回归多人运动生成框架,达成低FID(3.100)和高一致性。
Mengge Liu, Yan Di, Gu Wang 等
VGGT-SLAM 2.0通过改进因子图设计和注意力层验证,实现实时高精度场景重建,减少23%的位姿误差。
Dominic Maggio, Luca Carlone
GenAgent通过代理式多模态推理,解耦理解与生成,提升文本到图像性能,达成+23.6%提升。
Kaixun Jiang, Yuzheng Wang, Junjie Zhou 等
SRA 2通过VAE特征对齐加速扩散模型训练,仅增加4% GFLOPs。
Mengmeng Wang, Dengyang Jiang, Liuzhuozheng Li 等
CoT-Seg结合链式推理与自我校正,无需微调,显著提升复杂场景下的图像分割性能。
Shiu-hong Kao, Chak Ho Huang, Huaiqian Liu 等
提出PPIA,基于视觉观察的黑箱物理提示注入攻击,成功率达98%。
Chen Ling, Kai Hu, Hangcheng Liu 等
ActionMesh结合时间维Diffusion与自动编码,快速生成符合拓扑的动画3D网格。
Remy Sabathier, David Novotny, Niloy J. Mitra 等
SAMTok将任何区域掩码转化为两个特殊符号,实现像素级理解,无需架构改动。
Yikang Zhou, Tao Zhang, Dengxian Gong 等
提出迭代式自我修正策略,结合视觉语言模型提升复杂指令的图像生成准确率,达成16.9%的提升。
Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj 等
RayRoPE利用投影射线编码,确保多视角变换中的SE(3)不变性与几何适应性,提升新视点合成性能。
Yu Wu, Minsik Jeon, Jen-Hao Rick Chang 等
提出Soft Tail-dropping自适应视觉编码器(STAT),根据图像复杂度动态调整输出Token数,提升生成质量。
Zeyuan Chen, Kai Zhang, Zhuowen Tu 等
AVIR利用轻量检索和自适应筛选,减少70%页面,提升84.58% ANLS。
Zongmin Li, Yachuan Li, Lei Kang 等
提出SeLop方法,通过低秩正交投影抑制伪相关偏差,提升人脸伪造检测的泛化能力。
Chi Wang, Xinjue Hu, Boyu Wang 等
提出AIGVDBench,涵盖31模型和44万视频,系统评估33检测器,提供深度分析。
Long Ma, Zihao Xue, Yan Wang 等
HuDA模型利用人类检测和时间对齐提升视频生成,胜率达73%。
Kumar Ashutosh, XuDong Wang, Xi Yin 等
Molmo2为开源视频-语言模型,具点驱动定位和多模态理解能力。
Christopher Clark, Jieyu Zhang, Zixian Ma 等
使用WMReward和VJEPA-2模型提高视频生成物理合理性,ICCV 2025挑战赛得分62.64%。
Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich 等