RePainter: Empowering E-commerce Object Removal via Spatial-matting Reinforcement Learning
Repainter利用空间抠图强化学习,显著提升电商图像去除效果。
Zipeng Guo, Lichen Ma, Xiaolong Fu 等
Repainter利用空间抠图强化学习,显著提升电商图像去除效果。
Zipeng Guo, Lichen Ma, Xiaolong Fu 等
MV-Performer利用深度引导的视频扩散模型,实现360度同步多视角人类视频合成。
Yihao Zhi, Chenghong Li, Hongjie Liao 等
SIGMA-GEN实现单次多主体身份保留图像生成,性能超越SOTA,基于SIGMA-SET27K数据集。
Oindrila Saha, Vojtech Krs, Radomir Mech 等
提出LUR和RLUR方法,提升驾驶员行为识别中的不确定性检测效率。
Koen Vellenga, H. Joe Steinhauer, Jonas Andersson 等
TAG通过放大轨迹中的切向分量,有效减少幻觉,提高扩散模型生成的语义一致性。
Hyunmin Cho, Donghoon Ahn, Susung Hong 等
A.I.R.提出无训练的自适应迭代推理帧选择,显著提升VideoQA效率与准确性。
Yuanhao Zou, Shengji Jin, Andong Deng 等
ChronoEdit利用预训练视频生成模型,将图像编辑转化为时间序列推理,显著提升物理一致性。
Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen 等
提出Video-in-the-Loop(ViTL)框架,通过两阶段定位与回答实现长视频问答,提升效率与解释性。
Chendong Wang, Donglin Bai, Yifan Yang 等
提出HVGC框架和BridgeDiT模型,实现文本到声音视频生成,性能优于现有方法。
Kaisi Guan, Xihua Wang, Zhengfeng Lai 等
FSFSplatter在2分钟内通过稀疏视图实现高精度表面重建,减少28.39%误差。
Yibin Zhao, Yihan Pan, Jun Nan 等
Self-Forcing++通过样本采样和分布匹配,成功将长视频生成时间扩展至4分钟,超越原模型20倍,显著提升质量与一致性。
Justin Cui, Jie Wu, Ming Li 等
提出PhraseStereo数据集,将短语语义分割扩展到立体图像,利用深度信息提升精度。
Thomas Campagnolo, Ezio Malis, Philippe Martinet 等
提出LAKAN,结合面部关键点动态调节Kolmogorov-Arnold网络,提升深伪检测性能。
Jiayao Jiang, Bin Liu, Qi Chu 等
YOLO26通过移除DFL、端到端无NMS推理、引入ProgLoss、STAL和MuSGD,实现实时边缘检测,提升速度与精度。
Ranjan Sapkota, Rahul Harsha Cheppally, Ajay Sharda 等
SPLICE基准测试揭示VLM在视觉推理上与人类表现差距显著。
Mohamad Ballout, Okajevo Wilfred, Seyedalireza Yaghoubi 等
提出NeMo任务评估视频长时理解,结合自动化数据生成,构建NeMoBench基准。
Zi-Yuan Hu, Shuo Liang, Duo Zheng 等
提出Latent Visual Reasoning(LVR),在视觉嵌入空间实现端到端推理,显著提升视觉问答性能。
Bangzheng Li, Ximeng Sun, Jiang Liu 等
MoReact通过扩散模型生成基于文本描述的反应动作,显著提升交互真实感。
Xiyan Xu, Sirui Xu, Yu-Xiong Wang 等
提出ReWatch数据集及多阶段合成,结合多智能体ReAct框架,提升大视觉-语言模型视频推理能力。
Congzhi Zhang, Zhibin Wang, Yinchao Ma 等
LongLive采用因果帧级自回归模型,结合KV重置机制,实现20.7FPS的实时长视频生成,支持240秒视频。
Shuai Yang, Wei Huang, Ruihang Chu 等