排序: 最新 热门 引用
cs.CV 2503.10589

Long Context Tuning for Video Generation

提出长时上下文调优(LCT),扩展视频扩散模型的上下文窗口,实现场景级一致性,支持多镜头生成。

Yuwei Guo, Ceyuan Yang, Ziyan Yang 等

2025-03-14 28
cs.CV 2503.08507

Referring to Any Person

本论文提出RexSeek模型,结合多模态大语言模型与目标检测,实现对多个人物的自然语言指示识别,基于HumanRef数据集,显著优于现有模型。

Qing Jiang, Lin Wu, Zhaoyang Zeng 等

2025-03-11 24 引用 28