Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation
DepthDirector通过深度视频引导,实现精确相机控制和一致内容生成。
Dong-Yu Chen, Yixin Guo, Shuojin Yang 等
DepthDirector通过深度视频引导,实现精确相机控制和一致内容生成。
Dong-Yu Chen, Yixin Guo, Shuojin Yang 等
RAG-3DSG通过重新拍摄和检索增强生成方法,提升了3D场景图的语义一致性和精度,在多个基准测试中表现优异。
Yue Chang, Rufeng Chen, Zhaofan Zhang 等
Fast-ThinkAct通过显式潜在推理实现高效视觉-语言-行动规划,降低89.3%推理延迟。
Chi-Pin Huang, Yunze Man, Zhiding Yu 等
提出语义生命周期框架,结合基础模型提升语义获取、表示与存储能力,显著增强多模态语义处理。
Shuai Chen, Hao Chen, Yuanchen Bei 等
SpatialNav以空间场景图增强零样本导航,R2R成功率57.7%,R2R-CE达64.0%。
Jiwen Zhang, Zejun Li, Siyuan Wang 等
TAGRPO通过直接轨迹对齐提升GRPO在图像到视频生成中的表现,显著提高奖励。
Jin Wang, Jianxiang Lu, Guangzheng Xu 等
Mesh4D是一种基于变分自编码器和扩散模型的单目视频4D网格重建方法,能高效捕捉动态物体的完整形状与运动。
Zeren Jiang, Chuanxia Zheng, Iro Laina 等
DrivoR采用预训练ViT和注册令牌,压缩多摄像头信息,实现端到端自主驾驶,性能优越。
Ellington Kirby, Alexandre Boulch, Yihong Xu 等
提出HuForDet,结合面部与全身分析,采用多模态大模型实现人像伪造检测,达SOTA性能。
Xiao Guo, Jie Zhu, Anil Jain 等
LocalDPO通过局部细节优化提升视频扩散模型的生成质量,在Wan2.1和CogVideoX上表现优异。
Zitong Huang, Kaidong Zhang, Yukang Ding 等
ResTok提出层级残差视觉标记器,提升AR图像生成性能,9步达gFID 2.34。
Xu Zhang, Cheng Da, Huan Yang 等
提出SiT-Bench,基于文本描述评估LLMs空间推理,涵盖3800+题,揭示模型在全局一致性上的“空间差距”。
Zhongbin Guo, Zhen Yang, Yushan Li 等
LTX-2采用非对称双流Transformer架构,结合多模态交叉注意力,实现高效同步音视频生成,参数规模达14B(视频)和5B(音频)。
Yoav HaCohen, Benny Brazowski, Nisan Chiprut 等
VLM4VLA通过少参数微调,将通用VLM转为机器人控制模型,性能优于复杂架构。
Jianke Zhang, Xiaoyu Chen, Qiuyue Wang 等
DGA-Net通过深度提示和图锚引导提升伪装物体检测性能,超越现有方法。
Yuetong Li, Qing Zhang, Yilin Zhao 等
提出ReToK,通过冗余Token填充和层级语义正则化,显著改善灵活图像Tokenizer的生成性能。
Zixuan Fu, Lanqing Guo, Chong Wang 等
提出Fusion-SSAT,通过特征融合提升深伪检测的泛化能力,实验证明优于SOTA方法。
Shukesh Reddy, Srijan Das, Abhijit Das
SpaceTimePilot模型实现动态场景的时空生成渲染,支持独立控制相机视角和运动序列。
Zhening Huang, Hyeonho Jeong, Xuelin Chen 等
PhyGDPO通过物理引导的偏好优化提升文本到视频生成的物理一致性,显著优于现有方法。
Yuanhao Cai, Kunpeng Li, Menglin Jia 等
基于DiT的流匹配模型HY-Motion 1.0,规模突破至十亿参数,实现高精度文本驱动3D人类动作生成。
Yuxin Wen, Qing Shuai, Di Kang 等