Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints
利用稀疏3D手关节作为控制信号,提出一种考虑遮挡的高保真视频生成方法。
Chenyangguang Zhang, Botao Ye, Boqi Chen 等
利用稀疏3D手关节作为控制信号,提出一种考虑遮挡的高保真视频生成方法。
Chenyangguang Zhang, Botao Ye, Boqi Chen 等
本文提出Shape-of-You(SoY)框架,利用融合Gromov-Wasserstein(FGW)优化实现无标注语义对应,达成SOTA性能。
Jiin Im, Sisung Liu, Je Hyeong Hong
WeEdit通过HTML自动生成330K训练对,结合Glyph引导微调和强化学习,实现多语言文本图像编辑。
Hui Zhang, Juntao Liu, Zongkai Liu 等
ShotVerse通过VLM规划和控制实现文本驱动的多镜头电影级摄像,构建了对齐的(字幕、轨迹、视频)三元组分布。
Songlin Yang, Zhe Wang, Xuyi Yang 等
提出AssistMimic,基于多智能体强化学习实现物理支撑的人类互动模仿,达成83%的成功率。
Yuto Shibata, Kashu Yamazaki, Lalit Jayanti 等
COMIC系统利用LLM评论家生成接近专业水平的喜剧短片。
Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman 等
V2M-Zero通过事件曲线实现视频到音乐的时间同步生成,在多个数据集上提升音质和节拍对齐。
Yan-Bo Lin, Jonah Casebeer, Long Mai 等
DynVLA通过动态CoT预测紧凑的世界动态,在NAVSIM等数据集上表现优异。
Shuyao Shang, Bing Zhan, Yunfei Yan 等
提出BiLaLoRA结合CLIP的H2C损失,有效实现实景去雾,性能优于SOTA。
Yan Zhang, Long Ma, Yuxin Feng 等
提出World2Act,基于潜在空间无像素监督的后训练框架,提升机器人任务成功率达+2.5%。
An Dinh Vuong, Tuan Van Vo, Abdullah Sohail 等
InternVL-U为4B参数的多模态模型,兼具理解、推理、生成与编辑能力,超越规模更大模型。
Changyao Tian, Danni Yang, Guanzhou Chen 等
OddGridBench揭示MLLMs在视觉差异检测上的不足,提出OddGrid-GRPO提升性能。
Tengjin Weng, Wenhao Jiang, Jingyi Wang 等
RoomTour3D-IGR用隐式几何利用网页视频,跨四项VLN基准提升超6%。
Mingfei Han, Haihong Hao, Liang Ma 等
WS-Net通过状态空间和弱信号注意力融合解决弱信号崩溃问题,实现RMSE和SAD分别减少55%和63%。
Zekun Long, Ali Zia, Guanyiman Fu 等
提出HDR-NSFF,通过4D时空建模实现动态HDR场景的高质量重建,显著优于2D融合方法。
Shin Dong-Yeon, Kim Jun-Seong, Kwon Byung-Ki 等
QualiTeacher通过质量条件伪标签提升图像修复效果,显著提高模型泛化能力。
Fengyang Xiao, Jingjia Feng, Peng Hu 等
提出基于Kinematic Attention Aggregation的Masked Motion Diffusion Model(MMDM),实现运动数据的高效补全与重建。
Junkun Jiang, Jie Chen, Ho Yin Au 等
UniLongGen通过动态记忆管理提高长序列图像生成稳定性。
Haoyu Chen, Qing Liu, Yuqian Zhou 等
UnSCAR采用多专家混合架构,支持超过16种退化类型,提升规模和控制能力。
Debabrata Mandal, Soumitri Chattopadhyay, Yujie Wang 等
LiveWorld通过监控机制解决“视野外动态”问题,实现持久的世界演化。
Zicheng Duan, Jiatong Xia, Zeyu Zhang 等