HUMANISE: Language-conditioned Human Motion Generation in 3D Scenes
Proposed HUMANISE dataset and scene-language conditioned generative model achieve diverse, semantically consistent 3D human motions, with key metrics showing 15% improvement over baselines.
Zan Wang, Yixin Chen, Tengyu Liu et al.