FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
FlowVLA introduces explicit motion reasoning via Visual CoT, significantly improving long-term visual prediction and robot policy efficiency.
Zhide Zhong, Haodong Yan, Junfeng Li et al.