cs.RO 2608.24603

Gripper-aware Vision Language Action Models

Proposes GVLA, integrating multi-gripper encoding and adapter routing, trained on MiGA dataset with 103,000 demonstrations, achieving 7.62% improvement over baselines.

Hanyi Zhang, Zihong Luo, Tianyu Li et al.

2026-08-25 76