SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
SAM2Act integrates large-scale visual foundation models with multi-view transformers, achieving 86.8% success and enhanced spatial memory.
Haoquan Fang, Markus Grotz, Wilbert Pumacay et al.