Learning Invariant Visual Representations for Planning with Joint-Embedding Predictive World Models
Proposes bisimulation encoder for invariant visual representations, reducing latent size by 10×, enhancing robustness of JEPAs against background variations.
Leonardo F. Toso, Davit Shadunts, Yunyang Lu et al.