Self-Policy Distillation via Capability-Selective Subspace Projection
Self-Policy Distillation (SPD) extracts low-rank capability subspaces via gradients, guiding self-generation without external signals, improving performance by 13%.
Guangya Hao, Yitong Shang, Yunbo Long et al.