Accelerating Large Language Model Decoding with Speculative Sampling
Proposes Speculative Sampling, enabling 2-2.5x speedup in decoding 70B-parameter Chinchilla model by generating multiple tokens per call while maintaining distribution fidelity.
Charlie Chen, Sebastian Borgeaud, Geoffrey Irving et al.