Memory-Efficient Fine-Tuning of Compressed Large Language Models via sub-4-bit Integer Quantization
PEQA method enables sub-4-bit LLM fine-tuning by updating quantization scales, significantly reducing memory demands.
Jeonghoon Kim, Jung Hyun Lee, Sungdong Kim et al.