QLoRA kết hợp quantization 4-bit và LoRA để fine-tune mô hình 65B trên một GPU duy nhất
QLoRA cho phép fine-tune mô hình 65B tham số trên một GPU 48GB duy nhất bằng cách kết hợp lượng tử hóa 4-bit NormalFloat với LoRA adapter, đạt 99,3% hiệu năng ChatGPT.