只训练少量低秩矩阵实现高效微调的方法。
LoRA 冻结原模型权重,在旁路添加低秩分解矩阵并仅训练它们,使微调参数量减少 99% 以上,显存与存储成本大幅下降。QLoRA 进一步结合 4-bit 量化,单卡即可微调大模型。