结合 4-bit 量化与 LoRA 的极省显存微调方案。
QLoRA 将模型量化到 4-bit 后插入 LoRA 适配器训练,可在消费级显卡上微调 70B 级别模型。代价是训练速度略慢,但对个人开发者与小型团队极具吸引力。