模型微调全解:全参 vs 参数高效,深解 LoRA / QLoRA / Adapter
微调不是只有一条路。全参微调、LoRA、QLoRA、Adapter 各适合什么场景?为什么现在几乎都用 LoRA?
#微调#LoRA#QLoRA#Adapter#PEFT更新于 2026-08-12
📑 本页目录
大模型已经很强,但通用模型不「懂」你的领域、你的风格、你的私有数据。微调(Fine-tuning)就是让模型适配特定任务或领域的过程。
但微调 ≠ 只有一种做法。先分清楚你面对的选择。
三个层次,别混为一谈
- 提示工程 / RAG:不改模型,只改输入。零成本,先试这个
- 微调(Fine-tuning):改模型权重,让模型“长记性”
- 全参 vs 参数高效:改多少权重的区别
铁律:能靠 RAG/提示解决的就别微调。 微调是为了让模型学“新的行为/能力”,不是为塞资料——塞资料用 RAG 更划算。
全参微调(Full Fine-tuning)
所有参数都更新。
- ✅ 能力上限最高,能学最复杂的新行为
- ❌ 显存巨大(7B 全参要几十 GB),容易灾难性遗忘(忘了原来会的)
适用:有大量高质量数据 + 充足算力 + 需要彻底改变模型行为时。个人开发者基本不碰。
参数高效微调 PEFT
只更新一小部分参数,冻结其余。这是当下个人/小团队的主流方案。
LoRA(Low-Rank Adaptation)
核心洞察:预训练权重在微调时的“更新量”是低秩的——不需要动整个矩阵,只需学两个小的低秩矩阵,其乘积近似表示权重的变化量。
W' = W + B·A (B 和 A 都是小矩阵,秩 r 远小于原维度)
- 只训练新增的低秩矩阵(参数量通常 <1%)
- 训练完存一个几 MB 到几十 MB 的 adapter 文件,随时热插拔,不污染原模型
- 可以同时挂多个 LoRA 切换不同风格
QLoRA(量化 + LoRA)
在 LoRA 基础上,把预训练权重量化到 4bit 再冻结,只训 LoRA 部分。
- 4bit 量化让 7B 模型只需约 6-8GB 显存就能微调
- 消费级显卡(RTX 3060 12G / 4090 24G)就能跑
- 几乎无损精度,是目前个人微调的事实标准
Adapter
在 Transformer 层之间插入小的“适配器”模块,只训练这些模块。
- 参数量比 LoRA 更小,适合极轻量调整
- 但推理时多一层计算,且不如 LoRA 主流
怎么选(决策表)
| 场景 | 方案 |
|---|---|
| 消费级显卡 + 领域风格适配 | QLoRA |
| 显存充足 + 能力显著提升 | LoRA(全精度) |
| 企业级 + 彻底重塑模型 | 全参微调 |
| 只是塞资料 | 别微调,用 RAG |
一句话总结
微调前先问“我要改的是能力还是知识”——改能力才值得微调,改知识用 RAG。真要微调,个人首选 QLoRA,用不到 1% 的训练参数换来领域能力,还不会破坏模型原有本领。
继续学习
模型社区与资源:Hugging Face、ModelScope、Replicate、CivitAI
去哪找模型、怎么下模型?盘点主流模型社区:Hugging Face、魔搭 ModelScope、Replicate、CivitAI 的功能与直达教程。
本地部署实践:Ollama / vLLM / llama.cpp 对比与保姆级教程
在本地或小服务器跑大模型的三大工具对比,含安装、量化选型、消费级显卡(RTX 3060/4090)跑 7B/13B 的实战指南。
多模态模型简介:CLIP、GPT-4V 与视觉语言模型
多模态模型让 AI 同时理解文字和图像。从 CLIP 的对比学习,到 GPT-4V 的图文对话,讲清它们如何对齐不同模态。
扩散模型简介:图像生成背后的原理(去噪的魔法)
Midjourney、Stable Diffusion 背后的扩散模型是怎么工作的?用最直观的方式讲清'从噪声到图像'的过程。