3 个章节·按类别展开/折叠
知识
为什么需要微调
预训练 (Pre-training):读 1 万亿 token,学语言规律。成本 $1M+。
微调 (Fine-tuning):在 1 万 - 100 万样本上继续训练,让模型学会特定任务。成本 $10 - $10,000。
三类微调对比:
- Full Fine-tune:100% 参数 (7B),60 GB+,效果最佳
- LoRA:0.1% 参数 (7M),20 GB,效果接近
- QLoRA:0.1% 参数 (7M),6 GB,单卡 4090 能跑
- DPO:0.1% 参数,20 GB,对齐人类偏好
知识
LoRA 核心思想
不更新原始权重 W,只训练低秩分解 W + ΔW = W + A·B,其中 A∈[d, r],B∈[r, d],r=8 通常。原始 7Bx7B 矩阵变成 7Bx8 + 8x7B = 112M 参数。
直觉:模型需要学习的「变化」其实是低秩的,不需要更新整个矩阵。
callout