核心判断
微调(Fine-tuning)正在经历分化。不是整体衰落,而是其中一类在快速萎缩,另一类依然必要。区分这两类,决定了你在技术选型时是否会做出正确的判断。
正在消亡的部分:能力补救类微调
2023-2024 年微调最常见的用途是"让模型学会某个特定能力":
- "让模型学会遵循指令" — 指令微调现已内置进所有主流基础模型
- "让模型拒绝有害请求" — 宪法 AI 等对齐技术已硬编码进基模
- "让模型学会某种写作风格" — 少样本学习(in-context learning)能做到,成本更低
这些微调的存在理由是"模型原本做不到",但 2025-2026 年的强基模已经在训练中学会了这些模式。微调它们变成了冗余——而且相比之下,RAG 和 Few-shot 成本更低、更灵活、更易更新。
永不消亡的部分:工程驱动类微调
这类微调解决的不是"模型能力"而是"工程需求",基模升级无法让它消失:
用强模型的知识蒸馏出小模型,性能接近但推理成本/延迟大幅降低。高频场景永远有这个需求。
量化、剪枝等技术压缩模型,保证推理速度。ToC 产品的延迟要求永远无法被"换更强的模型"解决。
让模型以特定方式行动,而不是让模型更聪明。偏好学习(RLHF)解决的是风格和行为约束,与模型能力正交。
微调 vs RAG:该怎么选
这是当前最常见的技术选型问题。简单的判断框架:
- 知识稳定、数据量少、需要改变行为模式 → 考虑微调(但先问:RAG 能不能做到?)
- 知识快速变化、数据量大、需要溯源 → RAG 更合适
- 想扩展模型某个能力 → 先试 Few-shot,再试 RAG,最后才考虑微调
趋势很明确:RAG 在赢。因为现在知识变化快、数据多、需要追踪信息来源。微调的假设("知识是稳定的")越来越不符合现实。
LoRA 让部分微调重新可行
低秩适应(LoRA)的出现改变了微调的成本结构:不需要微调整个模型,只需训练额外的低秩矩阵,成本显著降低。这让一些此前因成本太高而放弃微调的场景重新变得可行——比如为不同客户快速适配不同风格的模型,或者为不同领域快速构建专用模型。