监督微调(Supervised Fine-Tuning,SFT)是在预训练完成后,用带标注的高质量数据对模型做进一步训练的方法。预训练让模型“博览群书”、掌握海量知识,但此时它只会接续文本、还不会好好对话;SFT 则通过模仿高质量的问答范例,让模型学会“像个助手一样说话和干活”。
一句话理解
- 预训练:让模型会“接话”
- 监督微调:让模型会“回答问题、执行指令”
- 收集高质量数据:人工编写的问答对、指令范例、专业领域内容
- 构造训练样本:把问题作为输入、理想回答作为标准答案
- 监督学习:让模型学会把“问题”映射到“标准答案”(有监督,故得名)
- 通用对话能力:把基础模型变成“会聊天”的助手
- 行业微调:用医疗、法律、金融等专业语料,让模型变“懂行”
- 风格迁移:让输出贴合品牌语气
- 数据质量决定一切:垃圾进、垃圾出
- 微调可能影响模型原有能力,需要控制训练量
- 通常与指令微调、对齐(RLHF/DPO)组合使用