📚

监督微调(SFT)

Supervised Fine-Tuning
技术原理
微调训练

监督微调(Supervised Fine-Tuning,SFT)是在预训练完成后,用带标注的高质量数据对模型做进一步训练的方法。预训练让模型“博览群书”、掌握海量知识,但此时它只会接续文本、还不会好好对话;SFT 则通过模仿高质量的问答范例,让模型学会“像个助手一样说话和干活”。

一句话理解

  • 预训练:让模型会“接话”
  • 监督微调:让模型会“回答问题、执行指令”
工作方式
  • 收集高质量数据:人工编写的问答对、指令范例、专业领域内容
  • 构造训练样本:把问题作为输入、理想回答作为标准答案
  • 监督学习:让模型学会把“问题”映射到“标准答案”(有监督,故得名)
典型应用
  • 通用对话能力:把基础模型变成“会聊天”的助手
  • 行业微调:用医疗、法律、金融等专业语料,让模型变“懂行”
  • 风格迁移:让输出贴合品牌语气
注意事项
  • 数据质量决定一切:垃圾进、垃圾出
  • 微调可能影响模型原有能力,需要控制训练量
  • 通常与指令微调、对齐(RLHF/DPO)组合使用
趋势 2026 年,SFT 仍然是模型训练的标准步骤,但与强化学习类方法结合得越来越紧密,单纯只做 SFT 的模型已很难满足生产级要求。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0