LuAITools.com
提交工具
📚AI
SFT

监督微调

用一批高质量的「问题—标准答案」继续训练基础模型,让它学会「按指令办事」、输出规范格式,是从「能接话」到「能干活」的关键一步。

监督微调是什么?

基础大模型读完了海量文本,会「接话」了,但还不会「听指令」——你问它一个问题,它可能给你续写一段,而不是直接回答。监督微调(SFT),就是拿一批人工精心准备的「问题—标准答案」对,再训练它一轮,让它学会:别人问什么,就答什么,而且答得像样。

它和「预训练」有什么区别?

预训练:学语言本身
这个阶段模型只是海量阅读,学会的是「这句话后面通常接什么」,相当于学会了语法和常识,还没学会「服务意识」。
监督微调:学「怎么回答」
SFT 用问答对和指令样本,教会模型「用户是来求助的,我要给出直接、有用的回答」。这一步之后,模型才像是个「助手」。

数据从哪来?

SFT 的质量高度依赖数据。优质的指令数据往往来自:人工撰写、从优质回答里筛选、甚至用更强的模型生成再人工校对。数据越干净、越多样,微调出来的模型越靠谱。

它的作用与局限

SFT 能让模型快速学会格式和指令遵循,成本比 RLHF 低;但它只是「模仿标准答案」,还分不清「好」和「更好」——那需要 RLHF 再来补一脚。

一句话记住:监督微调就是给 AI 看「优秀作业」,让它照着学怎么答题。

评论