指令微调是什么?
基础模型读完海量文本后,会「续写」,但未必懂「听令」。你让它「把这段话翻译成英文」,它可能给你接着写一段。指令微调(Instruction Tuning),就是用海量「指令—回答」对训练它,让它学会:读懂你的意图,然后照做。它和普通微调有什么不同?
更强调「格式」指令数据往往是「请你做X」的格式,训练后模型对各种命令的响应更稳定。
更强调「泛化」
好的指令微调不是背答案,而是学会一种通用能力——遇到没见过的指令,也能举一反三。
指令数据长什么样?
简单指令「把下面这句话翻译成日语:……」。
复杂指令
「阅读这段合同,找出潜在风险,用三点列出」。
多轮指令
模拟真实对话,让模型学会追问、澄清、按上下文办事。
它为什么重要?
指令微调是让模型「从能说到能用」的关键一步。它让 AI 更像一个能听懂人话的助手,而不是一个只会往下接句子的「接话机器」。后来的 RLHF、工具调用等能力,很多都建立在这层「会听指令」的基础上。一句话记住:指令微调就是拿成千上万条「任务+标准答案」训练 AI,让它从「会说话」变成「会办事」。
评论