LuAI ToolsLuAITools.com
提交工具
返回 AI 知识百科
AI
Knowledge Distillation

知识蒸馏

把大模型的推理智慧压缩进小模型,速度快十倍,性能掉一点。

知识蒸馏是什么?


你有没有见过那种超大的AI模型,动辄几千亿参数,跑一次能让你电脑风扇转到飞起,手机压根不敢想?但到真正用的时候,谁也不想在手机APP里等半天才出一个字。所以业界就琢磨出一个损招——让大模型当老师,把小模型当学生,把老师的“毕生所学”提炼出来灌给小模型。这个过程就叫知识蒸馏。

具体怎么“灌”呢?不是直接把大模型的回答塞给小模型去背——那叫复制粘贴,没技术含量。真实做法是:让大模型在面对一批数据时,不单给出“正确答案”,还给出它内部的那个“判断概率分布”。举个例子,识别一张图,大模型可能觉得“狗”的概率是0.85,“狼”是0.12,“狐狸”是0.03。小模型学的时候不光学“这是狗”,还学那组0.85、0.12、0.03的比例关系。这串概率里藏着大模型的“思考轨迹”——它知道狗和狼比狗和汽车更像。小模型把这层关系也吞下去,就能用极小的参数量达到大模型八九成的效果。

这玩意儿的好处肉眼可见:模型变小了,跑得飞快,内存和电费都省了,手机、浏览器、嵌入式设备都能塞进去。坏处也不是没有——蒸馏过程本身耗时耗力,而且小模型的上限天生就被老师限制住了,不可能青出于蓝。更麻烦的是,老师要是带“偏见”或者“幻觉”,小模型会原封不动地继承下来,相当于“垃圾进,垃圾出”。

总之,知识蒸馏就是AI界的“乞丐版替代品”——用微乎其微的性能损失,换来巨大的成本节省。不是你非要用它,是现实世界跑不动太大的模型,你只能妥协。

评论