LuAITools.com
提交工具
AI
Speculative Decoding

投机采样

让小模型先「草拟」、大模型再「审稿」的提速技巧。投机采样能让大模型生成速度快上 2 到 3 倍,还不改答案。

投机采样是什么?

大模型生成文字时,要一个字一个字往外蹦,每一步都很贵。投机采样想了个巧办法:请一个小模型先「打草稿」,大模型再一次性「审稿」,对的留下、错的改掉——结果一样,速度却快了好几倍。

它是怎么工作的?

小模型先猜
用一个又小又快的模型,快速生成一段候选文字,比如先猜出接下来好几个词。
大模型一次验证
大模型把这段候选词一次看完,判断哪些猜对了、哪些不对。猜对的部分直接采用,错的地方停下来修正。
省在哪
大模型一次能「验」好几个词,而不是一次只生成一个,等于把昂贵的步骤批量化了。

它为什么有用?

提速不降质
因为最终是大模型把关,输出的质量和直接生成几乎一模一样,只快不差。
不改架构
不用重新训练大模型,只需要额外配一个小模型,工程上很好落地。
广泛适用
翻译、写作、代码生成,各种生成任务都能受益。

它有什么局限?

加速效果取决于小模型「猜」得多准。猜得准,一次能验一大段;猜得偏,就退化成普通速度。所以两个模型要搭配得当。

一句话记住:投机采样,就是让小模型「草拟」、大模型「审稿」,用批量验证换速度。

评论