LuAITools.com
提交工具
🗂️AI
KV Cache

键值缓存

把注意力层的键值对缓存下来,避免逐字生成时的重复计算,用显存换推理速度的关键技术。

键值缓存是什么?

大模型生成文字,是一个字一个字「蹦」出来的。每生成一个新字,注意力机制都要和前面所有字「对一遍账」。键值缓存(KV Cache),就是把这笔账的结果存起来——前面算过的键(Key)和值(Value)不重算,直接复用,让生成快上好几倍。

为什么每步都在「重复劳动」?

自回归生成是一字一顿
模型每吐一个字,都要回头和之前的全部内容重新计算注意力。
前面算过的,其实没变
已经生成的部分不会回头改,它们对应的 K、V 是固定的,根本不用每次重算。

它是怎么提速的?

只算新的,复用旧的
新字的注意力,只需要「新字的 Q」和「历史 K、V」算一次,历史部分直接取缓存。
显存换时间
代价是要额外存下这些 K、V(很吃显存),但换来了推理速度的大幅提升。

它为什么重要?

KV Cache 是现代 LLM 推理提速的基石之一,几乎每个生产级推理引擎都在用它。理解了它,你就理解了「为什么生成越来越慢」和「为什么显存总是不够用」这两个问题的共同答案。

一句话记住:键值缓存就是「算过的不白算」——把历史注意力的账本存下来,生成时只补新账。

评论