LuAITools.com
提交工具
🗂️AI
No recalcular lo ya calculado

Caché KV

La caché KV guarda los pares clave-valor de la atención para no recalcular nada durante la generación token a token: cambia memoria por una inferencia mucho más rápida.

¿Qué es la caché KV?

Un modelo de lenguaje escribe el texto de a un token. Cada token nuevo tiene que «saldar cuentas» con todos los anteriores mediante la atención. La caché KV guarda el resultado de esa contabilidad —las claves (Key) y los valores (Value) ya calculados— para no recalcular nada. La generación se acelera varias veces.

¿Por qué hay trabajo repetido desde el principio?

La generación autorregresiva va token a token
Cada token que escupe el modelo le obliga a recalcular la atención contra todo lo anterior.
Lo ya calculado no ha cambiado
La parte generada nunca se reescribe, así que sus claves y valores son fijos. No hace falta recalcularlos en cada paso.

¿Cómo acelera?

Calcula lo nuevo, reutiliza lo viejo
Para un token nuevo, la atención solo necesita la consulta nueva más las claves y valores históricos; todo lo histórico sale directo de la caché.
Memoria a cambio de tiempo
El coste es almacenar todos esos K y V (que devoran mucha VRAM), a cambio de una inferencia mucho más rápida.

Por qué importa

La caché KV es uno de los cimientos de la inferencia moderna de LLM, y prácticamente todos los motores de inferencia en producción la usan. Entiéndela y habrás hallado la respuesta común a dos quejas de siempre: «por qué la generación se ralentiza» y «por qué mi VRAM siempre está llena».

En resumen: la caché KV significa «lo ya calculado se queda calculado» — guarda el libro de cuentas de la atención y solo salda entradas nuevas al generar.

Comentarios