¿Qué es la caché KV?
Un modelo de lenguaje escribe el texto de a un token. Cada token nuevo tiene que «saldar cuentas» con todos los anteriores mediante la atención. La caché KV guarda el resultado de esa contabilidad —las claves (Key) y los valores (Value) ya calculados— para no recalcular nada. La generación se acelera varias veces.¿Por qué hay trabajo repetido desde el principio?
La generación autorregresiva va token a tokenCada token que escupe el modelo le obliga a recalcular la atención contra todo lo anterior.
Lo ya calculado no ha cambiado
La parte generada nunca se reescribe, así que sus claves y valores son fijos. No hace falta recalcularlos en cada paso.
¿Cómo acelera?
Calcula lo nuevo, reutiliza lo viejoPara un token nuevo, la atención solo necesita la consulta nueva más las claves y valores históricos; todo lo histórico sale directo de la caché.
Memoria a cambio de tiempo
El coste es almacenar todos esos K y V (que devoran mucha VRAM), a cambio de una inferencia mucho más rápida.
Por qué importa
La caché KV es uno de los cimientos de la inferencia moderna de LLM, y prácticamente todos los motores de inferencia en producción la usan. Entiéndela y habrás hallado la respuesta común a dos quejas de siempre: «por qué la generación se ralentiza» y «por qué mi VRAM siempre está llena».En resumen: la caché KV significa «lo ya calculado se queda calculado» — guarda el libro de cuentas de la atención y solo salda entradas nuevas al generar.
Comentarios