¿Qué es la memoria de resúmenes?
La ventana de contexto de una IA es pequeña. Las conversaciones se alargan y los primeros turnos se quedan fuera. La memoria de resúmenes va directa: cada cierto tiempo, le pides al modelo que comprima «de qué hablábamos» en un resumen corto y te quedes solo con eso, en lugar de aferrarte a cada palabra original.¿En qué se diferencia de guardar el registro completo?
Registro completo: no se pierde nada, se queman tokensGuardar cada turno tal cual es lo más fiel, pero la ventana se llena rápido y la factura sube.
Memoria de resúmenes: quédate con lo importante, ahorra espacio
Conservas conclusiones, decisiones y datos clave: unas frases sustituyen a cientos de palabras y liberan espacio para contexto más importante.
¿Cómo se hacen los resúmenes?
Deja que el modelo los escribaLo habitual es pasarle al LLM un fragmento de diálogo y pedirle un resumen estructurado, algo como «objetivo del usuario / pasos completados / pendientes».
Comprime por capas
Los resúmenes se pueden resumir otra vez. Cuando tienes demasiados, los fusionas en un resumen de nivel superior, capa a capa, como una pirámide.
Beneficios y costes
A favor: tokens baratos, memoria más largaMantienes el hilo de la conversación por muy poco coste, así que los chats de varios turnos no se vuelven amnésicos.
En contra: se pierden detalles
Comprimir es perder. Una preferencia que el usuario mencionó de pasada puede quedar engullida. Guarda los detalles cruciales aparte.
En resumen: la memoria de resúmenes cambia detalle por duración: un resumen corto que ayuda a la IA a recordar una conversación larga.
Comentarios