¿Qué es un modelo de espacio de estados?
Al procesar una secuencia — digamos una frase — un Transformer deja que cada palabra mire a todas las demás. Eso da mucha información, pero el coste crece de forma cuadrática con la longitud. Un modelo de espacio de estados (SSM) toma otra ruta: como un río que fluye despacio, lleva hacia delante un «estado oculto» comprimido y lo va actualizando al leer cada elemento. Resultado: menos memoria y menos tiempo en secuencias largas.¿En qué se diferencia de un Transformer?
Transformer: todos miran a todosCada posición atiende a todas las demás — resultados estupendos, pero más caro a medida que crece la secuencia.
SSM: un relevo de estado
Se apoya en un único estado que se pasa hacia delante, y brilla en texto muy largo.
¿Por qué está de moda de repente?
Complejidad linealDuplicar la longitud cuesta más o menos el doble, no el cuádruple: los documentos largos salen baratos.
Memoria de largo alcance
Aunque el contexto relevante esté lejos, el SSM puede retenerlo.
Amable con el hardware
El patrón de cálculo es regular, lo que corre con eficiencia en GPUs.
Sus estrellas y sus límites
Mamba es una de las variantes más conocidas de SSM. Los SSM prometen mucho en secuencias largas e inferencia en tiempo real, aunque los Transformers siguen mandando en tareas que exigen comparación global fina. El futuro probablemente no es uno u otro, sino ambos.En resumen: los modelos de espacio de estados son una ruta nueva por las secuencias: un relevo comprimido de estado que compra eficiencia en texto largo.
Comentarios