¿Qué es el Transformer?
El Transformer es una arquitectura de red neuronal que investigadores de Google presentaron en un artículo de 2017. Cayó como una bomba en la piscina: rompió las viejas formas de procesar texto y se convirtió en la base compartida de casi todo modelo de lenguaje grande actual. GPT, Claude, Gemini: por debajo, todos son Transformers.¿Qué problema resolvió?
Las redes recurrentes eran lentasLos modelos antiguos leían una frase palabra por palabra, esperando cada palabra antes de la siguiente. Sin paralelismo, y las frases largas se volvían lentas u olvidadizas.
El Transformer ve la frase entera a la vez
Con la atención, cada palabra puede mirar directamente a todas las demás de la frase, todo en una sola pasada paralela: rápido y con buena memoria a largo alcance.
¿Cómo es por dentro?
Codificador y decodificadorEl diseño clásico tiene dos mitades: el codificador «lee» la entrada y el decodificador «escribe» la salida. Traducir es leer-una-frase, escribir-una-frase.
Atención multi-cabeza
No una sola forma de mirar, sino varias cabezas de atención disparando a la vez, cada una captando relaciones distintas entre palabras.
Codificación posicional
Como todo corre en paralelo, el modelo no sabe el orden por sí solo, así que hay que decirle quién va primero y quién al final.
¿Por qué domina la IA?
Escala de maravilla. Suma datos, cómputo y tamaño, y la capacidad no deja de subir sin techo aparente. Ese es el escenario de las leyes de escala, y el pistoletazo de salida de la era de los LLM.En resumen: el Transformer lee frases enteras en paralelo gracias a la atención, y es la base compartida de los grandes modelos de lenguaje actuales.
Comentarios