LuAITools.com
提交工具
🧱AI
La arquitectura detrás de todo LLM

Transformer

Una arquitectura neuronal presentada en 2017 que procesa secuencias en paralelo mediante el mecanismo de atención. Casi todos los grandes modelos de lenguaje actuales se construyen sobre ella.

¿Qué es el Transformer?

El Transformer es una arquitectura de red neuronal que investigadores de Google presentaron en un artículo de 2017. Cayó como una bomba en la piscina: rompió las viejas formas de procesar texto y se convirtió en la base compartida de casi todo modelo de lenguaje grande actual. GPT, Claude, Gemini: por debajo, todos son Transformers.

¿Qué problema resolvió?

Las redes recurrentes eran lentas
Los modelos antiguos leían una frase palabra por palabra, esperando cada palabra antes de la siguiente. Sin paralelismo, y las frases largas se volvían lentas u olvidadizas.
El Transformer ve la frase entera a la vez
Con la atención, cada palabra puede mirar directamente a todas las demás de la frase, todo en una sola pasada paralela: rápido y con buena memoria a largo alcance.

¿Cómo es por dentro?

Codificador y decodificador
El diseño clásico tiene dos mitades: el codificador «lee» la entrada y el decodificador «escribe» la salida. Traducir es leer-una-frase, escribir-una-frase.
Atención multi-cabeza
No una sola forma de mirar, sino varias cabezas de atención disparando a la vez, cada una captando relaciones distintas entre palabras.
Codificación posicional
Como todo corre en paralelo, el modelo no sabe el orden por sí solo, así que hay que decirle quién va primero y quién al final.

¿Por qué domina la IA?

Escala de maravilla. Suma datos, cómputo y tamaño, y la capacidad no deja de subir sin techo aparente. Ese es el escenario de las leyes de escala, y el pistoletazo de salida de la era de los LLM.

En resumen: el Transformer lee frases enteras en paralelo gracias a la atención, y es la base compartida de los grandes modelos de lenguaje actuales.

Comentarios