¿Qué es un modelo de difusión?
Seguro que has visto a una IA dibujar: escribes una frase y unos segundos después aparece una imagen. El motor que hay detrás suele ser el modelo de difusión. Su enfoque es un poco contraintuitivo: no «dibuja» directamente, sino que ensucia el lienzo y luego lo limpia poco a poco.¿Cómo funciona?
Hacia delante: añadir ruidoEn el entrenamiento, tomas una foto real y le vas añadiendo ruido aleatorio paso a paso hasta convertirla en una pantalla de estática.
Hacia atrás: quitar ruido
Luego entrenas al modelo para ir en sentido contrario: partir de esa estática e ir quitando ruido paso a paso hasta recuperar una foto nítida. Lo que el modelo aprende es a «borrar».
Generación: empezar desde el ruido
Cuando ya sabe quitar ruido, le das ruido puro y puede «borrar» hasta sacar una imagen nueva. Añade un prompt de texto y borra en la dirección que describiste.
¿Por qué está en todas partes?
CalidadFrente a los primeros modelos generativos, las imágenes son más ricas en detalle y más estables, menos propensas a desmoronarse.
Control
El texto, las imágenes de referencia y los retoques locales pueden guiarlo: va a donde apuntes.
Ecosistema abierto
La apertura de modelos como Stable Diffusion generó un aluvión de plugins y técnicas.
¿Cuáles son sus límites?
Generar una imagen exige muchos pasos iterativos, así que es más lento y pesado que otros modelos. Y como aprende de todo internet, el copyright y los sesgos siguen en debate.En resumen: un modelo de difusión «saca» una imagen de una mancha de ruido, paso a paso.
Comentarios