LuAITools.com
提交工具
🎨AI
Generar imágenes desde el ruido

Modelo de difusión

Los modelos de difusión generan imágenes añadiendo ruido y luego quitándolo. Son el motor central de herramientas de texto a imagen como Midjourney y Stable Diffusion.

¿Qué es un modelo de difusión?

Seguro que has visto a una IA dibujar: escribes una frase y unos segundos después aparece una imagen. El motor que hay detrás suele ser el modelo de difusión. Su enfoque es un poco contraintuitivo: no «dibuja» directamente, sino que ensucia el lienzo y luego lo limpia poco a poco.

¿Cómo funciona?

Hacia delante: añadir ruido
En el entrenamiento, tomas una foto real y le vas añadiendo ruido aleatorio paso a paso hasta convertirla en una pantalla de estática.
Hacia atrás: quitar ruido
Luego entrenas al modelo para ir en sentido contrario: partir de esa estática e ir quitando ruido paso a paso hasta recuperar una foto nítida. Lo que el modelo aprende es a «borrar».
Generación: empezar desde el ruido
Cuando ya sabe quitar ruido, le das ruido puro y puede «borrar» hasta sacar una imagen nueva. Añade un prompt de texto y borra en la dirección que describiste.

¿Por qué está en todas partes?

Calidad
Frente a los primeros modelos generativos, las imágenes son más ricas en detalle y más estables, menos propensas a desmoronarse.
Control
El texto, las imágenes de referencia y los retoques locales pueden guiarlo: va a donde apuntes.
Ecosistema abierto
La apertura de modelos como Stable Diffusion generó un aluvión de plugins y técnicas.

¿Cuáles son sus límites?

Generar una imagen exige muchos pasos iterativos, así que es más lento y pesado que otros modelos. Y como aprende de todo internet, el copyright y los sesgos siguen en debate.

En resumen: un modelo de difusión «saca» una imagen de una mancha de ruido, paso a paso.

Comentarios