Saltar al contenido
Explorar conocimiento

concepto · intermedio · 2 min de lectura

Diffusion Models

Los modelos de difusión generan datos —típicamente imágenes— mediante un proceso iterativo de agregar y remover ruido, siendo la base de DALL-E, Stable Diffusion y Midjourney.

No requiere conocimientos previos.

Alcance en breve

Cubre

  • Diffusion Models as a concept

No cubre

  • implementation details

Supone

  • The reader understands relevant fundamentals.

Resumen

Los diffusion models aprenden a generar datos invirtiendo un proceso de destrucción: primero toman una imagen real y le agregan ruido gradualmente hasta volverla ruido puro (forward process). Luego entrenan una red neuronal para revertir ese proceso: dado ruido, predecir cómo "des-ruidificarlo" paso a paso hasta obtener una imagen nítida (reverse process).

A diferencia de las GANs —que generan de una sola vez—, los diffusion models generan iterativamente, produciendo resultados de mayor calidad y diversidad. Son la base de DALL-E 3, Stable Diffusion, Midjourney y Sora (video).

Alcance y supuestos

Cubre diffusion models, el proceso forward/reverse y su contraste con GANs. Asume familiaridad con conceptos de ML.

Modelo mental

Un escultor que empieza con un bloque de mármol —ruido— y va removiendo material hasta revelar la estatua. Cada pasada del cincel —cada paso de difusión— refina un poco más. Los diffusion models son escultores que aprendieron a revelar imágenes desde el ruido.

Uso práctico

  • ✅ Generación de imágenes, video, audio, estructuras 3D, proteínas.
  • ❌ Generación en tiempo real: el proceso iterativo es lento comparado con GANs.

Ejemplo trabajado: Stable Diffusion

Prompt: "un gato astronauta en estilo油画". El modelo parte de ruido puro y en ~20-50 pasos de denoising produce una imagen. Cada paso refina detalles: primero la silueta, después los colores, finalmente las texturas.

Evidencia

  • Stable Diffusion (Stability AI), DALL-E (OpenAI) y Midjourney usan diffusion models.

Fuentes citadas