concepto · intermedio · 2 min de lectura
Diffusion Models
Los modelos de difusión generan datos —típicamente imágenes— mediante un proceso iterativo de agregar y remover ruido, siendo la base de DALL-E, Stable Diffusion y Midjourney.
No requiere conocimientos previos.
Alcance en breve
Cubre
- Diffusion Models as a concept
No cubre
- implementation details
Supone
- The reader understands relevant fundamentals.
Resumen
Los diffusion models aprenden a generar datos invirtiendo un proceso de destrucción: primero toman una imagen real y le agregan ruido gradualmente hasta volverla ruido puro (forward process). Luego entrenan una red neuronal para revertir ese proceso: dado ruido, predecir cómo "des-ruidificarlo" paso a paso hasta obtener una imagen nítida (reverse process).
A diferencia de las GANs —que generan de una sola vez—, los diffusion models generan iterativamente, produciendo resultados de mayor calidad y diversidad. Son la base de DALL-E 3, Stable Diffusion, Midjourney y Sora (video).
Alcance y supuestos
Cubre diffusion models, el proceso forward/reverse y su contraste con GANs. Asume familiaridad con conceptos de ML.
Modelo mental
Un escultor que empieza con un bloque de mármol —ruido— y va removiendo material hasta revelar la estatua. Cada pasada del cincel —cada paso de difusión— refina un poco más. Los diffusion models son escultores que aprendieron a revelar imágenes desde el ruido.
Uso práctico
- ✅ Generación de imágenes, video, audio, estructuras 3D, proteínas.
- ❌ Generación en tiempo real: el proceso iterativo es lento comparado con GANs.
Ejemplo trabajado: Stable Diffusion
Prompt: "un gato astronauta en estilo油画". El modelo parte de ruido puro y en ~20-50 pasos de denoising produce una imagen. Cada paso refina detalles: primero la silueta, después los colores, finalmente las texturas.
Evidencia
- Stable Diffusion (Stability AI), DALL-E (OpenAI) y Midjourney usan diffusion models.
Fuentes citadas
- Wikipedia, Object-oriented programming (Síntesis, 21-07-2026)