concepto · intermedio · 1 min de lectura
Chaos Engineering
Chaos Engineering inyecta fallas controladas en producción para descubrir debilidades sistémicas antes de que causen una interrupción real.
No requiere conocimientos previos.
Alcance en breve
Cubre
- Chaos Engineering as a concept
No cubre
- implementation details
Supone
- The reader understands relevant fundamentals.
Resumen
Chaos Engineering, popularizado por Netflix con Chaos Monkey, consiste en inyectar fallas controladas en producción —matar un servidor, saturar una red— y observar cómo reacciona el sistema. No es aleatorio: es formular una hipótesis ("si se cae la DB principal, el failover debe completar en < 30s"), ejecutar el experimento con blast radius mínimo, y validar la hipótesis.
Alcance y supuestos
Cubre Chaos Engineering, principios, herramientas y el contraste con testing tradicional. Asume familiaridad con sistemas distribuidos.
Modelo mental
Un simulacro de incendio. No esperás a que haya un incendio real para saber si la gente sabe evacuar. Prendés la alarma un martes a las 10am y ves qué pasa. Chaos Engineering es el simulacro de incendio de tu infraestructura.
Uso práctico
- ✅ Sistemas distribuidos complejos donde la alta disponibilidad es crítica.
- ❌ Startups con 2 servidores y cero redundancia: primero construí la redundancia, después probala.
Ejemplo trabajado: experimento con Chaos Monkey
Hipótesis: si se cae un nodo de Cassandra, las lecturas siguen funcionando. Experimento: se detiene un nodo en prod 2 minutos. Resultado: lecturas continúan, pero latencia p99 sube de 50ms a 300ms. Conclusión: falta tuning en rebalanceo.
Evidencia
- Netflix (Chaos Monkey, Simian Army), Gremlin y Litmus Chaos son las herramientas principales.
Fuentes citadas
- Wikipedia, Unit testing (Síntesis, 21-07-2026)