Saltar al contenido
Explorar conocimiento

concepto · intermedio · 1 min de lectura

Alerting

El alerting notifica a las personas adecuadas cuando algo falla o esta por fallar, basandose en metricas, logs o traces que cruzan umbrales predefinidos.

No requiere conocimientos previos.

Alcance en breve

Cubre

  • Alerting as a concept

No cubre

  • implementation details

Supone

  • The reader understands relevant fundamentals.

Resumen

Sin alertas, el monitoreo es pasivo. El alerting automatiza la deteccion: cuando una metrica cruza un umbral —latencia p99 > 500ms por 5 minutos, tasa de errores > 1%, disco libre < 10%—, el sistema notifica al equipo. Una buena alerta es accionable, tiene un runbook, y no genera fatiga. MTTA y MTTR miden la efectividad del proceso.

Alcance y supuestos

Cubre alerting como practica, buenas practicas y herramientas. Asume familiaridad con monitoreo.

Modelo mental

Un detector de humo. No se prende todo el tiempo —eso seria un dashboard—. Solo suena cuando hay humo. Si suena cada vez que cocinas un pan, le sacas las pilas.

Uso práctico

  • ✅ Infraestructura, aplicaciones, procesos de negocio criticos.
  • ❌ Alertar por cada error 404 de un bot de scraping.

Ejemplo trabajado: alerta de latencia

Prometheus evalua rate(http_requests_total{status="500"}[5m]) > 0.1. Alertmanager recibe la alerta y notifica a Slack y PagerDuty. El on-call reconoce en 2 minutos y aplica el runbook.

Evidencia

  • Alertmanager, Grafana Alerting y PagerDuty son las herramientas principales.

Fuentes citadas