Controla la saludde tu sistema
Pasar del «está caído» al «por qué está caído»: logs, métricas, trazas con OpenTelemetry, alertas, SLO y gestión de incidentes. Operar un sistema y saber qué hace por dentro.
Acceso al curso completo, ejercicios y material de entrevista.
// Log estructurado: la máquina puede filtrarlo y correlacionarlo { "level": "error", "msg": "pago rechazado", "trace_id": "a3f9c1", // enlaza con la traza "user_id": 4821, "latency_ms": 1320 }
No solo aprendes observabilidad. Te preparas para que te contraten.
Banco orientado a la entrevista técnica: qué diferencia logs, métricas y trazas, por qué alertarías sobre síntomas, qué es un SLO y un error budget, y cómo depurarías un fallo que solo ocurre en producción.
Ten siempre claro qué hace tu sistema y por qué falla cuando falla
Los tres pilares a fondo
Logs estructurados, métricas y series temporales, y trazas distribuidas: qué responde cada uno.
Métricas con criterio
Tipos, las cuatro señales doradas, percentiles frente a la media y la explosión de cardinalidad.
Instrumentar y correlacionar
OpenTelemetry sin atar tu código, el colector, y saltar de una métrica a la traza y al log exacto.
Alertas que no agotan
Alertar sobre síntomas y no causas, evitar la fatiga de alertas y avisar por consumo del error budget.
SLO, on-call e incidentes
SLI/SLO y presupuesto de error, guardia sostenible, gestionar la crisis y el postmortem sin culpa.
Depurar en producción
Partir de las señales y no adivinar, perfilado y latencia por percentiles, RUM y checks sintéticos.