Observabilité — 05 — SLO, SLI, SLA et error budgets
Définir et mesurer la fiabilité d'un service : SLI (ce qu'on mesure), SLO (l'objectif), SLA (le contrat), error budget (ce qu'il reste). Exemples PromQL et calculs concrets.
3 articles sur le thème "SRE".
Définir et mesurer la fiabilité d'un service : SLI (ce qu'on mesure), SLO (l'objectif), SLA (le contrat), error budget (ce qu'il reste). Exemples PromQL et calculs concrets.
Construire des alertes actionnables : alerter sur les symptômes plutôt que les causes, réduire le bruit, écrire des runbooks utiles. Prometheus Alertmanager et Grafana.
Introduction à l'observabilité : la différence entre monitoring et observabilité, les 3 piliers (logs, métriques, traces) et pourquoi tu as besoin des trois.