Observabilité — 05 — SLO, SLI, SLA et error budgets
Définir et mesurer la fiabilité d'un service : SLI (ce qu'on mesure), SLO (l'objectif), SLA (le contrat), error budget (ce qu'il reste). Exemples PromQL et calculs concrets.
4 articles sur le thème "Prometheus".
Définir et mesurer la fiabilité d'un service : SLI (ce qu'on mesure), SLO (l'objectif), SLA (le contrat), error budget (ce qu'il reste). Exemples PromQL et calculs concrets.
Construire des alertes actionnables : alerter sur les symptômes plutôt que les causes, réduire le bruit, écrire des runbooks utiles. Prometheus Alertmanager et Grafana.
Instrumenter une API TypeScript et Python avec OpenTelemetry : auto-instrumentation, traces manuelles, métriques custom, export OTLP vers Jaeger et Prometheus.
Les 4 types de métriques Prometheus, les méthodes RED et USE pour choisir quoi mesurer, et l'implémentation avec prom-client (TypeScript) et prometheus-client (Python).