Observabilité — 05 — SLO, SLI, SLA et error budgets
Définir et mesurer la fiabilité d'un service : SLI (ce qu'on mesure), SLO (l'objectif), SLA (le contrat), error budget (ce qu'il reste). Exemples PromQL et calculs concrets.
7 articles sur le thème "observabilité".
Définir et mesurer la fiabilité d'un service : SLI (ce qu'on mesure), SLO (l'objectif), SLA (le contrat), error budget (ce qu'il reste). Exemples PromQL et calculs concrets.
Construire des alertes actionnables : alerter sur les symptômes plutôt que les causes, réduire le bruit, écrire des runbooks utiles. Prometheus Alertmanager et Grafana.
Comment les traces distribuées relient les services entre eux. Spans, context propagation W3C TraceContext, stratégies de sampling. Exemples TypeScript et Python.
Introduction à l'observabilité : la différence entre monitoring et observabilité, les 3 piliers (logs, métriques, traces) et pourquoi tu as besoin des trois.
Instrumenter une API TypeScript et Python avec OpenTelemetry : auto-instrumentation, traces manuelles, métriques custom, export OTLP vers Jaeger et Prometheus.
Les 4 types de métriques Prometheus, les méthodes RED et USE pour choisir quoi mesurer, et l'implémentation avec prom-client (TypeScript) et prometheus-client (Python).
Passer des logs texte aux logs JSON structurés. Niveaux de log, correlation ID, aggregation. Implémentation avec pino (TypeScript) et structlog (Python).