Aller au contenu

Escalade

Sans escalade, une alerte est envoyée une fois, aux canaux attachés au monitor, et c’est terminé. Avec une politique, OKStatus continue jusqu’à ce qu’un humain acquitte l’alerte dans le journal des alertes.

t0 · alerte +10 min +30 min +60 min SANS ACQUITTEMENT Niveau 1 Slack · email Niveau 2 PagerDuty Niveau 3 SMS astreinte répète 30 min ACQUITTÉ À +6 MIN Niveau 1 ACK par Alice les niveaux 2 et 3 ne partent jamais — « Rétabli » passe par les canaux du monitor

Les politiques d’escalade se gèrent dans Alerting → Escalade et sont disponibles sur les plans Max et Enterprise.

ÉlémentCe que c’est
Nom« Production », « Exposé clients », « Nuit »…
S’applique àLes monitors couverts. L’interrupteur Tous les monitors couvre tout, y compris les monitors créés plus tard. Désactivez-le pour cibler par tag, par groupe, ou en choisissant des monitors précis — les trois se cumulent.
NiveauxUne liste ordonnée. Chaque niveau a un délai (immédiatement, ou après N minutes / heures / jours sans acquittement) et un ou plusieurs canaux choisis parmi ceux déjà créés.
RépéterOptionnel : une fois le dernier niveau parti, le répéter toutes les N minutes jusqu’à acquittement.
ActivéeUne politique désactivée est conservée mais ne tourne jamais.

Une politique typique :

  1. Immédiatement → Slack #ops et l’email d’astreinte.
  2. Après 10 min sans acquittement → PagerDuty.
  3. Après 30 min → le SMS du responsable, répété toutes les 30 min.
  • Seules les alertes Down et Dégradé escaladent. Les avertissements SSL et domaine sont envoyés une fois, aux canaux du monitor.
  • Le niveau 1 part quand l’alerte est levée. Les canaux qui ont déjà reçu l’alerte parce qu’ils sont attachés au monitor sont ignorés : personne n’est appelé deux fois pour le même événement.
  • Chaque minute, le moteur passe en revue chaque alerte non acquittée : le délai du niveau suivant est-il écoulé ? Si oui, ses canaux sont appelés et le journal affiche un badge Niveau N sur l’alerte d’origine.
  • Acquitter l’alerte arrête la cascade immédiatement. Rien ne part après ce moment. La notification Rétabli passe toujours par les canaux du monitor, pour que les personnes appelées sachent que c’est terminé.
  • La cascade s’arrête aussi d’elle-même quand le monitor se rétablit, est mis en muet, ou entre dans une fenêtre de maintenance.
  • Si plusieurs politiques correspondent au même monitor (une par tag, une par groupe…), chacune déroule sa propre cascade. Gardez des cibles disjointes si ce n’est pas ce que vous voulez.

Pas de planning d’astreinte ni de rotation : un niveau nomme des canaux, pas des personnes. Pointez un niveau vers un canal qui gère déjà la rotation pour vous (PagerDuty, Opsgenie, Grafana IRM, incident.io…) et laissez-le décider qui est de garde.

  • Gardez le niveau 1 large et peu coûteux (chat + email), et mettez le canal qui réveille au niveau 2. La plupart des alertes sont acquittées avant qu’il ne parte.
  • Donnez à Répéter une valeur au moins aussi longue que votre temps de réaction réaliste — une répétition de 5 min sur une panne de 30 min, c’est 6 appels pour un seul problème.
  • Acquittez depuis le journal des alertes, pas en mettant le monitor en muet : le muet arrête aussi la cascade, mais il coupe aussi toutes les alertes à venir.
  • Testez toute la chaîne une fois avec un monitor volontairement cassé, puis lisez le journal des alertes pour voir les niveaux estampillés dessus.