Escalade
Ce que fait une politique d’escalade
Section intitulée « Ce que fait une politique d’escalade »Sans escalade, une alerte est envoyée une fois, aux canaux attachés au monitor, et c’est terminé. Avec une politique, OKStatus continue jusqu’à ce qu’un humain acquitte l’alerte dans le journal des alertes.
Les politiques d’escalade se gèrent dans Alerting → Escalade et sont disponibles sur les plans Max et Enterprise.
Anatomie d’une politique
Section intitulée « Anatomie d’une politique »| Élément | Ce que c’est |
|---|---|
| Nom | « Production », « Exposé clients », « Nuit »… |
| S’applique à | Les monitors couverts. L’interrupteur Tous les monitors couvre tout, y compris les monitors créés plus tard. Désactivez-le pour cibler par tag, par groupe, ou en choisissant des monitors précis — les trois se cumulent. |
| Niveaux | Une liste ordonnée. Chaque niveau a un délai (immédiatement, ou après N minutes / heures / jours sans acquittement) et un ou plusieurs canaux choisis parmi ceux déjà créés. |
| Répéter | Optionnel : une fois le dernier niveau parti, le répéter toutes les N minutes jusqu’à acquittement. |
| Activée | Une politique désactivée est conservée mais ne tourne jamais. |
Une politique typique :
- Immédiatement → Slack
#opset l’email d’astreinte. - Après 10 min sans acquittement → PagerDuty.
- Après 30 min → le SMS du responsable, répété toutes les 30 min.
Comment les niveaux se résolvent
Section intitulée « Comment les niveaux se résolvent »- Seules les alertes Down et Dégradé escaladent. Les avertissements SSL et domaine sont envoyés une fois, aux canaux du monitor.
- Le niveau 1 part quand l’alerte est levée. Les canaux qui ont déjà reçu l’alerte parce qu’ils sont attachés au monitor sont ignorés : personne n’est appelé deux fois pour le même événement.
- Chaque minute, le moteur passe en revue chaque alerte non acquittée : le délai du niveau suivant est-il écoulé ? Si oui, ses canaux sont appelés et le journal affiche un badge Niveau N sur l’alerte d’origine.
- Acquitter l’alerte arrête la cascade immédiatement. Rien ne part après ce moment. La notification Rétabli passe toujours par les canaux du monitor, pour que les personnes appelées sachent que c’est terminé.
- La cascade s’arrête aussi d’elle-même quand le monitor se rétablit, est mis en muet, ou entre dans une fenêtre de maintenance.
- Si plusieurs politiques correspondent au même monitor (une par tag, une par groupe…), chacune déroule sa propre cascade. Gardez des cibles disjointes si ce n’est pas ce que vous voulez.
Ce que ce n’est pas (encore)
Section intitulée « Ce que ce n’est pas (encore) »Pas de planning d’astreinte ni de rotation : un niveau nomme des canaux, pas des personnes. Pointez un niveau vers un canal qui gère déjà la rotation pour vous (PagerDuty, Opsgenie, Grafana IRM, incident.io…) et laissez-le décider qui est de garde.
Bonnes habitudes
Section intitulée « Bonnes habitudes »- Gardez le niveau 1 large et peu coûteux (chat + email), et mettez le canal qui réveille au niveau 2. La plupart des alertes sont acquittées avant qu’il ne parte.
- Donnez à Répéter une valeur au moins aussi longue que votre temps de réaction réaliste — une répétition de 5 min sur une panne de 30 min, c’est 6 appels pour un seul problème.
- Acquittez depuis le journal des alertes, pas en mettant le monitor en muet : le muet arrête aussi la cascade, mais il coupe aussi toutes les alertes à venir.
- Testez toute la chaîne une fois avec un monitor volontairement cassé, puis lisez le journal des alertes pour voir les niveaux estampillés dessus.