Zum Inhalt springen

Eskalation

Ohne Eskalation wird ein Alarm einmal an die Kanäle gesendet, die am Monitor hängen, und damit hat es sich. Mit einer Richtlinie macht OKStatus weiter, bis ein Mensch den Alarm im Alarmprotokoll bestätigt.

t0 · Alarm +10 Min. +30 Min. +60 Min. KEINE BESTÄTIGUNG Stufe 1 Slack · E-Mail Stufe 2 PagerDuty Stufe 3 SMS Bereitschaft alle 30 Min. BESTÄTIGT NACH +6 MIN. Stufe 1 BEST. von Alice Stufen 2 und 3 lösen nie aus — „Wiederhergestellt" geht weiterhin an die Kanäle des Monitors

Eskalationsrichtlinien finden Sie unter Alarmierung → Eskalation; verfügbar in den Tarifen Max und Enterprise.

BestandteilWas es ist
Name„Produktion”, „Kundenseitig”, „Nachtschicht” …
Gilt fürWelche Monitors die Richtlinie abdeckt. Der Schalter Alle Monitors deckt jeden Monitor ab, auch später angelegte. Schalten Sie ihn aus, um nach Tag, nach Gruppe oder über bestimmte Monitors zu zielen — die drei addieren sich.
StufenEine geordnete Liste. Jede Stufe hat eine Verzögerung (sofort oder nach N Minuten / Stunden / Tagen ohne Bestätigung) und einen oder mehrere Kanäle aus denen, die Sie bereits angelegt haben.
WiederholenOptional: Hat die letzte Stufe ausgelöst, alle N Minuten wiederholen, bis bestätigt wird.
AktiviertEine deaktivierte Richtlinie bleibt erhalten, läuft aber nie.

Eine typische Richtlinie:

  1. Sofort → Slack #ops und die Bereitschafts-E-Mail.
  2. Nach 10 Min. ohne Bestätigung → PagerDuty.
  3. Nach 30 Min. → SMS an die Entwicklungsleitung, alle 30 Min. wiederholt.
  • Nur Alarme Down und Beeinträchtigt eskalieren. Warnungen zu SSL- und Domain-Ablauf gehen einmal an die Kanäle des Monitors.
  • Stufe 1 löst aus, sobald der Alarm entsteht. Kanäle, die den Alarm bereits erhalten haben, weil sie am Monitor hängen, werden übersprungen — niemand wird zum selben Ereignis zweimal geweckt.
  • Jede Minute prüft die Engine jeden unbestätigten Alarm: Ist die Verzögerung der nächsten Stufe verstrichen? Wenn ja, werden deren Kanäle aufgerufen, und das Protokoll zeigt am ursprünglichen Alarm ein Abzeichen Stufe N.
  • Bestätigen stoppt die Kette sofort. Nichts nach diesem Moment löst noch aus. Die Benachrichtigung Wiederhergestellt geht weiterhin über die eigenen Kanäle des Monitors hinaus, damit die Geweckten wissen, dass es vorbei ist.
  • Die Kette stoppt außerdem von selbst, wenn der Monitor sich erholt, stummgeschaltet wird oder in ein Wartungsfenster eintritt.
  • Passen mehrere Richtlinien auf denselben Monitor (eine über Tag, eine über Gruppe …), läuft jede von ihnen ihre eigene Kette. Halten Sie die Ziele überschneidungsfrei, wenn Sie das nicht wollen.

Es gibt keine Bereitschaftspläne oder Rotationen: Eine Stufe nennt Kanäle, keine Personen. Richten Sie eine Stufe auf einen Kanal, der die Rotation bereits für Sie erledigt (PagerDuty, Opsgenie, Grafana IRM, incident.io …), und überlassen Sie ihm, wer Dienst hat.

  • Halten Sie Stufe 1 billig und breit (Chat + E-Mail) und setzen Sie den weckenden Kanal auf Stufe 2. Die meisten Alarme sind bestätigt, bevor sie auslöst.
  • Geben Sie Wiederholen einen Wert, der mindestens so lang ist wie Ihre längste realistische Reaktionszeit — eine Wiederholung alle 5 Minuten bei einem 30-minütigen Ausfall sind 6 Weckrufe für ein Problem.
  • Bestätigen Sie im Alarmprotokoll, nicht durch Stummschalten des Monitors: Stummschalten stoppt die Kette zwar auch, bringt aber zugleich jeden künftigen Alarm zum Schweigen.
  • Testen Sie die ganze Kette einmal mit einem absichtlich kaputten Monitor und lesen Sie danach das Alarmprotokoll, um die dort vermerkten Stufen zu sehen.