Eskalation
Was eine Eskalationsrichtlinie tut
Abschnitt betitelt „Was eine Eskalationsrichtlinie tut“Ohne Eskalation wird ein Alarm einmal an die Kanäle gesendet, die am Monitor hängen, und damit hat es sich. Mit einer Richtlinie macht OKStatus weiter, bis ein Mensch den Alarm im Alarmprotokoll bestätigt.
Eskalationsrichtlinien finden Sie unter Alarmierung → Eskalation; verfügbar in den Tarifen Max und Enterprise.
Aufbau einer Richtlinie
Abschnitt betitelt „Aufbau einer Richtlinie“| Bestandteil | Was es ist |
|---|---|
| Name | „Produktion”, „Kundenseitig”, „Nachtschicht” … |
| Gilt für | Welche Monitors die Richtlinie abdeckt. Der Schalter Alle Monitors deckt jeden Monitor ab, auch später angelegte. Schalten Sie ihn aus, um nach Tag, nach Gruppe oder über bestimmte Monitors zu zielen — die drei addieren sich. |
| Stufen | Eine geordnete Liste. Jede Stufe hat eine Verzögerung (sofort oder nach N Minuten / Stunden / Tagen ohne Bestätigung) und einen oder mehrere Kanäle aus denen, die Sie bereits angelegt haben. |
| Wiederholen | Optional: Hat die letzte Stufe ausgelöst, alle N Minuten wiederholen, bis bestätigt wird. |
| Aktiviert | Eine deaktivierte Richtlinie bleibt erhalten, läuft aber nie. |
Eine typische Richtlinie:
- Sofort → Slack
#opsund die Bereitschafts-E-Mail. - Nach 10 Min. ohne Bestätigung → PagerDuty.
- Nach 30 Min. → SMS an die Entwicklungsleitung, alle 30 Min. wiederholt.
Wie die Stufen ablaufen
Abschnitt betitelt „Wie die Stufen ablaufen“- Nur Alarme Down und Beeinträchtigt eskalieren. Warnungen zu SSL- und Domain-Ablauf gehen einmal an die Kanäle des Monitors.
- Stufe 1 löst aus, sobald der Alarm entsteht. Kanäle, die den Alarm bereits erhalten haben, weil sie am Monitor hängen, werden übersprungen — niemand wird zum selben Ereignis zweimal geweckt.
- Jede Minute prüft die Engine jeden unbestätigten Alarm: Ist die Verzögerung der nächsten Stufe verstrichen? Wenn ja, werden deren Kanäle aufgerufen, und das Protokoll zeigt am ursprünglichen Alarm ein Abzeichen Stufe N.
- Bestätigen stoppt die Kette sofort. Nichts nach diesem Moment löst noch aus. Die Benachrichtigung Wiederhergestellt geht weiterhin über die eigenen Kanäle des Monitors hinaus, damit die Geweckten wissen, dass es vorbei ist.
- Die Kette stoppt außerdem von selbst, wenn der Monitor sich erholt, stummgeschaltet wird oder in ein Wartungsfenster eintritt.
- Passen mehrere Richtlinien auf denselben Monitor (eine über Tag, eine über Gruppe …), läuft jede von ihnen ihre eigene Kette. Halten Sie die Ziele überschneidungsfrei, wenn Sie das nicht wollen.
Was es (noch) nicht ist
Abschnitt betitelt „Was es (noch) nicht ist“Es gibt keine Bereitschaftspläne oder Rotationen: Eine Stufe nennt Kanäle, keine Personen. Richten Sie eine Stufe auf einen Kanal, der die Rotation bereits für Sie erledigt (PagerDuty, Opsgenie, Grafana IRM, incident.io …), und überlassen Sie ihm, wer Dienst hat.
Gute Gewohnheiten
Abschnitt betitelt „Gute Gewohnheiten“- Halten Sie Stufe 1 billig und breit (Chat + E-Mail) und setzen Sie den weckenden Kanal auf Stufe 2. Die meisten Alarme sind bestätigt, bevor sie auslöst.
- Geben Sie Wiederholen einen Wert, der mindestens so lang ist wie Ihre längste realistische Reaktionszeit — eine Wiederholung alle 5 Minuten bei einem 30-minütigen Ausfall sind 6 Weckrufe für ein Problem.
- Bestätigen Sie im Alarmprotokoll, nicht durch Stummschalten des Monitors: Stummschalten stoppt die Kette zwar auch, bringt aber zugleich jeden künftigen Alarm zum Schweigen.
- Testen Sie die ganze Kette einmal mit einem absichtlich kaputten Monitor und lesen Sie danach das Alarmprotokoll, um die dort vermerkten Stufen zu sehen.