Zum Inhalt springen

So funktioniert die Alarmierung

1 · ALARM — Maschine Von der Engine erkannt DOWN TEILWEISE für die Aufbewahrung des Tarifs behalten, auch ohne angehängten Kanal

2 · VORFALL — Mensch Was Sie mitteilen Schweregrad · Status · Updates auf der Statusseite veröffentlicht aus einem Alarm mit einem Klick erzeugt

3 · ESKALATION Wer, in welcher Reihenfolge 1 · sofort→ Slack 2 · +10 Min.→ PagerDuty 3 · +30 Min.→ E-Mail bis jemand bestätigt

4 · KANÄLE Slack E-Mail PagerDuty Webhook +14 weitere

Dashboard › Alarmierung: Alarme (Verlauf, Bestätigung, CSV) · Vorfälle · Eskalation · Kanäle · Wartung Eine Regel: Eine Information lebt an genau einem Ort. Die Glocke in der Kopfzeile trägt nur Produktbenachrichtigungen, nie Monitoring-Alarme. Die Status-Pille der Organisation in der Kopfzeile und das Abzeichen „Alarme” in der Seitenleiste sind die dauerhaften Signale.

Der Bereich Alarmierung des Dashboards ist um fünf Objekte herum gebaut, jedes mit eigener Seite — und einer Regel: Eine Information lebt an genau einem Ort.

SeiteWas sie enthält
AlarmeJedes von der Engine erkannte Ereignis — down, Teilausfall, beeinträchtigt, wiederhergestellt, SSL-Ablauf — ob benachrichtigt oder nicht.
VorfälleWas Sie melden und mitteilen: Schweregrad, Status, Aktualisierungen, Veröffentlichung auf der Statusseite.
EskalationWer benachrichtigt wird, in welcher Reihenfolge, nach welcher Zeit ohne Bestätigung.
KanäleDie Ziele: Slack, E-Mail, PagerDuty, Webhooks … (achtzehn davon, siehe unten).
WartungGeplante Fenster, die Alarme für die von ihnen abgedeckten Monitors verstummen lassen.

Die Glocke in der Kopfzeile ist für Produktbenachrichtigungen da (Besuchermeldungen auf Ihren Statusseiten, Abrechnung) — nie für Monitoring-Alarme. Das dauerhafte Monitoring-Signal sind die Status-Pille in der Kopfzeile und das Abzeichen Alarme in der Seitenleiste.

Von einer fehlgeschlagenen Prüfung zum benachrichtigten Menschen

Abschnitt betitelt „Von einer fehlgeschlagenen Prüfung zum benachrichtigten Menschen“
  1. Erkennung — die Prüfung eines Agents schlägt fehl. Die Engine wendet das Wiederholungsfenster an und, bei Monitors mit mehreren Regionen, die Mehrheitsregel (siehe Status & Verfügbarkeit). Nur eine bestätigte Zustandsänderung löst einen Alarm aus.
  2. Alarm — eine Zeile im Alarmprotokoll: was, wann, welcher Monitor, mit den Belegen. Sie dort zu bestätigen ist das, was „jemand kümmert sich” für OKStatus bedeutet.
  3. Benachrichtigung — der Alarm geht an jeden Kanal, der am Monitor hängt, gefiltert nach den Alarmarten, die der Kanal akzeptiert. Was gesendet wurde und ob es zugestellt wurde, steht am Alarm.
  4. Eskalation — in Max und Enterprise macht eine Eskalationsrichtlinie nach Stufe 1 weiter: mehr Kanäle nach N Minuten ohne Bestätigung, optional wiederholt, bis jemand bestätigt.
  5. Kommunikation — Sie entscheiden, was die Außenwelt sieht: ein Vorfall auf der Statusseite, ein geplantes Wartungsfenster, das Alarme vor geplanten Arbeiten verstummen lässt, und Abonnenten-E-Mails, die von selbst hinausgehen.
SituationAlarme ausgelöst?Kanäle aufgerufen?Statusseite
Monitor pausiertNein — es laufen keine PrüfungenNeinAls pausiert gezeigt
Monitor stummgeschaltetJa, protokolliertNeinEchter Status
Innerhalb eines WartungsfenstersNeinNein„In Wartung”
Alarm bestätigtBereits ausgelöstEskalation stoppt; Wiederherstellung geht weiterUnverändert
Kein Kanal angehängtJa, mit Abzeichen „kein Kanal”Nichts aufzurufenUnverändert