Zum Inhalt springen

Status & Verfügbarkeit

Jede Region führt ihre eigenen Prüfungen nach eigenem Zeitplan aus und speichert jedes Ergebnis (Erfolg, HTTP-Code, Latenz, Fehler). Ein Status wird zuerst je Region berechnet, allein aus den jüngsten Prüfungen dieser Region:

StatusRegel (je Region)
upLetzte Prüfung erfolgreich, Latenz unter 2 000 ms
beeinträchtigtLetzte Prüfung erfolgreich, aber ≥ 2 000 ms, oder fehlgeschlagen, während das Wiederholungsfenster noch nicht voll ist, oder eine 3xx außerhalb der akzeptierten Codes (Weiterleitungsabweichung, kein Ausfall — außer der Monitor setzt 3xx = down)
downWiederholungen + 1 aufeinanderfolgende Fehlschläge aus dieser Region
pausiert / veraltetVon Ihnen pausiert / seit dem 3-Fachen des Intervalls kein Ergebnis erhalten (Agent- oder Netzwerkproblem, nie als Ausfall behandelt)
One region · interval 60 s · retries = 1 → window = 2 consecutive checks 200200 503503 503200200 beeinträchtigt 1. Fehlschlag (1/2) down 2/2 → bestätigt wiederhergestellt? Fenster noch nicht sauber up 2/2 ok Wiederholungen + 1 Fehlschläge = down Wiederholungen + 1 Erfolge = up

Wiederholungen wird je Monitor gesetzt (Standard 1, es braucht also zwei aufeinanderfolgende Fehlschläge). Der erste Fehlschlag ist eine leichte Warnung; ein Fehlalarm durch ein einzelnes verlorenes Paket weckt Sie nie.

Monitors über mehrere Regionen: die Mehrheitsregel

Abschnitt betitelt „Monitors über mehrere Regionen: die Mehrheitsregel“

Läuft ein Monitor aus mehreren Regionen, beurteilt jede Region das Ziel für sich, und der Status des Monitors entscheidet sich dann per Mehrheitsentscheid:

  • DOWN — mehr als die Hälfte der konfigurierten Regionen hat den Fehlschlag bestätigt (ihr Wiederholungsfenster ist ausgeschöpft). 2 von 3, 3 von 5, 2 von 2.
  • TEILAUSFALL (beeinträchtigt) — mindestens eine Region bestätigt den Fehlschlag, aber keine Mehrheit. Der Dienst ist von irgendwo nicht erreichbar — ein regionales Netzwerkproblem, ein CDN-Edge, eine Geosperre —, und Sie sollten das wissen, aber die Mehrheit der Welt kommt weiterhin durch.
  • UP — keine Region bestätigt einen Fehlschlag. Die Wiederherstellung wird erst erklärt, wenn jede Region wieder gesund ist.
3 regions configured · retries = 1 · each region confirmed independently fr-dc3 de-fra nl-ams 0 von 3 down UP kein Alarm fr-dc3 de-fra nl-ams 1 von 3 down · keine Mehrheit TEILAUSFALL 1 Alarm fr-dc3 de-fra nl-ams 2 von 3 down · Mehrheit DOWN 1 Alarm Back to UP only once every region is healthy again — one recovery alert.

Was bei einem Monitor mit 3 Regionen auf Ihren Alarmkanälen ankommt:

  1. Erste Region bestätigt down → 1 Alarm — Teilausfall (orange), mit Nennung der ausgefallenen Region.
  2. Zweite Region bestätigt → 1 Alarm — Down (rot), mit beiden Regionen.
  3. Regionen kommen eine nach der anderen zurück → noch nichts …
  4. Letzte Region gesund → 1 Alarm — Wiederhergestellt, mit der Gesamtausfalldauer.

Schrumpft der Ausfall unter die Mehrheit zurück, bevor alles wieder läuft, erhalten Sie eine Herabstufung auf Teilausfall und danach Wiederhergestellt, sobald alles grün ist. Ein Monitor mit einer Region folgt schlicht dieser einen Region (leichte Warnung beim ersten Fehlschlag, down nach dem Wiederholungsfenster).

KOPFZEILE · ALLES UP 🏢 acme /Monitors Alle Systeme betriebsbereit 24 up ▾ 🔍 Suchen… Strg F

TOP BAR · TEILAUSFALL 🏢 acme /Statusseiten 1 down · 1 beeinträchtigt / 24 ▾

Teilausfall api-eu-prod · down · 3/3 Regionen · 4 Min. → grün — alle Monitors up (oder in Wartung) amber — at least one beeinträchtigt, none down rot, pulsierend — mindestens einer down

Derselbe aggregierte Status erscheint an drei Stellen, immer aus denselben Zahlen:

  • Die Status-Pille in der Kopfzeile, auf jeder Seite des Dashboards. Grün „Alle Systeme betriebsbereit · n up”; bernstein, wenn mindestens ein Monitor beeinträchtigt ist; rot und pulsierend, wenn mindestens einer down ist. Ein Klick öffnet eine verdichtete Karte „Aktueller Status”: Aktivitätslinie, Verhältnisbalken, die Monitors, die Aufmerksamkeit brauchen, jeweils mit Link, der laufende Ausfall oder der letzte Vorfall, Prüfungen der letzten 24 Std. und eine Abkürzung, um einen Vorfall zu melden. Sie aktualisiert sich live aus demselben Echtzeitstrom wie das Dashboard. Auf dem Handy wird sie zu einem Punkt (plus Zähler, wenn etwas nicht stimmt) in der Kopfzeile und öffnet dieselbe Karte als Bottom Sheet.
  • Die Karte „Aktueller Status” auf der Startseite des Dashboards.
  • Das Abzeichen „Alarme” in der Seitenleiste — die Zahl der unbestätigten Alarme (siehe Alarmprotokoll).

Pausierte Monitors und Wartungsfenster färben die Pille nie; sie erscheinen nur innerhalb der Karte.

Verfügbarkeit % = erfolgreiche Prüfungen ÷ gewertete Prüfungen (über den gewählten Zeitraum)
  • Alle Regionen zählen: Ein Monitor mit 3 Regionen im Minutentakt erzeugt ~4 320 gewertete Prüfungen pro Tag. Eine Region, die down ist, während die anderen laufen, senkt die Verfügbarkeit also anteilig (eine von drei Regionen eine Stunde down ≈ 98,6 % für diese Stunde) — genau das, was Ihre Nutzer in dieser Region erlebt haben.
  • Aus der Wertung ausgenommen: Prüfungen während eines Wartungsfensters, Ergebnisse im Zustand ratelimit (HTTP 429 oder ein LLM-Anbieterkontingent — der Dienst hat geantwortet, Sie werden gedrosselt) und Zeiträume, in denen der Monitor pausiert war.
  • Langsam ≠ down: Eine Prüfung über 2 s erscheint als beeinträchtigt, zählt in der Verfügbarkeit aber als Erfolg.
  • Ausfallzeit (Minuten) = fehlgeschlagene Prüfungen ÷ Anzahl meldender Regionen × Prüfintervall — gleichzeitige Fehlschläge aus mehreren Regionen sind derselbe Ausfall in der Uhrzeit, nicht N Ausfälle.
  • Zeiträume: Die Karten im Dashboard nutzen 24 Std.; Statusseiten, Berichte und die API akzeptieren 24 Std. / 7 T. / 30 T. / 90 T. / 365 T., stets begrenzt durch die Aufbewahrung Ihres Tarifs (90 / 180 / 365 / 730 Tage).

Die Latenzwerte (Durchschnitt, p50/p95/p99) verwenden nur erfolgreiche Prüfungen oder solche, die eine HTTP-Antwort erhalten haben — die 5 Sekunden Wartezeit einer Zeitüberschreitung verunreinigen Ihr Antwortzeitdiagramm nie.

Dieselben vier Stufen überall dort, wo ein Verfügbarkeitswert erscheint — das Abzeichen an einem Monitor, die Kachel Verfügbarkeit /24 Std., jede Zelle des Verfügbarkeitsrasters und die öffentliche Statusseite:

VerfügbarkeitStufeFarbeGrob, über 30 Tage
≥ 99,5 %AusgezeichnetGrünbis zu 3 Std. 39 verloren
98 – 99,5 %GutHellgrünbis zu 14 Std. 30 verloren
95 – 98 %BeeinträchtigtBernsteinbis zu 36 Std. verloren
< 95 %KritischRotmehr als 36 Std. verloren

Ein Vorbehalt zum Stundenraster: Eine Zelle kann nur die Werte annehmen, die Ihr Prüfintervall zulässt. Bei 5 Minuten (12 Prüfungen in der Stunde) sind ein einzelner Fehlschlag 91,7 %, die Zelle springt also direkt auf Kritisch — sie durchläuft nie Gut oder Beeinträchtigt. Bei 1 Minute sind ein einzelner Fehlschlag 98,3 % und bei 30 Sekunden 99,2 %, beides Gut. Die Stufe ist ehrlich darüber, was in dieser Stunde geschah; das Intervall entscheidet, wie fein sie es sagen kann.

Im Verfügbarkeitsraster ist die grüne Zone als Verlauf gezeichnet statt als zwei flache Blöcke — am tiefsten bei 98 %, das volle Markengrün bei 100 % —, weshalb ihre Legende den Verlauf ohne Zahlen zeigt. Fahren Sie über eine Zelle, um den genauen Prozentwert dieser Stunde zu sehen.