Zum Inhalt springen

Metriken & KPIs

Jede Prüfung eines Agents erzeugt ein Rohergebnis: Erfolg oder Fehlschlag, Zeitmessungen und (bei manchen Monitor-Typen) protokollspezifische Daten. Alle KPIs im Dashboard, alle Diagramme und alle PDF-Berichte leiten sich aus diesen Rohergebnissen ab. Diese Seite erklärt jede Metrik, ihre Berechnung und worauf zu achten ist.

Der Anteil der Zeit, in der Ihr Dienst erreichbar war, über einen Zeitraum. Angezeigt für Fenster von 24 Std., 7 T., 30 T. und 365 T.

Verfügbarkeit = UP-Zeit / (Gesamtzeit − Wartungszeit) × 100

Geplante Wartungsfenster sind aus dem Nenner ausgeschlossen — geplante Ausfallzeit zählt nie gegen Ihre Verfügbarkeit oder Ihr SLA.

Ein Monitor wird erst nach 2 aufeinanderfolgenden fehlgeschlagenen Prüfungen auf DOWN gesetzt, ein verlorenes Paket oder ein kurzer Netzwerkaussetzer meldet also keinen Ausfall.

Das Verfügbarkeitsziel, das Sie je Bericht wählen (standardmäßig 99,5 %, z. B. 99,9 %). Berichte vergleichen die gemessene Verfügbarkeit je Monitor mit diesem Ziel und markieren jeden Monitor, der es verfehlt hat.

ZielMax. Ausfallzeit / 30 Tage
99 %~7 Std. 18 Min.
99,5 %~3 Std. 39 Min.
99,9 %~43 Min.
99,99 %~4 Min. 20 Sek.

Ein Vorfall beginnt, wenn ein Monitor auf DOWN wechselt (nach der Bestätigung durch 2 Prüfungen), und endet mit seiner Erholung. Die Gesamtausfallzeit eines Zeitraums ist die Summe der Vorfalldauern, Wartung ausgenommen.

Zeit vom Absenden der Anfrage bis zum Empfang der vollständigen Antwort, gemessen je Region — ein Monitor, der aus Paris und Frankfurt geprüft wird, hat je Standort eine Latenzreihe. Das Dashboard zeigt den letzten Wert und einen 24-Stunden-Durchschnitt; das Latenzdiagramm zeichnet den vollständigen Verlauf je Region.

Durchschnitte verstecken Ausreißer, deshalb berechnen Diagramme und Berichte zusätzlich Perzentile über das gewählte Fenster:

  • P50 (Median) — die Hälfte aller Prüfungen war schneller als dieser Wert. Ihre „typische” Erfahrung.
  • P95 — 95 % der Prüfungen waren schneller. Die Erfahrung Ihrer langsamsten Nutzer; die übliche SLO-Kennzahl.
  • P99 — 99 % der Prüfungen waren schneller. Erwischt seltene Ausreißer (GC-Pausen, Kaltstarts, Sättigung).

Ein gesunder Dienst hält P95 nahe bei P50. Eine wachsende Lücke bedeutet zunehmende Tail-Latenz, meist das erste Symptom von Sättigung.

Durchschnittliche Dauer eines Vorfalls: wie lange es im Mittel dauert, bis der Dienst nach einem Ausfall zurück ist. Niedriger ist besser — sie misst, wie schnell Probleme behoben werden.

Durchschnittliche Zeit zwischen dem Beginn eines Vorfalls und dem Beginn des nächsten (über die letzten 30 Tage berechnet). Höher ist besser — sie misst, wie selten Probleme auftreten.

Lesen Sie beide zusammen: hohe MTBF + niedrige MTTR = seltene, kurze Ausfälle.

KI-Modell-Monitore senden einen echten Prompt an Ihren Anbieter und messen das Token-Streaming:

Zeit vom Absenden des Prompts bis zum Eintreffen des ersten Tokens. Das ist die vom Nutzer wahrgenommene Verzögerung („fängt es an zu antworten?”) und meist das erste Anzeichen von Kapazitätsproblemen beim Anbieter — die TTFT driftet nach oben, lange bevor Anfragen wirklich scheitern. Eine Prüfung, die die konfigurierte maximale TTFT überschreitet, gilt als beeinträchtigt, selbst wenn sie am Ende durchläuft.

Durchschnittliche Zeit zwischen Tokens, sobald das Streaming begonnen hat (Gesamtdauer der Generierung ÷ Ausgabetokens). Sie bestimmt, wie schnell sich die Antwort nach dem ersten Token „hintippt”.

Die Latenz zwischen aufeinanderfolgenden Tokens während des Streamings. Wo TPOT der Durchschnitt ist, erfasst ITL die Streuung — Stottern und Hänger mitten in der Generierung zeigen sich hier, während TPOT noch gut aussehen kann.

Für HTTPS-Monitors verfolgt OKStatus zusätzlich:

  • Ablauf des SSL-Zertifikats — Tage bis zum Ablauf des Zertifikats; Alarme feuern im Voraus, und Berichte markieren alles unter 30 Tagen.
  • Ablauf der Domain — Tage bis zum Verfall der Domainregistrierung, dieselben Schwellen.
MetrikDashboardMonitor-DetailPDF-Berichte
Verfügbarkeit %✓✓ (4 Fenster)✓
Antwortzeit / Latenz✓✓ (je Region)✓ (Ø)
P50 / P95 / P99✓✓ (P95/P99)
MTTR / MTBF✓✓
TTFT / TPOT / ITL✓ (KI)✓ (KI)
SSL- / Domain-Ablauf✓✓