Metriken & KPIs
Überblick
Abschnitt betitelt „Überblick“Jede Prüfung eines Agents erzeugt ein Rohergebnis: Erfolg oder Fehlschlag, Zeitmessungen und (bei manchen Monitor-Typen) protokollspezifische Daten. Alle KPIs im Dashboard, alle Diagramme und alle PDF-Berichte leiten sich aus diesen Rohergebnissen ab. Diese Seite erklärt jede Metrik, ihre Berechnung und worauf zu achten ist.
Verfügbarkeit
Abschnitt betitelt „Verfügbarkeit“Verfügbarkeit (%)
Abschnitt betitelt „Verfügbarkeit (%)“Der Anteil der Zeit, in der Ihr Dienst erreichbar war, über einen Zeitraum. Angezeigt für Fenster von 24 Std., 7 T., 30 T. und 365 T.
Verfügbarkeit = UP-Zeit / (Gesamtzeit − Wartungszeit) × 100Geplante Wartungsfenster sind aus dem Nenner ausgeschlossen — geplante Ausfallzeit zählt nie gegen Ihre Verfügbarkeit oder Ihr SLA.
Ein Monitor wird erst nach 2 aufeinanderfolgenden fehlgeschlagenen Prüfungen auf DOWN gesetzt, ein verlorenes Paket oder ein kurzer Netzwerkaussetzer meldet also keinen Ausfall.
SLA-Ziel
Abschnitt betitelt „SLA-Ziel“Das Verfügbarkeitsziel, das Sie je Bericht wählen (standardmäßig 99,5 %, z. B. 99,9 %). Berichte vergleichen die gemessene Verfügbarkeit je Monitor mit diesem Ziel und markieren jeden Monitor, der es verfehlt hat.
| Ziel | Max. Ausfallzeit / 30 Tage |
|---|---|
| 99 % | ~7 Std. 18 Min. |
| 99,5 % | ~3 Std. 39 Min. |
| 99,9 % | ~43 Min. |
| 99,99 % | ~4 Min. 20 Sek. |
Vorfälle & Ausfallzeit
Abschnitt betitelt „Vorfälle & Ausfallzeit“Ein Vorfall beginnt, wenn ein Monitor auf DOWN wechselt (nach der Bestätigung durch 2 Prüfungen), und endet mit seiner Erholung. Die Gesamtausfallzeit eines Zeitraums ist die Summe der Vorfalldauern, Wartung ausgenommen.
Geschwindigkeit
Abschnitt betitelt „Geschwindigkeit“Antwortzeit / Latenz (ms)
Abschnitt betitelt „Antwortzeit / Latenz (ms)“Zeit vom Absenden der Anfrage bis zum Empfang der vollständigen Antwort, gemessen je Region — ein Monitor, der aus Paris und Frankfurt geprüft wird, hat je Standort eine Latenzreihe. Das Dashboard zeigt den letzten Wert und einen 24-Stunden-Durchschnitt; das Latenzdiagramm zeichnet den vollständigen Verlauf je Region.
Perzentile — P50, P95, P99
Abschnitt betitelt „Perzentile — P50, P95, P99“Durchschnitte verstecken Ausreißer, deshalb berechnen Diagramme und Berichte zusätzlich Perzentile über das gewählte Fenster:
- P50 (Median) — die Hälfte aller Prüfungen war schneller als dieser Wert. Ihre „typische” Erfahrung.
- P95 — 95 % der Prüfungen waren schneller. Die Erfahrung Ihrer langsamsten Nutzer; die übliche SLO-Kennzahl.
- P99 — 99 % der Prüfungen waren schneller. Erwischt seltene Ausreißer (GC-Pausen, Kaltstarts, Sättigung).
Ein gesunder Dienst hält P95 nahe bei P50. Eine wachsende Lücke bedeutet zunehmende Tail-Latenz, meist das erste Symptom von Sättigung.
Zuverlässigkeit
Abschnitt betitelt „Zuverlässigkeit“MTTR — mittlere Wiederherstellungszeit
Abschnitt betitelt „MTTR — mittlere Wiederherstellungszeit“Durchschnittliche Dauer eines Vorfalls: wie lange es im Mittel dauert, bis der Dienst nach einem Ausfall zurück ist. Niedriger ist besser — sie misst, wie schnell Probleme behoben werden.
MTBF — mittlere Zeit zwischen Ausfällen
Abschnitt betitelt „MTBF — mittlere Zeit zwischen Ausfällen“Durchschnittliche Zeit zwischen dem Beginn eines Vorfalls und dem Beginn des nächsten (über die letzten 30 Tage berechnet). Höher ist besser — sie misst, wie selten Probleme auftreten.
Lesen Sie beide zusammen: hohe MTBF + niedrige MTTR = seltene, kurze Ausfälle.
Metriken für KI-Modelle
Abschnitt betitelt „Metriken für KI-Modelle“KI-Modell-Monitore senden einen echten Prompt an Ihren Anbieter und messen das Token-Streaming:
TTFT — Zeit bis zum ersten Token
Abschnitt betitelt „TTFT — Zeit bis zum ersten Token“Zeit vom Absenden des Prompts bis zum Eintreffen des ersten Tokens. Das ist die vom Nutzer wahrgenommene Verzögerung („fängt es an zu antworten?”) und meist das erste Anzeichen von Kapazitätsproblemen beim Anbieter — die TTFT driftet nach oben, lange bevor Anfragen wirklich scheitern. Eine Prüfung, die die konfigurierte maximale TTFT überschreitet, gilt als beeinträchtigt, selbst wenn sie am Ende durchläuft.
TPOT — Zeit je Ausgabetoken
Abschnitt betitelt „TPOT — Zeit je Ausgabetoken“Durchschnittliche Zeit zwischen Tokens, sobald das Streaming begonnen hat (Gesamtdauer der Generierung ÷ Ausgabetokens). Sie bestimmt, wie schnell sich die Antwort nach dem ersten Token „hintippt”.
ITL — Latenz zwischen Tokens
Abschnitt betitelt „ITL — Latenz zwischen Tokens“Die Latenz zwischen aufeinanderfolgenden Tokens während des Streamings. Wo TPOT der Durchschnitt ist, erfasst ITL die Streuung — Stottern und Hänger mitten in der Generierung zeigen sich hier, während TPOT noch gut aussehen kann.
Zertifikate & Domains
Abschnitt betitelt „Zertifikate & Domains“Für HTTPS-Monitors verfolgt OKStatus zusätzlich:
- Ablauf des SSL-Zertifikats — Tage bis zum Ablauf des Zertifikats; Alarme feuern im Voraus, und Berichte markieren alles unter 30 Tagen.
- Ablauf der Domain — Tage bis zum Verfall der Domainregistrierung, dieselben Schwellen.
Wo welche Metrik erscheint
Abschnitt betitelt „Wo welche Metrik erscheint“| Metrik | Dashboard | Monitor-Detail | PDF-Berichte |
|---|---|---|---|
| Verfügbarkeit % | ✓ | ✓ (4 Fenster) | ✓ |
| Antwortzeit / Latenz | ✓ | ✓ (je Region) | ✓ (Ø) |
| P50 / P95 / P99 | ✓ | ✓ (P95/P99) | |
| MTTR / MTBF | ✓ | ✓ | |
| TTFT / TPOT / ITL | ✓ (KI) | ✓ (KI) | |
| SSL- / Domain-Ablauf | ✓ | ✓ |