Zum Inhalt springen

KI-Modell

Agent1 Region fester Prompt · Modell gestreamte Tokens LLM-AnbieterOpenAI-compatible · Anthropic · Bedrock ZEITLEISTE EINER PRÜFUNG TTFT · Zeit bis zum ersten Token TPOT · Zeit je Ausgabetoken · ITL Nur eine Region pro KI-Modell-Monitor — every region multiplies your real token spend. VIER ZUSTÄNDE up — rechtzeitig, Inhalt stimmt beeinträchtigt — langsame TTFT oder Zusicherung verfehlt ratelimit — 429, aus der Verfügbarkeit ausgenommen down — Zeitüberschreitung, 5xx, keine brauchbare Antwort

Der KI-Modell-Monitor (ein LLM-Canary) sendet nach Zeitplan einen festen Prompt an den Chat-Completions-Endpunkt eines LLM-Anbieters und prüft, dass er antwortet — und zwar korrekt und innerhalb akzeptabler Zeit. Er ist für Teams gebaut, die produktive Funktionen auf einer LLM-API betreiben und in dem Moment Bescheid wissen müssen, in dem diese Abhängigkeit schwächelt, nicht erst, wenn sie ganz ausfällt.

Angelegt wird er unter Monitore → Monitor hinzufügen, indem Sie in der Typliste KI-Modell wählen: Der Dialog fragt dann Anbieter, Endpunkt, API-Schlüssel und Modell ab statt der HTTP-Optionen. In der Monitor-Liste zeigt ein KI-Modell das Logo seines Anbieters in der Spalte Typ und seine Zeit bis zum ersten Token in der Spalte Ø /24h; wählen Sie KI-Modell im Filter Monitor-Typ, um nur diese zu sehen, mit einer Spalte Anbieter · Modell und der durchschnittlichen TTFT.

Verfügbar in Max (bis zu 5 KI-Modelle) und Enterprise (bis zu 20). Ein KI-Modell-Monitor läuft aus einer einzigen Region — es geht um die Gesundheit des Anbieters, nicht um geografische Erreichbarkeit, und jede Prüfung kostet Sie echte Tokens.

Ein Modell, das in Ihrem eigenen Netz läuft (Ollama, vLLM, TGI …), ist nur von dort erreichbar. Mit privaten Agents wählen Sie unter Checks ausführen von die Option Meine privaten Agents und dann den Agent, der es erreicht: Interne Adressen wie http://ollama.internal:11434/v1/chat/completions sind erlaubt. Der Check läuft von diesem einen Agent aus, so wie von einer Region bei einem öffentlichen Anbieter.

EinstellungBeschreibungStandard
Anbieteropenai-compatible, anthropic oder bedrockopenai-compatible
Endpunkt-URLDer Chat-Completions-Endpunkt des Anbieters—
API-SchlüsselZugangsdatum zur Authentifizierung der Anfrage—
ModellDie aufzurufende Modellkennung—
PromptDer feste Prompt, der bei jeder Prüfung gesendet wird—
RegionVon wo aus die Prüfung läuft—
Max. TTFTMaximal akzeptable Zeit bis zum ersten Token, in ms, bevor die Prüfung als beeinträchtigt gilt1500 ms
Erwarteter InhaltText, den die Antwort enthalten muss, damit die Qualitätszusicherung besteht—
Dialog „Neuer Monitor“ mit dem Typ KI-Modell, Schritt 1: Anbieter, Endpunkt-URL, API-Schlüssel und Modell

Anders als andere Monitor-Typen, die nur up oder down melden, unterscheiden KI-Modell-Prüfungen vier Zustände:

  • Up — Rechtzeitig geantwortet, mit Inhalt, der zur Zusicherung passt.
  • Beeinträchtigt — Geantwortet, aber die Qualitätszusicherung verfehlt oder die maximale TTFT überschritten (der Anbieter läuft, erfüllt aber nicht die Vorgabe).
  • Ratelimit — Eine vereinzelte 429 vom Anbieter erhalten — getrennt von einem echten Ausfall behandelt, damit ein Schwall Ratenbegrenzung Sie nicht weckt, als wäre der Anbieter ausgefallen.
  • Down — Überhaupt keine brauchbare Antwort (Zeitüberschreitung, Verbindungsfehler, 5xx).
  • Stille Qualitätsrückschritte erkennen — Ein Modell-Update beim Anbieter oder eine Konfigurationsänderung stromaufwärts kann den Endpunkt technisch „up” lassen, während die Antworten schlechter werden; die Inhaltszusicherung fängt das ab.
  • Latenzdrift verfolgen — Die TTFT ist oft das erste Anzeichen von Kapazitätsproblemen beim Anbieter, lange vor echten Fehlschlägen.
  • Ratenbegrenzung von Ausfällen unterscheiden — Fehlalarme vermeiden, wenn Sie schlicht Ihr eigenes Kontingent ausschöpfen.

Jede Prüfung erfasst den Ergebniszustand, die Antwortlatenz, die Zeit bis zum ersten Token (TTFT) und ob die Inhaltszusicherung bestanden wurde — und speist damit dieselben Diagramme und PDF-Berichte wie jeder andere Monitor-Typ.