Aller au contenu

Statut & uptime

Chaque région exécute ses propres checks à son propre rythme et enregistre chaque résultat (succès, code HTTP, latence, erreur). Un statut est d’abord calculé par région, à partir des derniers checks de cette région seulement :

StatutRègle (par région)
upDernier check réussi, latence < 2 000 ms
degradedDernier check réussi mais ≥ 2 000 ms, ou échec mais la fenêtre de retries n’est pas encore pleine, ou réponse 3xx hors des codes acceptés (une redirection mal configurée, pas une panne — sauf si le monitor est réglé sur 3xx = down)
downretries + 1 échecs consécutifs depuis cette région
paused / staleMis en pause par vous / aucun résultat reçu depuis 3 × l’intervalle (problème d’agent ou de réseau, jamais compté comme une panne)
One region · interval 60 s · retries = 1 → window = 2 consecutive checks 200200 503503 503200200 degraded 1st failure (1/2) down 2/2 → confirmed recovered? window not clean yet up 2/2 ok retries + 1 failures = down retries + 1 successes = up

retries se règle par monitor (défaut 1, donc deux échecs consécutifs sont nécessaires). Le premier échec est un avertissement léger : un faux positif dû à un paquet perdu ne vous réveillera jamais.

Quand un monitor tourne depuis plusieurs régions, chaque région juge la cible de son côté, puis le statut du monitor est décidé par vote majoritaire :

  • DOWN — plus de la moitié des régions configurées ont confirmé la panne (leur fenêtre de retries est épuisée). 2 sur 3, 3 sur 5, 2 sur 2.
  • PANNE PARTIELLE (degraded) — au moins une région confirme la panne mais pas la majorité. Le service est injoignable depuis quelque part — incident réseau régional, edge CDN, géo-blocage — et vous devez le savoir, mais la majorité du monde passe encore.
  • UP — aucune région ne confirme de panne. Le rétablissement n’est déclaré que lorsque toutes les régions sont de nouveau saines.
3 regions configured · retries = 1 · each region confirmed independently fr-dc3 de-fra nl-ams 0 of 3 down UP no alert fr-dc3 de-fra nl-ams 1 of 3 down · not a majority PARTIAL OUTAGE 1 alert fr-dc3 de-fra nl-ams 2 of 3 down · majority DOWN 1 alert Back to UP only once every region is healthy again — one recovery alert.

Ce que reçoivent vos canaux d’alerte pour un monitor à 3 régions :

  1. Première région confirmée down → 1 alerte — Panne partielle (orange), avec la région concernée.
  2. Deuxième région confirmée → 1 alerte — Down (rouge), avec les deux régions.
  3. Les régions reviennent une à une → rien pour l’instant…
  4. Dernière région saine → 1 alerte — Rétabli, avec la durée totale d’indisponibilité.

Si la panne redescend sous la majorité avant d’être totalement résolue, vous recevez une désescalade Panne partielle, puis Rétabli quand tout est vert. Un monitor mono-région suit simplement sa région (avertissement léger au premier échec, down après la fenêtre de retries).

TOP BAR · EVERYTHING UP 🏢 acme /Monitors All systems operational 24 up ▾ 🔍 Search… Ctrl F

TOP BAR · PARTIAL OUTAGE 🏢 acme /Status pages 1 down · 1 degraded / 24 ▾

Partial outage api-eu-prod · down · 3/3 regions · 4 min → green — all monitors up (or in maintenance) amber — at least one degraded, none down red, pulsing — at least one down

Le même statut agrégé est affiché à trois endroits, toujours à partir des mêmes chiffres :

  • La pastille de statut dans la barre du haut, sur toutes les pages du dashboard. Verte « Tous les systèmes opérationnels · n up » ; ambre dès qu’un monitor est dégradé ; rouge et pulsante dès qu’un monitor est down. Un clic ouvre une version condensée de la carte « Statut actuel » : ligne d’activité, barre de proportion, les monitors à traiter avec un lien vers chacun, la panne en cours ou le dernier incident, les checks sur 24 h, et un raccourci pour déclarer un incident. Elle se rafraîchit en direct via le même flux temps réel que le dashboard. Sur mobile, elle devient un point (plus un compteur en cas de problème) dans l’en-tête, qui ouvre la même carte en feuille en bas d’écran.
  • La carte « Statut actuel » sur l’accueil du dashboard.
  • Le badge « Alertes » de la sidebar — le nombre d’alertes non acquittées (voir Historique des alertes).

Les monitors en pause et les fenêtres de maintenance ne colorent jamais la pastille ; ils n’apparaissent qu’à l’intérieur de la carte.

uptime % = checks réussis ÷ checks comptabilisés (sur la période choisie)
  • Toutes les régions comptent : un monitor à 3 régions et 1 min d’intervalle produit ~4 320 checks par jour. Une région down pendant que les autres sont up fait donc baisser l’uptime proportionnellement (une région sur trois down pendant une heure ≈ 98,6 % sur cette heure), ce qui correspond exactement à ce qu’ont vécu vos utilisateurs de cette région.
  • Exclus du calcul : les checks pendant une fenêtre de maintenance, les résultats en état rate-limited (HTTP 429 ou quota d’un fournisseur LLM — le service a répondu, vous êtes bridé), et les périodes où le monitor était en pause.
  • Lent ≠ down : un check > 2 s s’affiche degraded mais compte comme un succès dans l’uptime %.
  • Indisponibilité (minutes) = checks échoués ÷ nombre de régions ayant rapporté × intervalle — des échecs simultanés depuis plusieurs régions sont la même panne, pas N pannes.
  • Périodes : les cartes du dashboard utilisent 24 h ; status pages, rapports et API acceptent 24 h / 7 j / 30 j / 90 j / 365 j, toujours dans la limite de la rétention de votre plan (90 / 180 / 365 / 730 jours).

Les latences (moyenne, p50/p95/p99) n’utilisent que les checks réussis ou ayant obtenu une réponse HTTP — les 5 secondes d’abandon d’un timeout ne polluent jamais votre graphique de temps de réponse.

Les mêmes quatre paliers partout où un uptime est affiché — le badge d’un monitor, la tuile Uptime /24 h, chaque case de la grille Disponibilité et la page de statut publique :

UptimePalierCouleurEn gros, sur 30 jours
≥ 99,5 %ExcellentVertjusqu’à 3 h 39 perdues
98 – 99,5 %BonVert clairjusqu’à 14 h 30 perdues
95 – 98 %DégradéAmbrejusqu’à 36 h perdues
< 95 %CritiqueRougeplus de 36 h perdues

Une nuance sur la grille horaire : une case ne peut prendre que les valeurs que votre intervalle autorise. À 5 minutes (12 checks dans l’heure), un seul échec fait 91,7 % — la case passe directement en Critique, sans jamais passer par Bon ni Dégradé. À 1 minute un échec fait 98,3 % et à 30 secondes 99,2 %, tous deux en Bon. Le palier dit la vérité sur ce qui s’est passé dans l’heure ; c’est l’intervalle qui décide de la finesse avec laquelle il peut le dire.

Sur la grille Disponibilité, la zone verte est dessinée en dégradé plutôt qu’en deux blocs — la plus profonde à 98 %, le vert de la marque à 100 % — et sa légende montre donc le dégradé sans chiffres. Survolez une case pour lire le pourcentage exact de cette heure.