Statut & uptime
Du check au statut
Section intitulée « Du check au statut »Chaque région exécute ses propres checks à son propre rythme et enregistre chaque résultat (succès, code HTTP, latence, erreur). Un statut est d’abord calculé par région, à partir des derniers checks de cette région seulement :
| Statut | Règle (par région) |
|---|---|
| up | Dernier check réussi, latence < 2 000 ms |
| degraded | Dernier check réussi mais ≥ 2 000 ms, ou échec mais la fenêtre de retries n’est pas encore pleine, ou réponse 3xx hors des codes acceptés (une redirection mal configurée, pas une panne — sauf si le monitor est réglé sur 3xx = down) |
| down | retries + 1 échecs consécutifs depuis cette région |
| paused / stale | Mis en pause par vous / aucun résultat reçu depuis 3 × l’intervalle (problème d’agent ou de réseau, jamais compté comme une panne) |
retries se règle par monitor (défaut 1, donc deux échecs consécutifs
sont nécessaires). Le premier échec est un avertissement léger : un faux
positif dû à un paquet perdu ne vous réveillera jamais.
Monitors multi-région : la règle de majorité
Section intitulée « Monitors multi-région : la règle de majorité »Quand un monitor tourne depuis plusieurs régions, chaque région juge la cible de son côté, puis le statut du monitor est décidé par vote majoritaire :
- DOWN — plus de la moitié des régions configurées ont confirmé la panne (leur fenêtre de retries est épuisée). 2 sur 3, 3 sur 5, 2 sur 2.
- PANNE PARTIELLE (degraded) — au moins une région confirme la panne mais pas la majorité. Le service est injoignable depuis quelque part — incident réseau régional, edge CDN, géo-blocage — et vous devez le savoir, mais la majorité du monde passe encore.
- UP — aucune région ne confirme de panne. Le rétablissement n’est déclaré que lorsque toutes les régions sont de nouveau saines.
Ce que reçoivent vos canaux d’alerte pour un monitor à 3 régions :
- Première région confirmée down → 1 alerte — Panne partielle (orange), avec la région concernée.
- Deuxième région confirmée → 1 alerte — Down (rouge), avec les deux régions.
- Les régions reviennent une à une → rien pour l’instant…
- Dernière région saine → 1 alerte — Rétabli, avec la durée totale d’indisponibilité.
Si la panne redescend sous la majorité avant d’être totalement résolue, vous recevez une désescalade Panne partielle, puis Rétabli quand tout est vert. Un monitor mono-région suit simplement sa région (avertissement léger au premier échec, down après la fenêtre de retries).
Où le statut est affiché
Section intitulée « Où le statut est affiché »Le même statut agrégé est affiché à trois endroits, toujours à partir des mêmes chiffres :
- La pastille de statut dans la barre du haut, sur toutes les pages du dashboard. Verte « Tous les systèmes opérationnels · n up » ; ambre dès qu’un monitor est dégradé ; rouge et pulsante dès qu’un monitor est down. Un clic ouvre une version condensée de la carte « Statut actuel » : ligne d’activité, barre de proportion, les monitors à traiter avec un lien vers chacun, la panne en cours ou le dernier incident, les checks sur 24 h, et un raccourci pour déclarer un incident. Elle se rafraîchit en direct via le même flux temps réel que le dashboard. Sur mobile, elle devient un point (plus un compteur en cas de problème) dans l’en-tête, qui ouvre la même carte en feuille en bas d’écran.
- La carte « Statut actuel » sur l’accueil du dashboard.
- Le badge « Alertes » de la sidebar — le nombre d’alertes non acquittées (voir Historique des alertes).
Les monitors en pause et les fenêtres de maintenance ne colorent jamais la pastille ; ils n’apparaissent qu’à l’intérieur de la carte.
Comment l’uptime % est calculé
Section intitulée « Comment l’uptime % est calculé »uptime % = checks réussis ÷ checks comptabilisés (sur la période choisie)- Toutes les régions comptent : un monitor à 3 régions et 1 min d’intervalle produit ~4 320 checks par jour. Une région down pendant que les autres sont up fait donc baisser l’uptime proportionnellement (une région sur trois down pendant une heure ≈ 98,6 % sur cette heure), ce qui correspond exactement à ce qu’ont vécu vos utilisateurs de cette région.
- Exclus du calcul : les checks pendant une fenêtre de maintenance, les résultats en état rate-limited (HTTP 429 ou quota d’un fournisseur LLM — le service a répondu, vous êtes bridé), et les périodes où le monitor était en pause.
- Lent ≠ down : un check > 2 s s’affiche degraded mais compte comme un succès dans l’uptime %.
- Indisponibilité (minutes) = checks échoués ÷ nombre de régions ayant rapporté × intervalle — des échecs simultanés depuis plusieurs régions sont la même panne, pas N pannes.
- Périodes : les cartes du dashboard utilisent 24 h ; status pages, rapports et API acceptent 24 h / 7 j / 30 j / 90 j / 365 j, toujours dans la limite de la rétention de votre plan (90 / 180 / 365 / 730 jours).
Les latences (moyenne, p50/p95/p99) n’utilisent que les checks réussis ou ayant obtenu une réponse HTTP — les 5 secondes d’abandon d’un timeout ne polluent jamais votre graphique de temps de réponse.
Ce que veulent dire les couleurs
Section intitulée « Ce que veulent dire les couleurs »Les mêmes quatre paliers partout où un uptime est affiché — le badge d’un monitor, la tuile Uptime /24 h, chaque case de la grille Disponibilité et la page de statut publique :
| Uptime | Palier | Couleur | En gros, sur 30 jours |
|---|---|---|---|
| ≥ 99,5 % | Excellent | Vert | jusqu’à 3 h 39 perdues |
| 98 – 99,5 % | Bon | Vert clair | jusqu’à 14 h 30 perdues |
| 95 – 98 % | Dégradé | Ambre | jusqu’à 36 h perdues |
| < 95 % | Critique | Rouge | plus de 36 h perdues |
Une nuance sur la grille horaire : une case ne peut prendre que les valeurs que votre intervalle autorise. À 5 minutes (12 checks dans l’heure), un seul échec fait 91,7 % — la case passe directement en Critique, sans jamais passer par Bon ni Dégradé. À 1 minute un échec fait 98,3 % et à 30 secondes 99,2 %, tous deux en Bon. Le palier dit la vérité sur ce qui s’est passé dans l’heure ; c’est l’intervalle qui décide de la finesse avec laquelle il peut le dire.
Sur la grille Disponibilité, la zone verte est dessinée en dégradé plutôt qu’en deux blocs — la plus profonde à 98 %, le vert de la marque à 100 % — et sa légende montre donc le dégradé sans chiffres. Survolez une case pour lire le pourcentage exact de cette heure.