Exporter
Envoie une enveloppe content-free après une collecte locale réussie.
Acheminement de supervision
Topologie candidate A/B, séparation des identités, agrégation des cellules et livraison d’alertes bornée.
Le mode nominal et les pannes ont été exercés localement. Le mode dégradé conserve les limites de production et ne transforme pas ce lab en service déployé.
Envoie une enveloppe content-free après une collecte locale réussie.
Transmet le TLS depuis 10.72.40.50:9443 vers un collecteur.
Déduplique l’enveloppe et expose les métriques A/B.
Deux Prometheus scrutent chacun les deux collecteurs et agrègent par cellule/scope.
Groupe et route firing puis resolved vers le receiver avec send_resolved.
Valide, déduplique et persiste un état content-free.
Le lab coupe successivement Prometheus A, Alertmanager A, un puis deux collecteurs, le receiver et le gossip. Retry, déduplication, guérison et deadman stale à 180 s sont observés. LB privé, déploiement souverain et chemin humain restent absents.
Choisir un composant met à jour le contexte. Sans JavaScript, chaque lien ouvre directement sa fiche complète.
Le plan management reste privé. Le passthrough conserve l’identité edge jusqu’au collecteur, mais ne prouve pas l’adresse source backend du LB.
| Canal | Contrat | Identité / garde | Limite |
|---|---|---|---|
| Exporter vers collecteur | mTLS TCP/9443 via VIP; TLS transmis sans terminaison, sans Proxy Protocol | Identités télémétrie edge A/B déjà définies | CIDR source réel du backend LB non mesuré; health check TCP non sémantique |
| Prometheus vers métriques | GET /metrics direct sur chaque collecteur | prometheus-a.monitoring.navy.invalid ou prometheus-b.monitoring.navy.invalid; quatre rôles croisés refusés | Deux scrapes par Prometheus exercés localement; aucun certificat de production |
| Prometheus vers Alertmanager | Chaque Prometheus adresse directement A et B, jamais un LB | mTLS monitoring, vérification TLS non désactivable | Cluster local exercé; aucun déploiement souverain |
| Gossip Alertmanager | mTLS privé sur 9094 entre A et B | Certificats A/B et CA cluster dédiés | Gossip bilatéral, partition et guérison exercés localement; aucun SLO |
| Notification | Webhook mTLS privé; send_resolved=true; max_alerts=16; proxy et redirection refusés | Identité Alertmanager A/B vers receiver exploitation | Firing, resolved, retry et déduplication exercés localement; aucun receiver HA ou acquittement opérateur |
La redondance visée réduit les vues partielles, sans promettre une livraison exactement une fois.
Deux Prometheus 3.14.0 digest-pinnés ont chacun scruté les deux collecteurs. Le nominal sans faux incident, les pertes simple/double des collecteurs et la reprise sont exercés.
Deux Alertmanager 0.33.1 digest-pinnés ont été partitionnés. Les doublons attendus ont été dédupliqués par le receiver et le gossip a guéri, sans constituer une garantie exactement une fois.
Cette page possède l’acheminement HA et la notification. Les cinq alertes calculées localement restent décrites par le collecteur; les SLO et runbooks restent dans Observabilité et SLO.
Le runtime-lab local 12/12 exerce la chaîne synthétique. Il ne constitue ni une recette souveraine, ni une notification d’astreinte.
| Acquis local | Blocker de promotion |
|---|---|
| Deux collecteurs, deux Prometheus 3.14.0, deux Alertmanager 0.33.1 et le receiver réel; 7 endpoints mTLS, 2 scrapes par Prometheus, gossip bilatéral, 4 rôles croisés refusés et nominal sans faux incident. Le lab n’ouvre aucun port hôte, nettoie ressources et credentials temporaires et vérifie ses sources inchangées. | private-lb-not-deployed, load-balancer-backend-source-address-not-proven, aucun déploiement souverain, SLO, carrier ou PSTN réel |
| Perte Prometheus A; not-ready E2E avec Alertmanager A arrêté; firing vers resolved; perte simple puis double des collecteurs et reprise; panne receiver et retry; partition fail-open, doublons dédupliqués, guérison et deadman stale à 180 s. | Receiver HA/restauration, notification, acquittement et escalade humaine, astreinte et SLO non prouvés |