Skip to main content
Les métriques sont compatibles Prometheus via Quarkus Micrometer, sur le port de gestion :
Tout ce que le gateway publie sur lui-même est préfixé fireflo_, donc un seul match trouve tout :
Activer le port de gestion déplace /q/metrics. Un job Prometheus encore pointé sur 8080 commence à obtenir des 404 plutôt que d’échouer bruyamment, donc changez la cible de scrape en même temps.Un job de scrape retournant 404 ressemble à « pas de données » sur un tableau de bord, ce qui se lit comme un système silencieux plutôt qu’un moniteur cassé.

Les métriques

Toutes des jauges, lues au moment du scrape, donc aucune ne coûte quoi que ce soit par message.

Les quatre qui valent une alerte

fireflo_routing_failed_queue

Non nul signifie que des messages sont partis. Pas de CDR et pas d’accusé. Sauf si outSms.enqueueFailedRouting est réglé.

fireflo_cdr_failed

Du revenu que vous ne pouvez pas facturer. Silencieux partout ailleurs.

fireflo_rating_unrated

Trafic livré et facturé rien. Croît silencieusement et ne s’auto-corrige jamais.

amqp.bridge.degraded

Dans le log plutôt qu’une métrique. La durabilité REST est partie et rien d’autre ne vous le dira.

routing_rules_broken est comment distinguer corrigé de déjà rapporté

Le log dit chaque règle cassée une fois par règle, pas une fois par message. Délibérément, puisque non gardé ce serait une ligne par message par tentative sur exactement le trafic déjà en erreur. Le compteur ne se remet à zéro que quand une nouvelle table de routage est publiée. Donc un log silencieux n’est pas la preuve que le problème est parti, et cette jauge est la forme fiable de la même question.

whitelist_would_reject avant d’appliquer

Le mode report-only compte ce qui aurait été refusé sans le refuser.
Lisez ceci pendant une journée avant de passer un compte à l’application. Cela transforme une classe entière d’incident de mise en production en un nombre que vous regardez quand c’est pratique.

La profondeur de file par worker n’est pas ici

Il faudrait un mètre par worker, enregistré et retiré à mesure que les workers démarrent et s’arrêtent. /ops/health la rapporte par worker en attendant, donc une alerte de backlog par vendeur doit venir de là plutôt que de Prometheus.

Configuration de scrape

Le port 9000 porte les profondeurs de file, les noms de vendeurs, l’état des binds et les contrôles qui arrêtent un vendeur. Rien de tout cela n’a sa place sur le port que les clients atteignent. Gardez-le sur un réseau admin et ne le publiez pas.

Connexes

Santé en direct

L’état qui n’est pas dans Prometheus.

Tokens et accès

Quels endpoints ont besoin de quel token.