fireflo_, então um match encontra tudo:
As métricas
Todos são gauges, lidos no momento do scrape, então nenhum custa algo por mensagem.
Os quatro que valem um alerta
fireflo_routing_failed_queue
Não-zero significa que mensagens se foram — sem CDR e sem receipt — a menos que
outSms.enqueueFailedRouting esteja setado.fireflo_cdr_failed
Receita que você não consegue faturar. Silencioso em todo lugar mais.
fireflo_rating_unrated
Tráfego entregue e cobrado nada. Cresce quieto e nunca se autocorrige.
amqp.bridge.degraded
No log em vez de métrica. A durabilidade REST se foi e nada mais vai te dizer.
routing_rules_broken é como você distingue corrigido de já-reportado
O log diz cada regra quebrada uma vez por regra, não uma vez por mensagem — deliberadamente, já
que sem essa guarda seria uma linha por mensagem por tentativa exatamente no tráfego já indo mal.
O contador só reseta quando uma nova tabela de roteamento é publicada. Então um log quieto não é
prova de que o problema se foi, e este gauge é a forma confiável da mesma pergunta.
whitelist_would_reject antes de enforce
O modo report-only conta o que teria sido recusado sem recusá-lo.
Profundidade de fila por worker não está aqui
Ela precisaria de um meter por worker, registrado e retirado conforme workers iniciam e param./ops/health a reporta por worker enquanto isso, então um alerta de backlog por fornecedor tem
que vir de lá em vez do Prometheus.
Configuração de scrape
Relacionado
Live health
O estado que não está no Prometheus.
Tokens and access
Quais endpoints precisam de qual token.