Skip to main content
As métricas são compatíveis com Prometheus através do Quarkus Micrometer, na porta de gerenciamento:
Tudo que o gateway publica sobre si mesmo é prefixado com fireflo_, então um match encontra tudo:
Habilitar a porta de gerenciamento move /q/metrics. Um job do Prometheus ainda apontando para a 8080 começa a receber 404s em vez de falhar ruidosamente, então mude o target de scrape ao mesmo tempo.Um scrape job retornando 404 parece “sem dados” em um dashboard, o que lê como um sistema quieto em vez de um monitor quebrado.

As métricas

Todos são gauges, lidos no momento do scrape, então nenhum custa algo por mensagem.

Os quatro que valem um alerta

fireflo_routing_failed_queue

Não-zero significa que mensagens se foram — sem CDR e sem receipt — a menos que outSms.enqueueFailedRouting esteja setado.

fireflo_cdr_failed

Receita que você não consegue faturar. Silencioso em todo lugar mais.

fireflo_rating_unrated

Tráfego entregue e cobrado nada. Cresce quieto e nunca se autocorrige.

amqp.bridge.degraded

No log em vez de métrica. A durabilidade REST se foi e nada mais vai te dizer.

routing_rules_broken é como você distingue corrigido de já-reportado

O log diz cada regra quebrada uma vez por regra, não uma vez por mensagem — deliberadamente, já que sem essa guarda seria uma linha por mensagem por tentativa exatamente no tráfego já indo mal. O contador só reseta quando uma nova tabela de roteamento é publicada. Então um log quieto não é prova de que o problema se foi, e este gauge é a forma confiável da mesma pergunta.

whitelist_would_reject antes de enforce

O modo report-only conta o que teria sido recusado sem recusá-lo.
Leia isso por um dia antes de mudar uma conta para enforcement. Transforma uma classe inteira de incidente de go-live em um número que você olha quando é conveniente.

Profundidade de fila por worker não está aqui

Ela precisaria de um meter por worker, registrado e retirado conforme workers iniciam e param. /ops/health a reporta por worker enquanto isso, então um alerta de backlog por fornecedor tem que vir de lá em vez do Prometheus.

Configuração de scrape

A porta 9000 carrega profundidades de fila, nomes de fornecedores, estado de binds e os controles que param um fornecedor. Nada disso pertence à porta que os clientes alcançam — mantenha em uma rede admin e não publique.

Relacionado

Live health

O estado que não está no Prometheus.

Tokens and access

Quais endpoints precisam de qual token.