Construído para monitorar um milhão de sites
Por trás do seu painel está a mesma pilha de observabilidade em que executamos a plataforma: Prometheus e Grafana para métricas, OpenTelemetry para rastreamento distribuído no mecanismo, fluxos de trabalho e drivers, e logs estruturados centralizados rotulados por locatário, com os dados de auditoria mantidos separados.
As métricas são coletadas por serviço, por worker e por tenant, com estatísticas LVE por site da camada de isolamento. Cada execução de workflow — provisionamento, migração, imposição — é visível de ponta a ponta, e é por isso que uma resposta de suporte pode ser específica em vez de um palpite.
O monitoramento em escala é um problema de volume de dados, por isso foi projetado como tal. Métricas de alto volume são particionadas por tempo e consolidadas em vez de mantidas por site e por minuto para sempre, os rastreamentos são amostrados e os controles de cardinalidade por locatário impedem que uma única conta barulhenta degrade os painéis de todos os outros. A meta de projeto é de um milhão de sites, e não o número que operamos hoje.
Os alertas são direcionados pelo Alertmanager para a nossa escala de plantão, com SLOs definidos e monitorados — mantidos propositalmente separados das notificações de clientes acima, para que o ruído operacional nunca chegue à sua caixa de entrada e os seus alertas nunca fiquem na fila atrás dos nossos.