Gebouwd om een miljoen websites te bewaken
Achter je dashboard bevindt zich dezelfde observability stack waar we het platform op draaien: Prometheus en Grafana voor metrics, OpenTelemetry voor distributed tracing over de engine, workflows en drivers, en gecentraliseerde gestructureerde logs die tenant-getagd zijn waarbij auditgegevens apart worden gehouden.
Metriek wordt verzameld per service, per worker en per tenant, met per-site LVE-statistieken vanuit de isolatielaag. Elke workflow-uitvoering — provisioning, migratie, handhaving — is end-to-end zichtbaar, en daarom kan een ondersteuningsantwoord specifiek zijn in plaats van een gok.
Monitoren op grote schaal is een datavolumeprobleem, dus het is ook zo ontworpen. Metrische gegevens met een hoog volume worden tijdgepartitioneerd en samengevat in plaats van voor eeuwig per site per minuut bewaard, traces worden gesampled en kardinaliteitscontroles per tenant zorgen ervoor dat één luidruchtig account de dashboards van al de anderen niet vertraagt. Het ontwerpdoel is een miljoen sites, niet het aantal dat we vandaag draaien.
Alerting wordt via Alertmanager naar ons on-call rotatieschema gestuurd met gedefinieerde en bijgehouden SLO's — bewust gescheiden gehouden van de bovenstaande klantnotificaties, zodat operationele ruis nooit in je inbox terechtkomt en je waarschuwingen nooit achter die van ons in de wachtrij staan.