Construit pentru a monitoriza un milion de site-uri
În spatele panoului de control se află aceeași stivă de observabilitate pe care rulăm platforma: Prometheus și Grafana pentru metrici, OpenTelemetry pentru urmărire distribuită în motor, fluxuri de lucru și drivere, precum și jurnale structurate centralizate, etichetate per chiriaș, cu datele de audit păstrate separat.
Metricile sunt colectate per serviciu, per worker și per tenant, cu statistici LVE per site din stratul de izolare. Fiecare execuție a unui flux de lucru — provisioning, migrare, enforcement — este vizibilă cap la cap, motiv pentru care un răspuns de la suport poate fi specific în loc să fie o presupunere.
Monitorizarea la scară largă este o problemă de volum de date, așa că a fost proiectată ca atare. Valorile cu volum mare sunt partiționate în timp și centralizate, în loc să fie păstrate per site, per minut pentru totdeauna, urmele (traces) sunt eșantionate, iar controalele de cardinalitate per chiriaș (tenant) împiedică un singur cont cu activitate intensă să degradeze panourile de control ale tuturor celorlalți. Obiectivul de proiectare este de un milion de site-uri, nu numărul pe care îl operăm astăzi.
Sistemul de alertare este direcționat prin Alertmanager către tura noastră de gardă, cu SLO-uri definite și urmărite – menținut în mod deliberat separat de notificările pentru clienți de mai sus, astfel încât zgomotul operațional să nu ajungă niciodată în căsuța ta poștală, iar alertele tale să nu stea niciodată la coadă în spatele ale noastre.