Napravljeno da prati milion sajtova
Iza vaše kontrolne table nalazi se isti stek za opservabilnost na kome pokrećemo platformu: Prometheus i Grafana za metrike, OpenTelemetry za distribuirano praćenje kroz endžin, radne tokove i drajvere, kao i centralizovani strukturirani dnevnici koji su označeni u odnosu na zakupca, pri čemu su revizorski podaci odvojeni.
Metrike se prikupljaju po servisu, po radniku i po zakupcu, uz LVE statistiku po sajtu iz sloja izolacije. Svako izvršavanje radnog toka — rezervisanje resursa, migracija, primena — vidljivo je od početka do kraja, zbog čega odgovor podrške može biti precizan umesto nagađanja.
Praćenje u velikom obimu predstavlja problem količine podataka, pa je tako i dizajnirano. Metrike velike zapremine se vremenski dele i sumiraju umesto da se čuvaju po sajtu i po minutu zauvek, tragovi se uzorkuju, a kontrole kardinalnosti po zakupcu sprečavaju da jedan bučan nalog naruši kontrolne table svih ostalih. Cilj dizajna je milion sajtova, a ne broj koji danas pokrećemo.
Uzbunjivanje se usmerava preko Alertmanager-a do našeg dežurnog tima sa definisanim i praćenim SLO-ovima — što je namerno odvojeno od gorenavedenih obaveštenja za klijente, tako da operativna buka nikada ne dospe u vaše prijemno sanduče, niti vaši alarmi ikada čekaju u redu iza naših.