Ginawa para magbantay ng isang milyon na site
Sa likod ng iyong dashboard ay ang parehong observability stack na pinapatakbo namin sa platform: Prometheus at Grafana para sa metrics, OpenTelemetry para sa distributed tracing sa buong engine, workflows at drivers, at centralised structured logs na may tenant-tag habang hiwalay naman ang audit data.
Ang mga sukatan ay kinokolekta sa bawat serbisyo, bawat manggagawa, at bawat nangungupahan, kasama ang mga estadistika ng LVE sa bawat site mula sa layer ng paghihiwalay. Ang bawat takbo ng workflow — pagpaprovision, migrasyon, pagpapatupad — ay nakikita nang end-to-end, kaya naman ang sagot ng suporta ay maaaring maging tiyak sa halip na hula lamang.
Ang pagsubaybay sa malawakang saklaw ay problema sa dami ng data, kaya naman ito ay binuo bilang gayon. Ang mga mataas na dami ng sukatan ay hinahati ayon sa oras at pinagsasama sa halip na panatilihin bawat site bawat minuto magpakailanman, ang mga trace ay sinasample, at ang mga kontrol sa cardinality bawat tenant ay pumipigil sa isang maingay na account na magpababa sa mga dashboard ng iba. Ang layunin ng disenyo ay isang milyong site, hindi ang bilang na pinapatakbo namin ngayon.
Ang pag-alerto ay dinadaan sa Alertmanager patungo sa aming on-call rota kasama ang mga SLO na tinukoy at sinusubaybayan — sadyang pinapanatili itong hiwalay sa mga abiso ng customer sa itaas, upang ang ingay sa operasyon ay hindi kailanman mapunta sa iyong inbox at ang iyong mga alerto ay hindi kailanman pumila sa likod ng amin.