Σχεδιασμένο για να παρακολουθεί ένα εκατομμύριο ιστότοπους
Πίσω από τον πίνακα ελέγχου σας βρίσκεται η ίδια υποδομή παρατηρησιμότητας πάνω στην οποία τρέχουμε την πλατφόρμα: Prometheus και Grafana για μετρικές, OpenTelemetry για κατανerημένη ανίχνευση σε ολόκληρη τη μηχανή, τις ροές εργασίας και τους οδηγούς, καθώς και κεντρικά δομημένα αρχεία καταγραφής (logs) που φέρουν ετικέτες μισθωτών (tenant-tagged), με τα δεδομένα ελέγχου (audit data) να διατηρούνται ξεχωριστά.
Οι μετρήσεις συλλέγονται ανά υπηρεσία, ανά εργάτη και ανά πελάτη, με στατιστικά στοιχεία LVE ανά ιστότοπο από το επίπεδο απομόνωσης. Κάθε εκτέλεση ροής εργασίας —εκχώρηση πόρων, μετανάστευση, επιβολή— είναι ορατή από άκρη σε άκρη, γι' αυτό και μια απάντηση υποστήριξης μπορεί να είναι συγκεκριμένη αντί για μια απλή εικασία.
Η παρακολούθηση σε μεγάλη κλίμακα είναι πρόβλημα όγκου δεδομένων, γι' αυτό και σχεδιάζεται ως τέτοιο. Οι μετρικές υψηλού όγκου κατατάσσονται σε χρονικές χωρίσεις και συνοψίζονται αντί να διατηρούνται ανά ιστότοπο και ανά λεπτό επ' αόριστον, τα traces λαμβάνονται με δειγματοληψία, και οι έλεγχοι πληθικότητας ανά tenant αποτρέπουν έναν θorρυβώδη λογαριασμό από το να υποβαθμίσει τα dashboards όλων των υπόλοιπων. Ο σχεδιαστικός στόχος είναι ένα εκατομμύριο ιστότοποι, όχι ο αριθμός που διαχειριζόμαστε σήμερα.
Η αποστολή ειδοποιήσεων δρομολογείται μέσω του Alertmanager στο πρόγραμμα εφημερίας μας με καθορισμένα και παρακολουθούμενους SLO — διατηρείται σκόπιμα χωριστά από τις παραπάνω ειδοποιήσεις πελατών, ώστε ο λειτουργικός θόρυβος να μη φτάνει ποτέ στα εισερχόμενά σας και οι ειδοποιήσεις σας να μην μπαίνουν ποτέ σε ουρά πίσω από τις δικές μας.