एक दशलक्ष साईट्सवर लक्ष ठेवण्यासाठी बनवलेले
तुमच्या डॅशबोर्डच्या मागे तेच ऑब्झर्व्हबिलिटी स्टॅक आहे ज्यावर आम्ही प्लॅटफॉर्म चालवतो: मेट्रिक्ससाठी Prometheus आणि Grafana, इंजिन, वर्कफ्लो आणि ड्रायव्हर्समधील डिस्ट्रिब्युटेड ट्रेमिंगसाठी OpenTelemetry, आणि ऑडिट डेटा वेगळा ठेवून टेनंट-टॅग केलेले केंद्रीकृत संरचित लॉग.
प्रत्येक सेवेसाठी, प्रत्येक वर्करसाठी आणि प्रत्येक टेनंटसाठी मेट्रिक्स गोळा केले जातात, ज्यामध्ये आयसोलेशन लेयरमधील प्रति-साइट LVE आकडेवारी समाविष्ट असते. प्रत्येक वर्कफ्लो रन — प्रोव्हिजनिंग, मायग्रेशन, एन्फोर्समेंट — एंड-टू-एंड दृश्यमान असते, म्हणूनच सपोर्टचे उत्तर अंदाजाऐवजी अचूक असू शकते.
मोठ्या प्रमाणातील मॉनिटरिंग ही डेटा-व्हॉल्यूमची समस्या आहे, त्यामुळे ती तशीच डिझाइन केली आहे. उच्च-व्हॉल्यूम मेट्रिक्स हे प्रति-साइट प्रति-मिनिट नेहमीसाठी ठेवण्याऐवजी वेळेनुसार विभागले जातात आणि एकत्रित केले जातात, ट्रेस नमुनेदार (सॅमपल) केले जातात, आणि प्रति-टेनंट कार्डिनॅलिटी नियंत्रणे एकाच नॉइझी खात्याला इतर सर्वांचे डॅशबोर्ड खराब करण्यापासून रोखतात. डिझाइनचे उद्दिष्ट दहा लाख साइट्सचे आहे, आपण आज चालवत असलेल्या संख्येचे नाही.
अलर्टिंग ॲलर्टमॅनेजरद्वारे आमच्या ऑन-कॉल रोटाकडे पाठवली जाते, ज्यामध्ये परिभाषित केलेले आणि ट्रॅक केलेले SLOs असतात — वरील ग्राहक सूचनांपासून जाणीवपूर्वक वेगळे ठेवलेले, जेणेकरून ऑपरेशनल आवाज कधीही तुमच्या इनबॉक्समध्ये पोहोचणार नाही आणि तुमचे अलर्ट आमच्या मागे कधीही रांगेत असणार नाहीत.