สร้างขึ้นเพื่อรองรับเว็บไซต์นับล้าน
เบื้องหลังแดชบอร์ดของคุณคือสแต็กการสังเกตการณ์ชุดเดียวกับที่เราใช้รันแพลตฟอร์ม: Prometheus และ Grafana สำหรับเมตริก, OpenTelemetry สำหรับการติดตามแบบกระจายทั่วทั้งเอนจิ้น, เวิร์กฟลอบ และไดรเวอร์ รวมถึงบันทึกแบบมีโครงสร้างแบบรวมศูนย์ที่มีการแท็กเทแนนต์โดยแยกข้อมูลการตรวจสอบไว้ต่างหาก
ระบบจะรวบรวมตัววัดผลแยกตามบริการ ตามผู้ประมวลผล และตามผู้เช่า พร้อมทั้งสถิติ LVE แยกตามไซต์จากชั้นการแยกส่วน การทำงานของเวิร์กโฟลว์ทุกรายการ ทั้งการจัดสรร การย้ายข้อมูล การบังคับใช้กฎ จะมองเห็นได้ตั้งแต่เริ่มต้นจนจบ ซึ่งเป็นเหตุผลที่ทำให้การตอบกลับจากฝ่ายสนับสนุนมีความชัดเจนเจาะจงแทนที่จะเป็นการคาดเดา
การมอนิเตอร์ในสเกลใหญ่นั้นเป็นปัญหาเรื่องปริมาณข้อมูล เราจึงออกแบบระบบมาเพื่อรองรับปัญหานี้โดยเฉพาะ เมตริกที่มีปริมาณมากจะถูกแบ่งพาร์ติชันตามเวลาและสรุปผลรวม แทนที่จะเก็บข้อมูลแยกตามแต่ละเว็บไซต์ในทุกๆ นาทีไปตลอดกาล, เทรซ (traces) จะถูกสุ่มตัวอย่าง และการควบคุมคาร์ดินาลิตี้ต่อเทนแอนด์จะช่วยป้องกันไม่ให้บัญชีที่มีการใช้งานหนาแน่นเกินไปส่งผลกระทบต่อแดชบอร์ดของผู้ใช้งานรายอื่น เป้าหมายในการออกแบบคือรองรับหนึ่งล้านเว็บไซต์ ไม่ใช่แค่จำนวนที่เราใช้งานอยู่ ณ ปัจจุบัน
การแจ้งเตือนจะถูกส่งผ่าน Alertmanager ไปยังตารางเวรปฏิบัติการของเรา โดยมีการกำหนดและติดตาม SLO ซึ่งแยกไว้อย่างตั้งใจจากการแจ้งเตือนลูกค้าด้านบน เพื่อไม่ให้เสียงรบกวนจากการดำเนินงานเข้ามาในกล่องขาเข้าของคุณ และการแจ้งเตือนของคุณจะไม่ต้องต่อคิวรอหลังจากการแจ้งเตือนของเรา