ساخته شده برای پایش یک میلیون وبسایت
پشت داشبورد شما همان پشتهی قابلیت مشاهدهای قرار دارد که ما پلتفرم خود را روی آن اجرا میکنیم: Prometheus و Grafana برای معیارها، OpenTelemetry برای ردیابی توزیعشده در سراسر موتور، گردشهای کار و درایورها، و گزارشهای ساختاریافتهی متمرکز که با برچسب تننت نشانهگذاری شدهاند و دادههای ممیزی آنها جداگانه نگهداری میشوند.
سنجهها به ازای هر سرویس، هر کارگر و هر مستأجر، به همراه آمار LVE مربوط به هر سایت از لایه ایزولهسازی جمعآوری میشوند. هر اجرای گردش کار — اعم از پروویژنینگ، مهاجرت و اعمال قوانین — به صورت سرتاسر قابل مشاهده است، به همین دلیل است که پاسخ پشتیبانی میتواند به جای یک حدس، کاملاً دقیق باشد.
پایش در مقیاس وسیع یک مسئلهی حجم داده است، بنابراین به همین شکل نیز مهندسی شده است. معیارهای با حجم بالا به جای اینکه برای همیشه به ازای هر وبسایت و هر دقیقه نگه داشته شوند، بر اساس زمان پارتیشنبندی و تجمیع میشوند، تریسها نمونهبرداری میشوند، و کنترلهای کاردینالیته به ازای هر تننت مانع از این میشوند که یک حساب پرمشغله داشبورد سایرین را مختل کند. هدف طراحی، یک میلیون وبسایت است، نه تعداد وبسایتهایی که امروز اداره میکنیم.
هشدارها از طریق Alertmanager به برنامه شیفتی (on-call) ما هدایت میشوند که دارای SLOهای تعریفشده و ردیابیشده است؛ این سیستم بهطور عمدی جدا از اعلانهای مشتری ذکر شده در بالا نگه داشته میشود تا سر و صدای عملیاتی هرگز وارد صندوق ورودی شما نشود و هشدارهای شما هرگز در صف پشت هشدارهای ما قرار نگیرند.