Bir milyon siteyi izlemek için tasarlandı
Panonuzun arkasında, platformu üzerinde çalıştırdığımız gözlemlenebilirlik yığınıyla aynısı yer alır: metrikler için Prometheus ve Grafana, motor, iş akışları ve sürücüler genelinde dağıtık izleme için OpenTelemetry ve denetim verilerinin ayrı tutulduğu kiracı etiketli merkezi yapılandırılmış loglar.
Metrikler servis başına, çalışan başına ve kiracı başına toplanır; izolasyon katmanından gelen site bazlı LVE istatistikleri de buna dahildir. Sağlama, migrasyon ve yaptırım dahil her iş akışı çalıştırması baştan sona görünür; bu nedenle bir destek yanıtı tahmine dayalı değil, kesin olabilir.
Ölçekli izleme bir veri hacmi sorunudur; bu nedenle bu şekilde tasarlanmıştır. Yüksek hacimli metrikler, her sitenin dakikalık verileri sonsuza kadar saklanmak yerine zamana göre bölümlere ayrılır ve özetlenir, izlemeler örneklenir ve her kirecinin kardinalite kontrolleri, gürültülü tek bir hesabın diğer herkesin panolarını kötüleştirmesini engeller. Tasarım hedefi, bugün çalıştırdığımız sayı değil, bir milyon sitedir.
Uyarılar, SLO'ların tanımlandığı ve takip edildiği nöbetçi ekibimize Alertmanager üzerinden yönlendirilir — yukarıdaki müşteri bildirimlerinden bilerek ayrı tutulur, böylece operasyonel gürültü asla gelen kutunuza düşmez ve uyarılarınız bizimkilerin arkasında sıraya girmez.