Stworzony do monitorowania miliona witryn
Za Twoim panelem stoi ten sam stos obserwowalności, na którym opieramy naszą platformę: Prometheus i Grafana dla metryk, OpenTelemetry do śledzenia rozproszonego w całym silniku, przepływach pracy i sterownikach, oraz scentralizowane logi strukturalne oznaczone identyfikatorem najemcy, z oddzielnie przechowywanymi danymi audytowymi.
Metryki są zbierane dla każdej usługi, każdego workera i każdego tenanta, ze statystykami LVE dla każdej strony z warstwy izolacji. Każde uruchomienie workflow – provisionowanie, migracja, egzekwowanie – jest widoczne od początku do końca, dlatego odpowiedź wsparcia technicznego może być konkretna, a nie oparta na domysłach.
Monitorowanie na dużą skalę to problem wielkości danych, więc i zaprojektowano je w ten sposób. Metryki o dużej objętości są partycjonowane czasowo i agregowane zamiast być trzymane dla każdej witryny co minutę na zawsze, śledzenia (traces) są prókowane, a kontrola kardynalności dla poszczególnych najemców (tenants) uniemożliwia jednemu hałaśliwemu kontu pogarszanie działania pulpitów wszystkich pozostałych. Celem projektowym jest milion witryn, a nie liczba, którą obsługujemy dzisiaj.
Alerty są kierowane przez Alertmanager do naszego grafiku dyżurów ze zdefiniowanymi i śledzonymi wskaźnikami SLO – celowo oddzielonymi od powyższych powiadomień dla klientów, dzięki czemu szum operacyjny nigdy nie trafia do Twojej skrzynki odbiorczej, a Twoje alerty nigdy nie stoją w kolejce za naszymi.