Kiedy aplikacja bankowa przestaje działać choćby na piętnaście minut, konsekwencje są natychmiastowe i widoczne — media społecznościowe pełne skarg klientów, telefony do infolinii, czasem nawet komentarz w mediach branżowych. Krzysztof Kula z ING Banku Śląskiego, prezentując temat Site Reliability Engineering na konferencji IT w Bankowości organizowanej przez GigaCon, tłumaczył, dlaczego w takim środowisku podejście „naprawimy, jak się zepsuje” po prostu się nie sprawdza.
SRE to filozofia zarządzania niezawodnością, w której zespoły inżynierskie definiują konkretne, mierzalne cele dotyczące dostępności usługi (SLO — Service Level Objectives) i budżet błędów (error budget), który pozwala świadomie decydować, kiedy inwestować w stabilność, a kiedy w nowe funkcje. To podejście różni się od klasycznego utrzymania IT tym, że traktuje niezawodność jako cechę produktu do zaprojektowania, a nie efekt uboczny dobrej woli zespołu.
Beyond uptime — dlaczego sam wskaźnik dostępności nie wystarcza
Tytuł prelekcji Kuli — „Beyond Uptime” — nie był przypadkowy. Klasyczny wskaźnik uptime (np. 99,9% dostępności) łatwo zmanipulować, jeśli mierzy się go w sposób, który nie odzwierciedla realnego doświadczenia użytkownika. Aplikacja może formalnie „działać” (odpowiadać na żądania), a jednocześnie być na tyle wolna, że użytkownicy i tak rezygnują z próby zalogowania się. SRE każe patrzeć na doświadczenie użytkownika końcowego, nie tylko na status serwera.
W kontekście regulacyjnym, jaki wprowadza DORA, to podejście nabiera dodatkowego znaczenia — banki muszą wykazać nie tylko, że mają procedury na wypadek awarii, ale że systematycznie testują odporność swoich systemów na realne scenariusze awaryjne, a nie tylko na papierze.
Czego to wymaga od organizacji
Wdrożenie SRE to nie jest wyłącznie kwestia narzędzi monitorujących — to przede wszystkim zmiana sposobu myślenia zespołów deweloperskich i operacyjnych o odpowiedzialności za produkt. Zespoły, które piszą kod, zaczynają też odpowiadać za to, jak ten kod zachowuje się na produkcji, zamiast przerzucać ten problem wyłącznie na dział utrzymania.
Jeśli pracujecie nad niezawodnością systemów w sektorze finansowym, warto zobaczyć więcej takich praktycznych podejść. Sprawdź program najbliższej konferencji IT w Bankowości organizowanej przez GigaCon.

