Kalkulator MTTR i MTBF

Zmierz tempo napraw i rytm awarii: MTTR z łącznego czasu naprawy oraz, opcjonalnie, dostępność z podanego MTBF — w kontekście incydentów, nie budżetu SLO.

Dane

Opcje dodatkowe (opcjonalnie)

W tym kalkulatorze MTBF jest wartością wejściową (średni czas między awariami), a nie automatycznie wyliczaną z sztywnego okna kalendarzowego.

Wynik

Wprowadź dane i kliknij Oblicz.

MTTR, MTBF, MTTA i MTTD

MTTR (Mean Time To Repair) to średni czas potrzebny na przywrócenie usługi po awarii. MTBF (Mean Time Between Failures) to średni czas działania między awariami — tu podajesz go jako wejście (np. z historii lub szacunku), a nie wynik z automatycznego okna kalendarzowego. W praktyce SRE często rozbija się też incydent na MTTD (czas do wykrycia) i MTTA (czas do reakcji) — MTTR liczony przez ten kalkulator obejmuje cały czas naprawy, niezależnie od tego, jak go zmierzono.

Wzory

MTTR = suma czasów naprawy ÷ liczba awarii. Gdy podasz MTBF, kalkulator liczy też szacowaną dostępność: Dostępność = MTBF ÷ (MTBF + MTTR) — to standardowy model dostępności stacjonarnej (steady-state availability) używany w analizie niezawodności.

Cele dostępności a rytm awarii

Szacowana dostępność z MTBF/(MTBF+MTTR) warto zestawić z typowymi „dziewiątkami”. Skrócona tabela poniżej — pełniejszy rozkład downtime pod SLO znajdziesz w kalkulatorze Error budget.

Cel dostępnościDowntime / rok (orientacyjnie)
99%~3,65 dnia
99,9%~8,76 godziny
99,99%~52,6 minuty

Jak skracać MTTR

  • Runbooki i automatyzacja typowych działań naprawczych (restart, rollback, failover) skracają czas naprawy bardziej niż samo szybsze wykrywanie.
  • Dobre dashboardy i alerty z konkretnym kontekstem (nie tylko "coś jest nie tak") skracają czas diagnozy — największą część MTTR często pochłania właśnie zrozumienie, co się zepsuło.
  • Post-mortemy bez obwiniania (blameless) i śledzenie akcji naprawczych zapobiegają powtarzającym się długim naprawom tego samego problemu.

MTTR vs MTBF — co poprawiać najpierw

Dostępność zależy od obu wartości, ale ich poprawa ma różny koszt. Wydłużenie MTBF (rzadsze awarie) często wymaga zmian architektonicznych (redundancja, lepsze testy) i jest kosztowne. Skrócenie MTTR (szybsza naprawa) zwykle jest tańsze i szybsze do wdrożenia — dlatego wiele zespołów SRE inwestuje najpierw w automatyzację reakcji na incydenty, a dopiero potem w fundamentalną niezawodność.

Przykłady

  • 10 godzin łącznego czasu naprawy przy 5 awariach → MTTR = 2 godziny.
  • MTTR = 2h, MTBF = 100h → dostępność ≈ 98,04%.
  • Ten sam MTBF = 100h, ale MTTR skrócone do 0,5h → dostępność ≈ 99,50% — widać, jak duży wpływ ma skrócenie samego czasu naprawy.

FAQ — MTTR i MTBF

Czym różni się MTTR od MTTA i MTTD?
MTTD to czas do wykrycia awarii, MTTA to czas do reakcji zespołu, a MTTR to czas do pełnej naprawy. Ten kalkulator liczy MTTR na podstawie łącznego czasu naprawy — możesz go liczyć od wykrycia albo od zgłoszenia, zależnie od konwencji zespołu.
Co dokładnie liczy się jako "czas naprawy"?
Najczęściej czas od momentu podjęcia działań naprawczych do pełnego przywrócenia usługi. Niektóre zespoły liczą od wykrycia (włączając diagnozę), inne od potwierdzenia (acknowledge) — ważne, by być konsekwentnym w raportowaniu.
Skąd wziąć MTBF dla nowego systemu bez historii awarii?
Możesz oszacować na podstawie komponentów (dostawcy podają MTBF sprzętu), podobnych systemów w organizacji, albo zacząć bez MTBF i uzupełnić go po zebraniu pierwszych danych produkcyjnych.
Czy niższe MTTR zawsze oznacza bardziej niezawodny system?
Nie — MTTR mówi tylko, jak szybko naprawiacie awarie, nie jak często się zdarzają. System z częstymi, ale szybko naprawianymi awariami może mieć niższe MTTR niż stabilny system z rzadkimi, długimi naprawami, a mimo to gorszą dostępność.
Jak MTTR łączy się z error budgetem?
Częstsze lub dłuższe naprawy zużywają budżet błędów szybciej. Skrócenie MTTR to jeden z najskuteczniejszych sposobów, by nie przekroczyć SLO przy tej samej liczbie awarii.
Czy MTTR może wynosić zero?
W praktyce nie — nawet automatyczny failover ma niezerowy czas przełączenia. Bardzo niskie MTTR (sekundy) jest możliwe przy dobrze zaprojektowanej automatyzacji, ale rzadko dokładnie zero.
Jakie MTTR jest "dobre" dla usługi produkcyjnej?
Zależy od SLO i skali biznesu — usługi krytyczne celują w minuty, mniej krytyczne w godziny. Ważniejsze niż wartość absolutna jest trend: czy MTTR spada z czasem.
Czy ten wzór dostępności zakłada coś konkretnego o rozkładzie awarii?
To standardowy model dostępności stacjonarnej z teorii niezawodności — zakłada uśrednione, powtarzające się cykle działanie/naprawa, nie pojedynczy katastrofalny incydent.