Kalkulator MTTR i MTBF
Zmierz tempo napraw i rytm awarii: MTTR z łącznego czasu naprawy oraz, opcjonalnie, dostępność z podanego MTBF — w kontekście incydentów, nie budżetu SLO.
Wynik
Wprowadź dane i kliknij Oblicz.
MTTR, MTBF, MTTA i MTTD
MTTR (Mean Time To Repair) to średni czas potrzebny na przywrócenie usługi po awarii. MTBF (Mean Time Between Failures) to średni czas działania między awariami — tu podajesz go jako wejście (np. z historii lub szacunku), a nie wynik z automatycznego okna kalendarzowego. W praktyce SRE często rozbija się też incydent na MTTD (czas do wykrycia) i MTTA (czas do reakcji) — MTTR liczony przez ten kalkulator obejmuje cały czas naprawy, niezależnie od tego, jak go zmierzono.
Wzory
MTTR = suma czasów naprawy ÷ liczba awarii. Gdy podasz MTBF, kalkulator liczy też szacowaną dostępność: Dostępność = MTBF ÷ (MTBF + MTTR) — to standardowy model dostępności stacjonarnej (steady-state availability) używany w analizie niezawodności.
Cele dostępności a rytm awarii
Szacowana dostępność z MTBF/(MTBF+MTTR) warto zestawić z typowymi „dziewiątkami”. Skrócona tabela poniżej — pełniejszy rozkład downtime pod SLO znajdziesz w kalkulatorze Error budget.
| Cel dostępności | Downtime / rok (orientacyjnie) |
|---|---|
| 99% | ~3,65 dnia |
| 99,9% | ~8,76 godziny |
| 99,99% | ~52,6 minuty |
Jak skracać MTTR
- Runbooki i automatyzacja typowych działań naprawczych (restart, rollback, failover) skracają czas naprawy bardziej niż samo szybsze wykrywanie.
- Dobre dashboardy i alerty z konkretnym kontekstem (nie tylko "coś jest nie tak") skracają czas diagnozy — największą część MTTR często pochłania właśnie zrozumienie, co się zepsuło.
- Post-mortemy bez obwiniania (blameless) i śledzenie akcji naprawczych zapobiegają powtarzającym się długim naprawom tego samego problemu.
MTTR vs MTBF — co poprawiać najpierw
Dostępność zależy od obu wartości, ale ich poprawa ma różny koszt. Wydłużenie MTBF (rzadsze awarie) często wymaga zmian architektonicznych (redundancja, lepsze testy) i jest kosztowne. Skrócenie MTTR (szybsza naprawa) zwykle jest tańsze i szybsze do wdrożenia — dlatego wiele zespołów SRE inwestuje najpierw w automatyzację reakcji na incydenty, a dopiero potem w fundamentalną niezawodność.
Przykłady
- 10 godzin łącznego czasu naprawy przy 5 awariach → MTTR = 2 godziny.
- MTTR = 2h, MTBF = 100h → dostępność ≈ 98,04%.
- Ten sam MTBF = 100h, ale MTTR skrócone do 0,5h → dostępność ≈ 99,50% — widać, jak duży wpływ ma skrócenie samego czasu naprawy.
FAQ — MTTR i MTBF
- Czym różni się MTTR od MTTA i MTTD?
- MTTD to czas do wykrycia awarii, MTTA to czas do reakcji zespołu, a MTTR to czas do pełnej naprawy. Ten kalkulator liczy MTTR na podstawie łącznego czasu naprawy — możesz go liczyć od wykrycia albo od zgłoszenia, zależnie od konwencji zespołu.
- Co dokładnie liczy się jako "czas naprawy"?
- Najczęściej czas od momentu podjęcia działań naprawczych do pełnego przywrócenia usługi. Niektóre zespoły liczą od wykrycia (włączając diagnozę), inne od potwierdzenia (acknowledge) — ważne, by być konsekwentnym w raportowaniu.
- Skąd wziąć MTBF dla nowego systemu bez historii awarii?
- Możesz oszacować na podstawie komponentów (dostawcy podają MTBF sprzętu), podobnych systemów w organizacji, albo zacząć bez MTBF i uzupełnić go po zebraniu pierwszych danych produkcyjnych.
- Czy niższe MTTR zawsze oznacza bardziej niezawodny system?
- Nie — MTTR mówi tylko, jak szybko naprawiacie awarie, nie jak często się zdarzają. System z częstymi, ale szybko naprawianymi awariami może mieć niższe MTTR niż stabilny system z rzadkimi, długimi naprawami, a mimo to gorszą dostępność.
- Jak MTTR łączy się z error budgetem?
- Częstsze lub dłuższe naprawy zużywają budżet błędów szybciej. Skrócenie MTTR to jeden z najskuteczniejszych sposobów, by nie przekroczyć SLO przy tej samej liczbie awarii.
- Czy MTTR może wynosić zero?
- W praktyce nie — nawet automatyczny failover ma niezerowy czas przełączenia. Bardzo niskie MTTR (sekundy) jest możliwe przy dobrze zaprojektowanej automatyzacji, ale rzadko dokładnie zero.
- Jakie MTTR jest "dobre" dla usługi produkcyjnej?
- Zależy od SLO i skali biznesu — usługi krytyczne celują w minuty, mniej krytyczne w godziny. Ważniejsze niż wartość absolutna jest trend: czy MTTR spada z czasem.
- Czy ten wzór dostępności zakłada coś konkretnego o rozkładzie awarii?
- To standardowy model dostępności stacjonarnej z teorii niezawodności — zakłada uśrednione, powtarzające się cykle działanie/naprawa, nie pojedynczy katastrofalny incydent.