I .신뢰성 기본 이론
5. MTBF(Mean Time Between Failures)
수리 가능한 설비에서 고장과 다음 고장 사이에 확보되는 평균 운전시간을 나타내는 대표적인 신뢰성 지표다.
하지만 현장에서 MTBF를 단순히 “고장이 평균 몇 시간마다 발생하는가”로 해석하면 중요한 정보를 놓칠 수 있다. MTBF는 여러 개의 고장시간을 하나의 평균값으로 압축한 숫자이기 때문에, 같은 MTBF라도 설비의 실제 고장 특성과 정비 필요성은 전혀 다를 수 있기 때문이다.
따라서 전문적인 신뢰성 분석에서는 MTBF의 크기보다 그 숫자가 어떤 고장 데이터에서 만들어졌으며, 시간에 따라 어떻게 변화하고 있는가를 함께 살펴봐야 한다.
5-1. MTBF는 ‘수명’이 아니라 ‘고장 사이의 간격’이다
기본적인 MTBF는 다음과 같이 계산할 수 있다.
예를 들어 어떤 생산설비가 20,000시간 운전되는 동안 5회의 고장을 경험했다면,
이다.
그러나 여기서 “이 설비는 4,000시간을 사용할 수 있다”라고 해석하면 안 된다.
MTBF 4,000시간은 개별 설비의 수명을 의미하는 것이 아니라 관찰된 고장 간격들의 평균값이다.
실제 데이터가
시간이라면 평균은 4,000시간이지만 고장 간격 자체는 상당히 넓게 분산되어 있다.
따라서 MTBF를 볼 때 첫 번째 질문은
“평균이 얼마인가?”가 아니라 “그 평균을 구성하는 고장 간격은 어떻게 분포되어 있는가?”
가 되어야 한다.
5-2. 같은 MTBF라도 설비의 위험은 같지 않다
이 부분이 MTBF를 전문적으로 해석할 때 매우 중요하다.
두 설비가 모두 MTBF 5,000시간이라고 가정해보자.
설비 A
고장 간격이 비교적 일정하다.
설비 B
고장 간격의 편차가 매우 크다.
두 설비의 평균은 비슷하게 나타날 수 있지만 고장 발생 패턴은 완전히 다르다.
A는 일정한 수준의 고장간격을 유지하고 있는 반면, B는 특정 시점에 매우 짧은 고장간격이 반복될 가능성이 있다.
따라서 MTBF 하나만 비교하면 두 설비를 비슷한 수준으로 판단할 수 있지만, 실제 정비전략을 결정할 때는 고장시간 분포와 변동성까지 확인해야 한다.
이것이 평균값 중심의 신뢰성 평가가 갖는 첫 번째 한계다.
5-3. MTBF가 증가했는데도 신뢰성이 좋아졌다고 단정할 수 없는 이유
MTBF가 3,000시간에서 5,000시간으로 증가했다면 일반적으로 긍정적인 변화로 생각한다.
하지만 다음과 같은 상황에서도 MTBF는 증가할 수 있다.
- 경미한 고장을 기록하지 않음
- 고장 판정 기준 변경
- 설비 운전시간 과대 산정
- 고장 데이터 누락
- 설비 운전조건 변화
- 정비 후 고장 기록 기준 변경
예를 들어 이전에는 작은 누유까지 고장으로 기록했지만 이후부터는 생산 중단을 일으킨 고장만 기록한다면 고장횟수가 감소한다.
총 운전시간이 동일한 상태에서 고장횟수가 감소하면,
에 따라 MTBF는 자연스럽게 증가한다.
하지만 이것은 설비의 물리적인 신뢰성이 향상된 것이 아니라 데이터 생성 기준이 변한 것일 수 있다.
따라서 전문가의 관점에서는
MTBF 상승 = 신뢰성 향상
이라는 등식을 바로 적용하지 않는다.
5-4. MTBF의 진짜 가치는 ‘추세’에서 나타난다
하나의 MTBF 값보다 중요한 것은 시간에 따른 변화다.
예를 들어 다음과 같은 결과가 있다고 하자.
| 기간 | MTBF |
|---|---|
| 1분기 | 5,200 h |
| 2분기 | 4,600 h |
| 3분기 | 3,900 h |
| 4분기 | 3,100 h |
이 경우 단순히 “현재 MTBF는 3,100시간이다”라고 기록하는 것보다 MTBF가 지속적으로 감소하고 있다는 사실에 주목해야 한다.
이는 설비 열화, 운전조건 변화, 특정 부품의 반복적인 손상 또는 정비 품질 저하 등을 의심할 수 있는 신호가 된다.
반대로
처럼 증가한다면 개선활동의 효과를 검토할 수 있다.
따라서 MTBF는 절대적인 숫자보다 변화 방향과 변화 속도를 함께 보는 것이 중요하다.
5-5. MTBF가 감소할 때 바로 부품을 교체해서는 안 된다
MTBF가 감소했다고 해서 곧바로 예방교체 주기를 짧게 설정하는 것은 성급한 판단일 수 있다.
먼저 다음과 같은 질문을 해야 한다.
① 고장모드가 바뀌었는가?
과거에는 베어링 고장이 많았지만 최근에는 씰 누설이 증가했다면 동일한 정비대책을 적용할 수 없다.
② 특정 운전조건에서만 발생하는가?
부하, 회전속도, 온도, 압력 등이 증가한 이후 고장이 늘었다면 부품 자체보다 운전조건이 원인일 가능성이 있다.
③ 정비 후 고장 간격이 짧아졌는가?
정비 직후 반복적으로 고장이 발생한다면 조립, 정렬, 체결, 윤활 또는 교체부품의 품질을 확인해야 한다.
④ 특정 설비에 집중되는가?
전체 설비의 MTBF가 감소한 것처럼 보여도 실제로는 특정 장비 몇 대가 전체 평균을 끌어내리고 있을 수 있다.
따라서 MTBF → 고장모드 → 원인 → 개선조치 순으로 분석하는 것이 중요하다.
5-6. MTBF와 Weibull을 결합하면 ‘평균’에서 ‘고장 메커니즘’으로 이동한다
MTBF가 평균적인 고장 간격을 알려준다면 Weibull 분석은 시간에 따른 고장 특성을 분석하는 데 도움을 준다.
Weibull 형상모수 β는 특히 중요한 정보를 제공한다.
여기서 β에 따라 고장률의 시간적 특성이 달라진다.
| β | 고장률 특성 | 의심할 수 있는 현상 |
|---|---|---|
| β<1 | 감소 | 초기고장, 설치·조립 문제 |
| β≈1 | 일정 | 우연고장 |
| β>1 | 증가 | 마모, 열화, 노후화 |
따라서 MTBF가 같더라도 β가 다르면 정비전략이 달라질 수 있다.
예를 들어,
설비 A: MTBF 5,000시간, β=0.8
설비 B: MTBF 5,000시간, β=3.0
이라면 평균 고장 간격은 같아 보인다.
그러나 B는 시간이 지나면서 고장률이 증가하는 마모형 특성을 보이므로 열화 감시나 예방교체 전략을 검토할 필요성이 훨씬 커질 수 있다.
이처럼 MTBF는 “얼마나 자주 고장나는가”를 보여주고, Weibull β는 “고장이 어떤 방식으로 변하고 있는가”를 설명하는 데 활용할 수 있다.
5-7. MTBF와 MTTR을 결합하면 ‘고장 빈도’와 ‘복구 속도’를 동시에 볼 수 있다
설비 신뢰성에서는 고장이 적게 발생하는 것만큼 고장이 발생했을 때 얼마나 빨리 복구되는가도 중요하다.
MTBF가 고장 사이의 평균 운전시간이라면 MTTR은 평균 수리시간이다.
그리고 단순한 가동도 추정에서는 다음과 같은 관계를 사용할 수 있다.
여기서 중요한 것은 두 설비의 MTBF가 같아도 MTTR이 다르면 실제 생산손실은 크게 달라질 수 있다는 점이다.
따라서 설비 개선에는 두 방향이 존재한다.
MTBF 증가 → 고장 발생 빈도 감소
MTTR 감소 → 고장 후 복구시간 단축
이 두 가지를 분리해서 관리해야 신뢰성(reliability)과 정비성(maintainability)을 함께 개선할 수 있다.
5-8. MTBF를 예방정비 주기로 그대로 사용하면 생기는 문제
MTBF가 6,000시간이라고 해서
“6,000시간마다 부품을 교체하자.”
라고 결정하는 것은 올바른 신뢰성 의사결정이 아니다.
평균값은 고장이 발생하는 확률분포를 직접 알려주지 않기 때문이다.
예방정비 주기를 결정하려면 최소한 다음을 함께 고려해야 한다.
특히 안전에 영향을 미치는 설비라면 경제적인 MTBF만으로 정비주기를 결정해서는 안 된다.
고장확률이 급격히 증가하기 시작하는 시점과 고장 결과의 심각도를 함께 고려해야 한다.
5-9. MTBF를 고장모드별로 분해하면 숨겨진 문제가 드러난다
전체 설비의 MTBF만 계산하면 여러 고장 원인이 하나의 숫자로 섞인다.
예를 들어 모터의 고장이 다음과 같이 발생한다고 하자.
- 베어링 손상
- 권선 과열
- 축 정렬 불량
- 냉각장치 이상
- 전원 품질 문제
전체 MTBF가 감소했다는 사실만으로는 어느 원인이 핵심인지 알 수 없다.
따라서 가능하면
뿐만 아니라
등으로 고장모드별 데이터를 분리해야 한다.
이렇게 하면 전체 MTBF의 변화가 특정 고장모드 하나에 의해 발생했는지 확인할 수 있고, 제한된 정비자원을 어디에 집중해야 하는지도 판단할 수 있다.
5-10. 고장 데이터가 적을수록 MTBF를 더 조심해서 해석해야 한다
MTBF 계산은 간단하지만 고장 표본이 적을 때 평균값의 불확실성이 커질 수 있다.
예를 들어 10,000시간 동안 고장이 1회 발생했다면 계산상 MTBF는 10,000시간이다.
그러나 단 한 번의 고장만으로 이 설비가 정말 10,000시간의 평균 고장 간격을 갖는다고 확신하기는 어렵다.
반면 수백 건의 고장 간격이 확보되어 있다면 동일한 MTBF라도 통계적으로 훨씬 많은 정보를 가지고 있다.
따라서 전문적인 분석에서는 MTBF의 점추정값만 제시하기보다 표본 크기, 고장시간 분포, 신뢰구간, 검열자료의 존재 여부까지 고려하는 것이 바람직하다.
5-11. MTBF를 제대로 활용하는 실무 분석 순서
MTBF를 단순 KPI로 끝내지 않으려면 다음과 같은 분석 흐름을 사용할 수 있다.
① 운전시간 수집 -> ② 고장 발생시점 기록 -> ③ 고장 간격 계산
④ MTBF 산출 -> ⑤ MTBF 추세 확인 -> ⑥ 고장모드별 분리 -> ⑦ Weibull β·η 분석
⑧ 고장률 변화 확인 -> ⑨ 정비 전·후 비교 -> ⑩ 예방정비·상태기반정비 전략 결정
이 구조의 장점은 MTBF를 단순히 보고하는 데서 끝나지 않고 “왜 변화했는가?”와 “무엇을 해야 하는가?”까지 연결할 수 있다는 것이다.
5-12. 전문가가 MTBF를 볼 때 확인하는 질문
실제 신뢰성 분석에서는 다음 질문이 유용하다.
Q1. MTBF가 증가했는가 감소했는가?
단순한 현재값보다 장기 추세가 중요하다.
Q2. 고장 간격의 분산은 커졌는가?
평균이 같아도 고장시간의 변동성이 증가하면 운영 리스크가 달라질 수 있다.
Q3. 특정 고장모드가 MTBF를 끌어내리고 있는가?
전체 평균보다 고장모드별 분석이 원인 규명에 유리하다.
Q4. MTBF 감소가 실제 열화 때문인가?
운전조건이나 고장 기록 기준의 변화가 원인일 수도 있다.
Q5. MTBF 증가가 실제 신뢰성 개선인가?
데이터 누락이나 고장 정의 변경에 의한 착시인지 확인해야 한다.
Q6. Weibull β는 어떻게 변화했는가?
MTBF만으로 확인하기 어려운 고장률의 시간적 변화를 확인할 수 있다.
Q7. MTTR은 어떻게 변화했는가?
고장 빈도뿐 아니라 복구능력까지 확인해야 실제 가동성 개선 여부를 판단할 수 있다.
5-13. MTBF의 가장 중요한 해석
MTBF는 설비의 신뢰성을 나타내는 최종 답이 아니라 추가 분석을 시작하게 만드는 출발점으로 보는 것이 좋다.
이러한 관점에서 보면 MTBF의 진정한 가치는 숫자 자체에 있는 것이 아니다.
“고장이 얼마나 자주 발생하는가?”라는 질문을 시작으로 “왜 그 주기로 고장이 발생하는가?”, “시간이 지나면서 위험이 증가하는가?”, “정비 후 실제로 개선되었는가?”라는 질문으로 확장할 수 있다는 점이 MTBF 분석의 핵심이다.
핵심 정리
| 구분 | 단순한 해석 | 전문가 관점 |
|---|---|---|
| MTBF | 평균 고장 간격 | 고장 데이터의 요약 지표 |
| MTBF 증가 | 신뢰성 향상 | 데이터 기준 변화 여부 확인 |
| MTBF 감소 | 설비가 나빠짐 | 고장모드·운전조건·열화 분석 |
| MTBF 동일 | 같은 신뢰성 | 고장분포와 β 비교 |
| MTBF 활용 | KPI 관리 | 원인분석·정비전략 결정 |
| MTBF + MTTR | 가동도 계산 | 신뢰성과 정비성 동시 평가 |
| MTBF + Weibull | 별도 분석 | 평균값을 시간별 고장위험으로 확장 |
한 줄로 정리하면, MTBF는 “설비가 평균적으로 얼마나 오래 버티는가”를 알려주는 숫자가 아니라, 고장 데이터의 구조를 분석하고 정비전략을 결정하기 위한 출발점이다.




댓글 0
첫 댓글을 남겨보세요.