모두의 계산기
← 블로그로 돌아가기

재미있는 통계

검사 결과의 함정(기저율의 오류): 99% 정확도의 암 검사에서 양성이 나와도 실제 발병 확률은 낮을 수 있는 조건부 확률(베이즈 정리)

99% 정확한 암 검사에서 양성이면 암일 확률도 99%일까요? 유병률, 민감도, 특이도와 양성예측도를 자연빈도와 베이즈 정리로 정확하게 계산합니다.

건강검진 결과에 ‘양성’이라고 적혀 있으면 많은 사람이 질병에 걸렸을 가능성도 검사 정확도와 같다고 생각합니다. 검사 설명에 ‘정확도 99%’라고 쓰여 있다면 실제로 암이 있을 확률도 99%라고 받아들이기 쉽습니다. 하지만 두 확률은 서로 다른 질문에 답합니다.

검사의 민감도가 99%라는 말은 암이 있는 사람을 검사했을 때 양성이 나올 확률이 99%라는 뜻입니다. 양성 결과를 받은 사람에게 실제로 암이 있을 확률을 뜻하지 않습니다. 양성 후 암이 있을 확률을 구하려면 검사받기 전 암이 존재할 가능성인 기저율과 암이 없는 사람에게 양성이 나오는 위양성률까지 함께 계산해야 합니다.

이 글에서 사용하는 ‘민감도 99%, 특이도 99%인 암 검사’는 조건부확률을 설명하기 위한 가상 검사입니다. 특정 암이나 실제 검사 제품의 성능을 나타내지 않습니다. 실제 검사 결과는 검사 목적, 대상자의 나이와 증상, 가족력, 검사법, 판정 기준에 따라 의료진이 해석해야 합니다.

기저율의 오류란 무엇인가요?

기저율(base rate)은 어떤 정보가 추가되기 전에 대상 집단에서 사건이 발생하는 기본 비율입니다. 암 선별검사라면 검사 대상 집단에서 실제 암이 존재하는 비율, 즉 유병률이 기저율 역할을 합니다.

기저율의 오류 또는 기저율 무시(base-rate neglect)는 개별 단서에 주목하면서 전체 집단의 기본 비율을 충분히 반영하지 않는 추론 오류입니다. 검사 문제에서는 ‘양성’과 ‘99%’라는 강한 정보에 집중한 나머지, 검사받는 사람 가운데 실제 암이 있는 사람이 얼마나 적은지를 빼놓을 때 발생합니다.

희귀한 질환을 매우 많은 사람에게 검사하면 암이 없는 사람의 수가 암이 있는 사람보다 훨씬 많습니다. 특이도가 높아 위양성률이 작더라도 매우 큰 비질환 집단에 그 비율을 적용하면 위양성의 절대 인원이 많아질 수 있습니다. 그 결과 전체 양성자 가운데 위양성이 상당한 비중을 차지할 수 있습니다.

“99% 정확도”는 무엇을 뜻하나요?

‘정확도 99%’라는 표현만으로는 검사 결과를 계산할 수 없습니다. 정확도라는 말이 민감도인지, 특이도인지, 전체 정확도인지, 양성예측도인지 구분해야 합니다.

민감도

민감도(sensitivity)는 실제로 질병이 있는 사람 가운데 검사에서 양성으로 나온 비율입니다.

민감도 = 진양성 ÷ (진양성 + 위음성)

민감도가 99%라면 질병이 있는 100명 가운데 평균적으로 99명을 양성으로 찾아내고 1명은 음성으로 놓친다는 뜻입니다. 이때 놓친 1명이 위음성입니다.

특이도

특이도(specificity)는 실제로 질병이 없는 사람 가운데 검사에서 음성으로 나온 비율입니다.

특이도 = 진음성 ÷ (진음성 + 위양성)

특이도가 99%라면 질병이 없는 100명 가운데 평균적으로 99명은 음성으로 분류되고 1명은 양성으로 잘못 분류됩니다. 위양성률은 1 - 특이도이므로 1%입니다.

양성예측도

양성예측도(positive predictive value, PPV)는 검사 결과가 양성인 사람 가운데 실제로 질병이 있는 비율입니다.

양성예측도 = 진양성 ÷ (진양성 + 위양성)

양성 결과를 받은 뒤 가장 궁금한 값은 보통 양성예측도입니다. 양성예측도는 민감도와 특이도뿐 아니라 검사 전 질병 가능성에 따라 달라집니다.

음성예측도

음성예측도(negative predictive value, NPV)는 검사 결과가 음성인 사람 가운데 실제로 질병이 없는 비율입니다.

음성예측도 = 진음성 ÷ (진음성 + 위음성)

미국 국립의학도서관의 진단검사 해설은 질병이 드물수록 양성예측도는 낮아지고 음성예측도는 높아지는 반면, 질병이 흔해질수록 양성예측도는 높아지고 음성예측도는 낮아진다고 설명합니다.

1만 명으로 계산하면 양성 후 암 확률은 50%입니다

계산을 위해 다음 세 가지 조건을 가정하겠습니다.

  • 검사 대상자의 암 유병률: 1%
  • 검사의 민감도: 99%
  • 검사의 특이도: 99%

이 조건으로 1만 명을 검사한다고 생각해 보겠습니다. 유병률이 1%이므로 실제로 암이 있는 사람은 100명이고 암이 없는 사람은 9,900명입니다.

암이 있는 100명에게 민감도 99%를 적용하면 99명은 진양성, 1명은 위음성입니다. 암이 없는 9,900명에게 특이도 99%를 적용하면 9,801명은 진음성입니다. 나머지 1%인 99명은 위양성입니다.

결과를 정리하면 다음과 같습니다.

  • 진양성: 99명
  • 위양성: 99명
  • 진음성: 9,801명
  • 위음성: 1명

양성 결과를 받은 사람은 진양성 99명과 위양성 99명을 합한 198명입니다. 이 가운데 실제 암이 있는 사람은 99명입니다.

양성 후 실제 암일 확률 = 99 ÷ (99 + 99) = 50%

민감도와 특이도가 모두 99%인데 양성예측도는 50%입니다. 검사가 형편없어서가 아닙니다. 암이 없는 사람이 암이 있는 사람보다 99배 많았고, 비질환자 9,900명의 1%에서 나온 위양성이 99명에 이르렀기 때문입니다.

베이즈 정리로 같은 결과 계산하기

베이즈 정리는 새로운 증거를 관찰한 뒤 기존 확률을 갱신하는 공식입니다. D를 질병이 있는 사건, +를 검사 양성 사건이라고 하겠습니다. 구하려는 값은 P(D | +), 즉 양성이 나왔다는 조건에서 질병이 있을 확률입니다.

P(D | +) = P(+ | D) × P(D) ÷ P(+)

전체 양성 확률 P(+)에는 질병이 있는 사람의 진양성과 질병이 없는 사람의 위양성이 모두 포함됩니다.

P(+) = P(+ | D) × P(D) + P(+ | 질병 없음) × P(질병 없음)

두 식을 합치면 양성예측도 공식이 됩니다.

양성예측도 = 민감도 × 유병률 ÷ [민감도 × 유병률 + (1 - 특이도) × (1 - 유병률)]

가상 검사의 값을 넣으면 다음과 같습니다.

0.99 × 0.01 ÷ [0.99 × 0.01 + 0.01 × 0.99] = 0.5

결과는 50%로 자연빈도 계산과 같습니다. 공식은 간결하지만 1만 명 가운데 몇 명인지를 먼저 그려 보면 진양성과 위양성이 어디에서 생기는지 더 쉽게 확인할 수 있습니다.

P(양성 | 암)과 P(암 | 양성)은 다릅니다

기저율 오류의 핵심은 조건의 순서를 바꾸는 데 있습니다.

P(양성 | 암): 암이 있는 사람에게 양성이 나올 확률
P(암 | 양성): 양성인 사람에게 실제 암이 있을 확률

앞의 값은 민감도이고 뒤의 값은 양성예측도입니다. 표기에서 세로선 뒤에 있는 조건이 달라졌으므로 같은 확률이 아닙니다.

비가 올 때 길이 젖을 확률과 길이 젖었을 때 비가 왔을 확률이 다른 것과 같은 원리입니다. 비가 오면 길이 젖을 가능성이 크지만 길은 청소차나 살수 장치 때문에 젖을 수도 있습니다. 검사에서도 양성은 질병 때문에 나올 수 있지만 질병이 없는 사람에게 발생하는 위양성일 수도 있습니다.

유병률이 0.1%라면 양성예측도는 약 9%입니다

검사의 민감도와 특이도는 그대로 99%로 두고 유병률만 0.1%로 낮춰 보겠습니다. 10만 명을 검사하면 실제 암이 있는 사람은 100명, 암이 없는 사람은 99,900명입니다.

  • 암이 있는 100명 중 진양성: 99명
  • 암이 없는 99,900명 중 위양성: 999명
  • 전체 양성: 1,098명
  • 양성예측도: 99 ÷ 1,098 ≈ 9.02%

양성인 1,098명 가운데 실제 암이 있는 사람은 99명입니다. 양성이 나왔더라도 이 가정 아래에서 실제 암이 있을 확률은 약 9.02%입니다. 나머지 약 90.98%는 위양성입니다.

유병률이 낮아지면서 암이 없는 사람의 수가 더 커졌고, 1%의 위양성률이 많은 위양성을 만들었습니다. 같은 검사를 다른 위험 집단에 적용하면 양성 결과의 의미가 달라지는 이유입니다.

유병률에 따라 양성예측도는 얼마나 달라질까요?

민감도와 특이도가 모두 99%인 같은 가상 검사를 서로 다른 유병률에 적용하면 다음과 같이 계산됩니다.

  • 유병률 0.01%: 양성예측도 약 0.98%
  • 유병률 0.1%: 양성예측도 약 9.02%
  • 유병률 1%: 양성예측도 50%
  • 유병률 10%: 양성예측도 약 91.67%
  • 유병률 50%: 양성예측도 99%

유병률 50%에서야 양성예측도가 민감도·특이도와 같은 99%가 됩니다. 검사 성능이 변한 것이 아니라 검사를 받는 집단에서 질병이 존재할 사전확률이 달라졌습니다.

이 계산에서 유병률은 개인에게 그대로 적용되는 고정값이 아닐 수 있습니다. 실제 진료에서는 연령, 증상, 가족력, 과거 검사, 노출 요인처럼 개인별 정보가 검사 전 확률을 바꿉니다. 동일한 검사 결과라도 무증상 일반인과 의심 증상이 있는 환자의 검사 후 확률이 다를 수 있습니다.

전체 정확도 99%도 오해를 부를 수 있습니다

전체 정확도(accuracy)는 모든 검사 대상자 가운데 진양성과 진음성이 차지하는 비율입니다.

전체 정확도 = (진양성 + 진음성) ÷ 전체 검사 수

질병 유병률이 1%인 1만 명에게 아무도 질병이 없다고 예측하는 검사가 있다고 가정하겠습니다. 이 검사는 암이 없는 9,900명을 모두 맞히므로 전체 정확도가 99%입니다. 하지만 암이 있는 100명을 단 한 명도 찾지 못해 민감도는 0%입니다.

따라서 희귀 질환 검사에서 전체 정확도 하나만 보면 성능을 잘못 판단할 수 있습니다. 민감도, 특이도, 위양성률, 위음성률, 양성예측도와 음성예측도를 함께 확인해야 합니다. 어떤 기준검사와 어떤 대상 집단에서 성능을 평가했는지도 중요합니다.

검사 결과 네 가지를 구분해야 합니다

이진 검사에는 네 가지 결과가 있습니다.

진양성

실제로 질병이 있고 검사도 양성인 경우입니다. 선별검사가 찾아내려는 대상입니다.

위양성

실제로 질병이 없지만 검사에서 양성이 나온 경우입니다. 위양성은 불안과 추가 검사로 이어질 수 있습니다. 미국 국립암연구소는 암 선별검사의 알려진 위해 가운데 하나로 위양성과 그에 따른 추가 침습적 진단 절차를 제시합니다.

진음성

실제로 질병이 없고 검사도 음성인 경우입니다.

위음성

실제로 질병이 있지만 검사에서 음성이 나온 경우입니다. 위음성 결과를 확정적인 배제로 받아들이면 증상이 있는데도 후속 진료가 늦어질 수 있습니다.

위양성과 위음성은 서로 다른 문제입니다. 검사 판정 기준을 바꾸면 민감도와 특이도 사이에 상충관계가 생길 수 있으므로 어떤 오류를 더 줄여야 하는지는 검사 목적과 임상 상황에 따라 판단합니다.

선별검사 양성은 확진과 다릅니다

선별검사(screening test)는 증상이 없는 사람에게 특정 질병이나 전암성 병변의 가능성을 확인하는 목적으로 사용됩니다. 미국 국립암연구소는 암 선별검사가 일반적으로 암을 확진하는 검사가 아니며, 이상 결과가 나오면 암인지 확인하기 위한 추가 진단검사가 시행될 수 있다고 설명합니다.

양성 결과는 ‘검사 기준상 추가 확인이 필요하다’는 뜻일 수 있으며 그 자체로 암 진단이 아닙니다. 후속 검사는 영상검사, 다른 검사법 또는 조직검사처럼 상황에 따라 달라질 수 있습니다. 실제 결과를 받았다면 인터넷의 일반 계산으로 진단을 내리지 말고 검사기관이나 담당 의료진에게 검사명, 판정 기준과 다음 절차를 확인해야 합니다.

위양성이 존재한다고 해서 선별검사가 무의미하다는 뜻도 아닙니다. 일부 암 선별검사는 조기 발견이나 전암성 병변 제거를 통해 암 사망 또는 발생 위험을 낮추는 근거가 있습니다. 선별검사의 이익과 위해는 암종, 검사법, 연령과 위험 수준에 따라 함께 평가해야 합니다.

사전확률과 사후확률은 어떻게 달라지나요?

검사 전 질병 가능성을 사전확률(pretest probability), 검사 결과를 반영한 뒤의 가능성을 사후확률(post-test probability)이라고 합니다. 베이즈 정리는 검사 결과라는 증거로 사전확률을 사후확률로 갱신합니다.

유병률은 집단 수준의 사전확률을 정하는 출발점입니다. 실제 개인의 사전확률에는 증상과 병력 등 추가 정보가 들어갈 수 있습니다. 그래서 검사 대상자를 적절히 선정하는 과정이 검사 성능만큼 중요합니다.

같은 양성 결과라도 사전확률이 0.1%였던 사람과 10%였던 사람의 사후확률은 크게 다릅니다. 앞의 가상 검사에서는 각각 약 9.02%와 91.67%였습니다. 검사 결과만 떼어 놓고 확률을 말할 수 없는 이유입니다.

가능도비로도 계산할 수 있습니다

가능도비(likelihood ratio)는 검사 결과가 질병이 있는 사람과 없는 사람에게 얼마나 다르게 나타나는지를 나타냅니다. 양성 가능도비는 다음과 같습니다.

양성 가능도비 = 민감도 ÷ (1 - 특이도)

민감도와 특이도가 모두 99%이면 양성 가능도비는 0.99 ÷ 0.01 = 99입니다. 베이즈 계산을 오즈로 표현하면 검사 전 오즈에 가능도비를 곱해 검사 후 오즈를 구할 수 있습니다.

유병률 1%의 검사 전 오즈는 1 대 99입니다. 여기에 양성 가능도비 99를 곱하면 검사 후 오즈는 1 대 1이 되고, 이를 확률로 바꾸면 50%입니다.

가능도비도 검사 대상과 판정 기준에 맞는 값이 필요합니다. 논문이나 제품 자료에서 가져온 수치를 다른 집단에 적용할 때는 질병 단계와 환자 특성, 기준검사, 연구 설계를 확인해야 합니다.

반복검사에서 양성이 두 번 나오면 어떻게 되나요?

서로 조건부로 독립이고 민감도와 특이도가 각각 99%인 검사를 같은 조건에서 두 번 시행한다고 단순 가정하면 첫 양성 뒤 50%였던 오즈에 양성 가능도비 99를 다시 곱해 약 99%가 됩니다. 하지만 실제 반복검사에서는 이 독립 가정이 성립하지 않을 수 있습니다.

같은 검체, 같은 장비, 같은 측정 원리나 같은 생물학적 요인 때문에 두 검사의 오류가 함께 발생할 수 있습니다. 첫 검사와 확인검사의 대상 집단 및 판정 기준도 다를 수 있습니다. 그러므로 ‘양성이 두 번이면 공식상 몇 퍼센트’라는 단순 계산을 실제 진단에 그대로 적용하면 안 됩니다. 확인검사의 종류와 성능을 바탕으로 의료진이 해석해야 합니다.

자연빈도로 표현하면 왜 이해하기 쉬울까요?

0.99, 0.01 같은 조건부확률을 공식에 바로 넣는 대신 1만 명 가운데 몇 명인지 바꾸는 방법을 자연빈도 표현이라고 합니다.

  1. 먼저 전체 1만 명을 암이 있는 100명과 없는 9,900명으로 나눕니다.
  2. 암이 있는 100명에게 민감도를 적용해 진양성 99명을 구합니다.
  3. 암이 없는 9,900명에게 위양성률을 적용해 위양성 99명을 구합니다.
  4. 진양성을 모든 양성자 수로 나눕니다.

호프라게와 기거렌처가 1998년 발표한 연구에서는 의사 48명에게 네 가지 진단검사의 양성예측도를 계산하게 했습니다. 확률 형식으로 제시했을 때 정답률은 10%였고, 같은 정보를 자연빈도로 제시했을 때는 46%로 높아졌습니다.

2017년 Psychological Bulletin에 발표된 메타분석은 35편의 논문에서 나온 226개의 수행 추정치를 검토했습니다. 연구는 자연빈도로 제시했을 때 베이즈 추론 과제를 더 잘 푼다는 효과를 종합했으며, 결합사건을 직접 보여 주는 짧은 형식과 시각 보조 자료가 중요한 조절 요인이라고 보고했습니다.

자연빈도는 베이즈 정리와 다른 계산법이 아닙니다. 같은 확률 구조를 실제 인원수 형태로 펼쳐 진양성과 위양성의 분모를 눈에 보이게 만드는 표현 방식입니다.

기저율 오류를 피하기 위한 확인 질문

검사 결과나 검사 광고의 수치를 볼 때 다음 항목을 확인하면 조건부확률을 뒤집는 오류를 줄일 수 있습니다.

  1. 99%는 민감도, 특이도, 전체 정확도, 양성예측도 중 무엇인가요?
  2. 검사 대상 집단의 질병 유병률 또는 개인의 검사 전 확률은 얼마인가요?
  3. 위양성률과 위음성률은 각각 얼마인가요?
  4. 성능 평가는 어떤 기준검사와 비교해 이루어졌나요?
  5. 증상이 없는 선별검사인가요, 의심 환자의 진단검사인가요?
  6. 양성 결과 뒤 어떤 확인검사가 필요한가요?
  7. 검사 성능의 신뢰구간과 연구 대상자 수는 제시됐나요?
  8. 검사 결과가 어느 연령과 위험 집단에 적용되는 값인가요?

특히 양성예측도가 검사 설명에 직접 제시돼 있다면 그 값이 계산된 유병률과 대상 집단을 함께 봐야 합니다. 예측도는 다른 집단으로 옮기면 달라질 수 있습니다.

자주 묻는 질문

99% 정확한 암 검사에서 양성이면 암일 확률은 몇 퍼센트인가요?

‘정확도 99%’만으로는 계산할 수 없습니다. 민감도, 특이도와 검사 전 암 확률이 필요합니다. 민감도와 특이도가 각각 99%, 유병률이 1%라는 가상 조건에서는 양성예측도가 50%입니다.

양성예측도가 낮으면 검사가 쓸모없다는 뜻인가요?

그렇지 않습니다. 드문 질환을 넓은 집단에서 찾는 선별검사는 높은 민감도와 특이도를 가져도 양성예측도가 낮을 수 있습니다. 선별검사의 역할은 추가 확인이 필요한 대상을 찾는 것이며, 임상적 유용성은 사망 감소 같은 이익과 위양성·과잉진단·후속 검사 같은 위해를 함께 평가해야 합니다.

양성이 나왔는데 암이 아닐 수도 있나요?

가능합니다. 실제 질병이 없는데 양성인 결과를 위양성이라고 합니다. 위양성 가능성은 검사법과 대상 집단에 따라 다르므로 개별 결과는 담당 의료진과 확인해야 합니다.

음성이면 암이 절대 없나요?

아닙니다. 민감도가 100%가 아닌 검사에는 위음성이 있을 수 있습니다. 증상이 지속되거나 위험 요인이 있다면 음성 결과만으로 진료를 중단하지 말고 의료진의 안내를 따라야 합니다.

유병률과 개인의 발병 위험은 같은가요?

같지 않을 수 있습니다. 유병률은 특정 시점이나 기간에 집단에서 질병이 존재하는 비율입니다. 개인의 위험은 연령, 병력, 유전적 요인과 노출 등에 따라 집단 평균과 다를 수 있습니다. 또한 양성예측도는 보통 검사 시점에 질병이 실제로 존재할 조건부확률이지 앞으로 새로 질병이 발생할 확률을 뜻하지 않습니다.

베이즈 정리는 암 검사에만 쓰이나요?

아닙니다. 감염병 검사, 보안 경보, 스팸 필터, 품질 검사처럼 기본 발생률과 오탐률을 함께 고려해야 하는 문제에 적용됩니다. 희귀 사건을 탐지할 때 작은 오탐률이 많은 거짓 경보를 만들 수 있다는 구조도 같습니다.

결론: 양성 결과는 기저율과 함께 읽어야 합니다

검사의 민감도가 99%라는 정보만으로 양성 후 질병 확률을 99%라고 결론 내릴 수 없습니다. P(양성 | 질병)과 P(질병 | 양성)은 서로 다른 조건부확률입니다. 뒤의 값을 구하려면 유병률과 위양성률이 필요합니다.

유병률 1%, 민감도 99%, 특이도 99%인 가상 검사에서는 1만 명 중 진양성과 위양성이 각각 99명입니다. 양성 198명 가운데 실제 질병은 99명이므로 양성예측도는 50%입니다. 유병률이 0.1%로 낮아지면 같은 검사의 양성예측도는 약 9.02%가 됩니다.

가장 쉬운 계산 방법은 확률을 실제 인원수로 바꾸는 것입니다. 전체 검사 대상자를 질병이 있는 집단과 없는 집단으로 나누고, 각 집단에서 진양성과 위양성을 구한 뒤 모든 양성자 가운데 진양성의 비율을 계산하면 됩니다.

선별검사의 양성은 확진이 아닙니다. 반대로 위양성이 있다는 사실이 권고된 검사를 피해야 한다는 뜻도 아닙니다. 실제 검사 결과는 검사 목적과 개인의 사전확률, 후속 진단 절차를 함께 아는 의료진과 확인해야 합니다.

참고 자료