두 치료법 A와 B를 비교한다고 가정해 보겠습니다. 가벼운 환자만 보면 A의 성공률이 더 높고, 중증 환자만 봐도 A가 더 높습니다. 그렇다면 전체 환자를 합쳤을 때도 당연히 A가 높아야 할 것 같습니다. 하지만 각 그룹의 인원 구성이 다르면 전체 성공률에서는 B가 더 높게 나타날 수 있습니다.
이처럼 하위 그룹에서 나타난 관계가 데이터를 합친 전체 집단에서는 사라지거나 반대 방향으로 바뀌는 현상을 ‘심슨의 역설(Simpson’s Paradox)’이라고 합니다. 계산이 틀려서 생기는 모순은 아닙니다. 서로 다른 비율의 그룹을 하나로 합치면서 각 그룹에 적용되는 가중치가 달라져 생기는 통계 현상입니다.
심슨의 역설을 이해하면 전체 평균 하나만 보고 결론을 내릴 때 어떤 정보가 가려질 수 있는지 알 수 있습니다. 반대로 데이터를 무조건 잘게 나누는 것이 언제나 옳은 것도 아닙니다. 전체 수치와 하위 그룹 중 무엇을 해석해야 하는지는 자료가 만들어진 과정과 분석하려는 질문에 따라 결정해야 합니다.
심슨의 역설이란 무엇인가요?
스탠퍼드 철학 백과사전은 심슨의 역설을 전체 모집단과 하위 모집단에서 변수 사이의 연관성이 나타나거나 사라지거나 반전되는 통계 현상으로 설명합니다. 대표적인 형태는 다음과 같습니다.
- 그룹 1에서 A의 성공률이 B보다 높습니다.
- 그룹 2에서도 A의 성공률이 B보다 높습니다.
- 두 그룹을 합치면 전체 성공률은 B가 A보다 높습니다.
첫 두 문장과 마지막 문장은 동시에 참일 수 있습니다. 각 성공률이 같은 분모로 계산된 값이 아니기 때문입니다. 전체 성공률은 그룹별 성공률을 단순히 더해서 나눈 평균이 아니라, 각 그룹의 인원수를 반영한 가중평균입니다.
예를 들어 A를 선택한 사람 대부분이 성공하기 어려운 그룹에 속하고, B를 선택한 사람 대부분이 성공하기 쉬운 그룹에 속했다면 전체 수치에는 치료법 차이와 난이도 차이가 함께 섞입니다. 하위 그룹에서는 치료법끼리 비슷한 조건으로 비교하지만, 전체에서는 서로 다른 환자 구성을 한꺼번에 비교하게 됩니다.
실제 신장결석 치료 자료에서 나타난 역전
심슨의 역설을 설명할 때 널리 사용되는 실제 자료가 있습니다. C. R. Charig 연구진이 1986년 British Medical Journal에 발표한 신장결석 치료 연구입니다. 아래 수치는 당시 자료를 통계 교육에서 A와 B 두 치료로 정리해 비교한 것입니다.
작은 결석 환자의 치료 성공률은 다음과 같습니다.
- 치료 A: 87명 중 81명 성공, 약 93.10%
- 치료 B: 270명 중 234명 성공, 약 86.67%
큰 결석 환자에서도 A의 성공률이 더 높습니다.
- 치료 A: 263명 중 192명 성공, 약 73.00%
- 치료 B: 80명 중 55명 성공, 68.75%
작은 결석에서는 A가 약 6.43%포인트 높고, 큰 결석에서는 A가 약 4.25%포인트 높습니다. 결석 크기를 나누어 비교하면 두 그룹 모두 A의 성공률이 B보다 높습니다.
그런데 결석 크기를 구분하지 않고 전체 환자를 합치면 순서가 바뀝니다.
- 치료 A 전체: 350명 중 273명 성공, 78.00%
- 치료 B 전체: 350명 중 289명 성공, 약 82.57%
전체 성공률만 보면 B가 A보다 약 4.57%포인트 높습니다. 부분 그룹에서는 모두 A가 높았는데 전체에서는 B가 높아진 전형적인 심슨의 역설입니다.
이 수치는 1980년대 치료 자료에서 나타난 통계 구조를 설명하기 위한 사례입니다. 현재 환자의 치료 방법을 선택하는 의료 지침이 아니며, 실제 치료 결정에는 최신 임상 근거와 의료진의 판단이 필요합니다.
성공률이 뒤집힌 이유는 환자 구성에 있습니다
두 치료를 받은 환자는 각각 350명으로 전체 인원은 같습니다. 그러나 결석 크기의 구성은 크게 다릅니다.
치료 A를 받은 350명 가운데 큰 결석 환자는 263명입니다. 비율로는 약 75.14%입니다. 작은 결석 환자는 87명으로 약 24.86%에 불과합니다. A군에는 상대적으로 성공하기 어려운 큰 결석 환자가 많이 포함되어 있습니다.
치료 B를 받은 350명 가운데 작은 결석 환자는 270명입니다. 약 77.14%입니다. 큰 결석 환자는 80명으로 약 22.86%입니다. B군에는 상대적으로 성공하기 쉬운 작은 결석 환자가 많이 포함되어 있습니다.
두 치료 모두 작은 결석의 성공률이 큰 결석보다 높습니다. A는 작은 결석에서 약 93%, 큰 결석에서 약 73%이고, B는 작은 결석에서 약 87%, 큰 결석에서 약 69%입니다. 전체 성공률은 각 치료가 쉬운 사례와 어려운 사례를 얼마나 많이 포함했는지에 큰 영향을 받습니다.
A는 각 난이도 안에서 B보다 높은 성공률을 보였지만 어려운 사례의 비중이 컸습니다. B는 각 난이도 안에서 A보다 낮았지만 쉬운 사례의 비중이 컸습니다. 이 구성 차이가 치료별 차이보다 전체 평균에 더 크게 작용하면서 순위가 뒤집혔습니다.
가중평균을 계산하면 역전이 보입니다
전체 성공률은 그룹별 성공률에 해당 그룹의 비중을 곱한 뒤 더한 값입니다. 치료 A의 전체 성공률은 다음과 같이 구성됩니다.
A 전체 성공률 = 작은 결석 성공률 × A군의 작은 결석 비중 + 큰 결석 성공률 × A군의 큰 결석 비중
수치를 넣으면 약 93.10% × 87/350 + 73.00% × 263/350 = 78.00%입니다. A군에서는 낮은 성공률을 가진 큰 결석 그룹의 가중치가 약 75%입니다.
치료 B도 같은 방식으로 계산합니다.
B 전체 성공률 = 작은 결석 성공률 × B군의 작은 결석 비중 + 큰 결석 성공률 × B군의 큰 결석 비중
약 86.67% × 270/350 + 68.75% × 80/350 = 82.57%입니다. B군에서는 성공률이 높은 작은 결석 그룹의 가중치가 약 77%입니다.
여기서 A와 B의 전체 성공률은 서로 다른 가중치를 사용한 평균입니다. A의 78%와 B의 82.57%를 바로 비교하면 치료법 차이뿐 아니라 결석 크기의 구성 차이까지 함께 비교하게 됩니다. 같은 크기의 결석끼리 비교했을 때와 전체 결과의 방향이 다른 이유입니다.
간단한 숫자로 다시 확인해 보기
같은 구조를 더 작은 가상 자료로 줄여 보겠습니다. 이 예시는 계산 원리를 보여 주기 위해 만든 자료입니다.
쉬운 문제를 푼 그룹에서는 A 방식으로 공부한 학생 10명 중 9명이 통과해 성공률이 90%이고, B 방식은 100명 중 80명이 통과해 80%라고 가정합니다. 어려운 문제 그룹에서는 A 방식이 100명 중 30명으로 30%, B 방식이 10명 중 2명으로 20%입니다.
- 쉬운 문제: A 90%, B 80%
- 어려운 문제: A 30%, B 20%
두 그룹에서 모두 A가 10%포인트 높습니다. 그러나 전체를 합치면 A는 110명 중 39명이 성공해 약 35.45%이고, B는 110명 중 82명이 성공해 약 74.55%입니다. 전체 수치에서는 B가 크게 앞섭니다.
A 방식에는 어려운 문제를 푼 학생이 100명이고 쉬운 문제를 푼 학생은 10명입니다. B 방식은 반대로 쉬운 문제를 푼 학생이 100명이고 어려운 문제를 푼 학생은 10명입니다. 방식의 성과를 비교하려던 자료에 문제 난이도와 인원 구성의 차이가 섞이면서 전체 결과가 뒤집혔습니다.
단순 평균과 전체 비율은 다릅니다
그룹별 성공률이 두 개 있다고 해서 두 수를 단순 평균하면 전체 성공률이 되는 것은 아닙니다. 신장결석 자료에서 치료 A의 그룹별 성공률 93.10%와 73.00%를 단순 평균하면 약 83.05%입니다. 하지만 실제 전체 성공률은 78.00%입니다. 두 그룹의 인원이 87명과 263명으로 다르기 때문입니다.
치료 B의 86.67%와 68.75%를 단순 평균하면 약 77.71%지만 실제 전체 성공률은 약 82.57%입니다. B군에서는 성공률이 높은 작은 결석 환자가 270명으로 대부분을 차지합니다.
그룹의 크기가 같을 때는 단순 평균과 가중평균이 같아질 수 있습니다. 그룹 크기가 다르면 큰 그룹의 성공률이 전체 수치에 더 많은 영향을 줍니다. 심슨의 역설은 A와 B가 서로 다른 가중치 조합을 가질 때 나타날 수 있습니다.
교란변수는 어떤 역할을 하나요?
신장결석 사례에서 결석 크기는 치료법 선택과 성공 여부 양쪽에 관련된 변수입니다. 큰 결석과 작은 결석은 기본적인 치료 성공 가능성이 다르고, 두 치료군에 포함된 결석 크기의 비율도 다릅니다. 이런 변수를 고려하지 않으면 치료법과 성공 사이의 관계가 왜곡되어 보일 수 있습니다.
통계와 역학에서는 분석하려는 원인과 결과의 관계를 섞어 놓는 제3의 변수를 교란변수라고 부릅니다. 다만 어떤 변수를 무조건 교란변수로 지정할 수 있는 것은 아닙니다. 시간적 순서와 인과 구조를 확인해야 합니다. 분석 대상의 원인보다 뒤에 생긴 변수를 잘못 통제하거나, 선택 과정에서 만들어진 변수로 데이터를 나누면 또 다른 편향을 만들 수 있습니다.
따라서 “그룹별 결과가 전체보다 항상 옳다”는 규칙도 성립하지 않습니다. 어떤 수치가 분석 질문에 적합한지는 제3의 변수가 원인과 결과에 어떤 관계를 가지는지에 따라 달라집니다. 단순한 표만으로 인과관계를 확정할 수 없는 이유입니다.
전체 데이터와 부분 데이터 중 무엇을 봐야 할까요?
질문이 단순한 현황 집계라면 전체 비율 자체가 필요한 답일 수 있습니다. 특정 기간에 실제로 몇 명이 성공했는지 묻는다면 전체 성공자 수와 전체 성공률을 보고하면 됩니다.
반면 치료 A와 B 가운데 어느 방법이 결과에 영향을 주었는지 알고 싶다면 환자의 초기 상태처럼 치료 선택과 결과에 함께 관련된 변수를 고려해야 합니다. 이때는 층화, 표준화, 회귀분석, 성향점수, 무작위 배정 등 연구 설계와 자료에 맞는 방법을 사용할 수 있습니다. 어떤 방법을 선택하더라도 필요한 가정과 한계를 밝혀야 합니다.
결석 크기별 성공률을 같은 인구 구성으로 표준화하면 서로 다른 가중치 때문에 생긴 차이를 줄일 수 있습니다. 예를 들어 A와 B에 작은 결석과 큰 결석의 가중치를 똑같이 50%씩 적용하면 A는 약 83.05%, B는 약 77.71%가 됩니다. 이 값은 실제 환자 구성에서 관찰한 전체 성공률이 아니라 비교를 위해 같은 가중치를 적용한 표준화 결과입니다.
버클리 대학원 입학 자료가 보여 준 집계의 위험
심슨의 역설과 함께 자주 언급되는 실제 사례가 1973년 캘리포니아대학교 버클리 대학원 입학 자료입니다. 전체 지원자를 합친 자료에서는 남성 지원자의 합격률이 여성보다 높아 여성에게 불리한 양상으로 보였습니다.
피터 비켈, 유진 해멀, 조지프 오코넬이 1975년 Science에 발표한 분석은 학과별 자료를 살폈습니다. 연구진은 여성 지원자가 남녀 모두에게 합격이 어려운 학과에 더 많이 지원한 경향이 전체 차이에 영향을 주었다고 설명했습니다. 학과는 지원자 구성과 합격률을 함께 좌우하는 중요한 층화 변수였습니다.
이 사례를 “학과별로 나누니 모든 학과에서 여성이 유리했다”라고 단순화하면 원 연구와 달라집니다. 논문의 초록은 통계적으로 유의한 차이를 보인 의사결정 단위가 적었고, 여성을 선호한 단위와 남성을 선호한 단위의 수가 대체로 비슷했다고 설명합니다. 핵심은 전체 격차가 관찰되었다는 사실과 각 학과의 선발 과정에서 같은 방향의 차별이 있었다는 주장이 서로 동일하지 않다는 점입니다.
또한 이 분석이 교육 과정 전반의 성별 불평등이 없다는 뜻도 아닙니다. 연구진은 여성 지원자가 더 경쟁적인 분야로 향하게 된 이전 교육과 사회화 과정까지 논의했습니다. 어떤 단계와 어떤 질문을 분석하는지에 따라 해석 범위가 달라집니다.
심슨의 역설을 발견하는 실무 점검 방법
데이터를 분석할 때 다음 순서로 확인하면 집계 때문에 중요한 패턴을 놓칠 가능성을 줄일 수 있습니다.
- 먼저 분자와 분모를 함께 확인합니다. 백분율만 비교하면 각 그룹의 크기를 알 수 없습니다.
- 전체 수치뿐 아니라 의미 있는 하위 그룹별 수치를 계산합니다. 연령, 난이도, 지역, 기간처럼 결과와 관련된 변수를 살펴봅니다.
- 그룹별 표본 수와 구성비를 나란히 표시합니다. 방향이 바뀌는 원인은 성공률보다 가중치 차이에서 드러나는 경우가 많습니다.
- 그룹별 결과와 전체 결과의 방향이 같은지 확인합니다. 모두 같은 방향인데 전체만 반대라면 심슨의 역설 구조를 의심할 수 있습니다.
- 동일한 가중치를 적용한 표준화 결과를 계산해 봅니다. 관찰된 전체 비율과 구성 차이를 분리하는 데 도움이 됩니다.
- 제3의 변수를 나눌 이론적 근거를 확인합니다. 결과를 보고 유리한 변수만 사후에 고르면 잘못된 결론을 만들 수 있습니다.
- 연관성과 인과관계를 구분합니다. 관찰 자료의 비율 차이만으로 어떤 선택이 결과를 만들었다고 단정할 수 없습니다.
표와 그래프를 만들 때도 전체 막대 하나만 제시하기보다 하위 그룹의 성공률과 표본 수를 함께 보여 주는 편이 정보를 더 정확히 전달합니다. 단, 개인을 식별할 수 있을 정도로 작은 집단은 개인정보 보호와 통계적 불확실성을 별도로 고려해야 합니다.
심슨의 역설은 왜 ‘착시’처럼 보일까요?
전체 데이터에는 모든 관측값이 들어 있으므로 전체 비율이 가장 공정한 요약처럼 보일 수 있습니다. 하지만 전체 비율은 각 하위 그룹의 성과뿐 아니라 그룹이 얼마나 큰지까지 함께 반영합니다. 비교 대상 A와 B의 그룹 구성이 다르면 서로 다른 기준으로 가중된 평균을 비교하게 됩니다.
부분 데이터만 보는 것도 자동으로 문제를 해결하지는 않습니다. 너무 작은 그룹은 우연 변동이 커질 수 있고, 잘못된 변수로 나누면 선택 편향이 생길 수 있습니다. 심슨의 역설이 알려 주는 사실은 전체가 항상 틀리거나 부분이 항상 맞다는 것이 아닙니다. 집계 방식에 따라 관찰된 연관성이 달라질 수 있으며, 인과적 결론에는 자료가 생성된 구조에 대한 정보가 필요하다는 점입니다.
수학적으로는 모순이 없습니다. A와 B의 가중평균이 서로 다른 가중치를 사용하기 때문에 그룹별 부등호의 방향이 전체에서도 보존될 필요가 없습니다. 같은 가중치를 양쪽에 적용하면 각 그룹에서 A가 B보다 높은 경우 A의 표준화 평균도 B보다 높습니다. 역전은 서로 다른 구성비가 적용될 때 발생합니다.
심슨의 역설이라는 이름의 유래
이와 같은 통계적 반전은 에드워드 심슨의 논문보다 앞서 논의되었습니다. 스탠퍼드 철학 백과사전에 따르면 칼 피어슨은 1899년, 조지 율은 1903년에 관련 현상을 다뤘습니다. 에드워드 H. 심슨은 1951년 Journal of the Royal Statistical Society에 ‘The Interpretation of Interaction in Contingency Tables’를 발표해 분할표의 연관성 해석 문제를 논의했습니다.
이후 이 현상은 심슨의 이름을 따라 널리 알려졌으며 ‘율-심슨 효과’라고도 불립니다. 심슨의 원 논문은 기계적으로 표를 합치거나 나누어 검정하는 절차만으로는 상호작용을 올바르게 해석하지 못할 수 있음을 사례로 보여 주었습니다.
자주 묻는 질문
부분 그룹에서 모두 A가 높으면 전체에서도 A가 높아야 하지 않나요?
A와 B에 같은 그룹 가중치를 적용한다면 그렇습니다. 하지만 실제 전체 비율은 A와 B에 서로 다른 그룹 구성비가 적용될 수 있습니다. A에는 어려운 사례가 많고 B에는 쉬운 사례가 많다면, 각 난이도에서 A가 높아도 전체에서는 B가 높게 나올 수 있습니다.
심슨의 역설은 계산 오류인가요?
아닙니다. 그룹별 비율과 전체 비율이 모두 정확하게 계산되어도 발생합니다. 서로 다른 가중치가 적용된 평균을 비교하기 때문에 방향이 바뀌는 것입니다.
데이터를 세분화하면 언제나 해결되나요?
아닙니다. 분석 질문과 관련 없는 변수로 나누거나 원인 이후에 생긴 변수를 통제하면 해석이 더 왜곡될 수 있습니다. 적절한 층화 변수는 연구 설계, 시간 순서, 분야 지식과 인과 구조를 바탕으로 정해야 합니다.
표본 수가 많으면 심슨의 역설이 사라지나요?
반드시 그렇지는 않습니다. 심슨의 역설은 단순한 표본 오차가 아니라 그룹 구성과 가중평균의 구조에서 발생할 수 있습니다. 같은 구성 차이가 유지된다면 표본이 커져도 역전이 나타날 수 있습니다. 큰 표본은 추정의 무작위 오차를 줄일 수 있지만 잘못된 집계 구조를 자동으로 바로잡지는 않습니다.
상관관계와 인과관계는 어떻게 구분하나요?
관찰된 비율만으로는 인과관계를 확정할 수 없습니다. 시간적 순서, 무작위 배정 여부, 공통 원인, 표본 선택 과정과 측정 방법을 함께 검토해야 합니다. 인과 그래프나 적절한 연구 설계는 어떤 변수를 통제해야 하는지 판단하는 데 사용됩니다.
결론: 평균을 보기 전에 무엇이 섞였는지 확인하세요
심슨의 역설은 부분 그룹에서 같은 방향으로 나타난 관계가 전체를 합쳤을 때 사라지거나 반대로 바뀌는 통계 현상입니다. 신장결석 자료에서는 A가 작은 결석과 큰 결석 모두에서 더 높은 성공률을 보였지만, A군에 큰 결석 환자가 많이 포함되어 전체 성공률은 B보다 낮았습니다.
이 역전은 산술 오류가 아니라 서로 다른 가중치를 사용한 평균에서 생겼습니다. 전체 백분율을 볼 때는 분자와 분모, 하위 그룹의 성공률, 각 그룹의 표본 수와 구성비를 함께 확인해야 합니다.
전체 데이터와 부분 데이터 가운데 어느 하나가 언제나 정답인 것은 아닙니다. 현황을 묻는지 효과를 묻는지 먼저 구분하고, 제3의 변수가 비교 대상과 결과에 어떤 관계를 가지는지 살펴야 합니다. 그래야 데이터에 나타난 연관성을 인과관계로 잘못 해석하는 일을 줄일 수 있습니다.
참고 자료
- Edward H. Simpson, The Interpretation of Interaction in Contingency Tables, 1951
- Stanford Encyclopedia of Philosophy, Simpson’s Paradox
- C. R. Charig 외, Comparison of Treatment of Renal Calculi, BMJ, 1986
- Harvard Department of Statistics, Statistics: Your Chance for Happiness or Misery
- P. J. Bickel·E. A. Hammel·J. W. O’Connell, Sex Bias in Graduate Admissions: Data from Berkeley, Science, 1975