모두의 계산기
← 블로그로 돌아가기

재미있는 통계

버크슨의 역설(Berkson's Paradox): "매력적인 사람은 성격이 안 좋다?" 표본 선택 편향으로 생기는 음의 상관관계

외모와 성격이 원래 무관해도 연애 후보처럼 선택된 집단에서는 왜 음의 상관관계가 생길까요? 버크슨의 역설을 조건부확률, 콜라이더 편향과 모의실험으로 설명합니다.

“외모가 매력적인 사람은 성격이 좋지 않은 것 같아.” 주변의 연애 경험만 떠올리면 이런 인상을 받을 수 있습니다. 하지만 이 말이 전체 사람들의 외모와 성격 사이에 실제로 음의 상관관계가 있다는 뜻은 아닙니다. 누구를 만나고 관찰했는지에 따라 원래 없던 관계가 표본 안에서 만들어질 수 있기 때문입니다.

외모나 성격 중 적어도 하나가 일정 기준을 넘어야 연애 후보가 된다고 가정해 보겠습니다. 외모와 성격이 모두 기준보다 낮은 사람은 후보군에서 빠집니다. 반면 외모가 매우 뛰어난 사람은 성격 점수가 조금 낮아도 들어올 수 있고, 성격이 매우 좋은 사람은 외모 점수가 조금 낮아도 들어올 수 있습니다. 이렇게 선택된 후보만 보면 외모가 높을수록 성격이 낮고, 성격이 높을수록 외모가 낮은 것처럼 보일 수 있습니다.

이 현상을 ‘버크슨의 역설(Berkson’s Paradox)’이라고 합니다. 표본에 들어오는 조건이 두 특성의 공통 결과일 때, 전체 모집단에서는 무관했던 두 특성이 선택된 표본 안에서 관련된 것처럼 나타나는 선택 편향입니다. 현대 인과추론에서는 콜라이더 편향(collider bias)의 대표적인 사례로 설명합니다.

버크슨의 역설이란 무엇인가요?

버크슨의 역설은 두 변수 A와 B가 표본 선택 여부 S에 함께 영향을 줄 때 발생할 수 있습니다. 전체 모집단에서는 A와 B가 독립이거나 양의 관계를 보이더라도, S가 특정 값인 사례만 분석하면 두 변수 사이에 음의 관계가 생길 수 있습니다.

인과관계를 화살표로 표시하면 다음과 같습니다.

특성 A → 선택 여부 S ← 특성 B

두 화살표가 S에서 마주치기 때문에 S를 ‘콜라이더(collider)’라고 부릅니다. 선택된 사람만 본다는 것은 S=1이라는 조건을 거는 일입니다. 콜라이더에 조건을 걸면 원래 막혀 있던 A와 B 사이의 경로가 열려 비인과적 연관성이 생길 수 있습니다.

쉽게 말하면 합격이나 입원처럼 표본에 들어오는 문이 하나 있고, 두 변수가 그 문을 여는 서로 다른 열쇠라고 볼 수 있습니다. 한 열쇠가 부족한 상태에서 이미 문을 통과했다는 사실을 알게 되면 다른 열쇠가 강했을 가능성이 커집니다. 선택된 집단 안에서 한 특성의 값은 다른 특성에 대한 정보를 제공하게 됩니다.

조지프 버크슨은 병원 자료에서 무엇을 발견했나요?

이 역설의 이름은 미국의 의사이자 생물통계학자인 조지프 버크슨(Joseph Berkson)에서 나왔습니다. 버크슨은 1946년 Biometrics Bulletin에 ‘Limitations of the Application of Fourfold Table Analysis to Hospital Data’라는 논문을 발표했습니다. 논문은 제2권 제3호 47~53쪽에 실렸습니다.

버크슨이 다룬 핵심 문제는 병원 환자만 조사해 일반 인구의 질병 관계를 추론할 때 생기는 오류였습니다. 두 질병이 각각 병원에 입원할 가능성을 높인다고 가정하겠습니다. 일반 인구에서는 두 질병이 서로 무관하더라도 병원 환자만 모은 자료에서는 한 질병이 있는 환자에게 다른 질병이 적게 관찰될 수 있습니다.

병원에 왔다는 사실을 이미 알고 있는 상태에서 첫 번째 질병이 없다면, 그 사람은 두 번째 질병이나 다른 이유 때문에 입원했을 가능성이 상대적으로 커집니다. 반대로 첫 번째 질병이 있다면 두 번째 질병이 없어도 병원 표본에 들어올 수 있습니다. 입원 여부라는 공통 결과에 조건을 걸었기 때문에 질병 사이에 인위적인 연관성이 만들어진 것입니다.

버크슨의 원 논문은 2×2 분할표를 병원 자료에 적용할 때 일반 인구에서 얻은 표와 같은 방식으로 해석할 수 없다는 점을 지적했습니다. 오늘날에는 병원 입원 여부뿐 아니라 연구 참여, 설문 응답, 취업, 대학 입학, 앱 가입과 활동 여부처럼 분석 대상이 표본에 들어오는 모든 과정에서 같은 구조를 확인합니다.

“매력적인 사람은 성격이 안 좋다”는 인상이 생기는 과정

이 문장은 버크슨의 원 논문에 나온 결론이 아닙니다. 역설을 일상적으로 설명하기 위해 사용하는 가상 사례입니다. 실제 사람들의 외모와 성격에 관한 관계를 증명하는 자료로 받아들이면 안 됩니다.

전체 모집단에서 외모 매력도 A와 친절한 성격 B가 서로 독립이라고 가정하겠습니다. 그런데 어떤 관찰자가 A와 B의 합이 일정 기준 이상인 사람만 연애 후보로 만난다고 해보겠습니다.

외모가 매우 높은 사람은 성격 점수가 상대적으로 낮아도 합계 기준을 넘을 수 있습니다. 외모 점수가 낮은 사람은 후보가 되려면 성격 점수가 높아야 합니다. 두 점수가 모두 낮은 사람은 후보군에 들어오지 않습니다. 결국 관찰 가능한 후보군에는 다음과 같은 사람들이 많이 남습니다.

  • 외모와 성격이 모두 높은 사람
  • 외모가 높고 성격은 상대적으로 낮은 사람
  • 성격이 높고 외모는 상대적으로 낮은 사람

외모와 성격이 모두 낮은 사람은 보이지 않습니다. 이 빈 영역 때문에 선택된 집단의 산점도는 오른쪽 아래로 기울 수 있습니다. 관찰자는 자신이 만난 사람들만 놓고 “외모가 좋으면 성격이 나쁘다”고 해석할 수 있지만, 실제로 확인한 것은 전체 모집단이 아니라 자신의 선택 기준을 통과한 집단입니다.

400명으로 계산하는 가장 간단한 예시

전체 400명을 외모와 성격이 각각 높거나 낮은 네 집단으로 나눠 보겠습니다. 두 특성이 완전히 독립이고 각 조합에 100명씩 있다고 가정합니다. 이 숫자는 원리를 설명하기 위한 가상 자료입니다.

  • 외모 높음·성격 높음: 100명
  • 외모 높음·성격 낮음: 100명
  • 외모 낮음·성격 높음: 100명
  • 외모 낮음·성격 낮음: 100명

전체 집단에서 외모가 높은 200명 중 성격이 높은 사람은 100명으로 50%입니다. 외모가 낮은 200명 중에서도 성격이 높은 사람은 100명으로 50%입니다. 외모가 성격의 높고 낮음을 전혀 예측하지 못하므로 두 변수는 독립입니다.

이제 외모나 성격 중 하나라도 높은 사람만 후보로 선택하겠습니다. 두 특성이 모두 낮은 100명은 제외되고 300명이 남습니다.

선택된 집단에서 외모가 높은 사람은 200명이며 그중 성격이 높은 사람은 100명입니다. 비율은 여전히 50%입니다. 하지만 외모가 낮은 상태로 선택된 사람 100명은 모두 성격이 높은 사람입니다. 외모가 낮은 집단의 높은 성격 비율은 100%가 됩니다.

전체에서는 외모의 높고 낮음과 관계없이 성격이 높은 비율이 50%로 같았습니다. 선택된 300명 안에서는 외모가 높은 집단의 높은 성격 비율이 50%, 외모가 낮은 집단에서는 100%입니다. 선택 조건 하나 때문에 외모와 성격 사이에 음의 관계가 생겼습니다.

이 2×2 표에서 두 이진 변수의 상관을 나타내는 파이 계수를 계산하면 -0.5입니다. 전체 모집단의 상관계수 0이 표본을 선택한 뒤 -0.5로 바뀐 것입니다. 개인의 외모나 성격은 전혀 바꾸지 않았고, 두 변수가 서로 영향을 주도록 설정하지도 않았습니다.

100만 명 모의실험으로 확인한 음의 상관관계

높음과 낮음 두 단계가 아니라 연속된 점수에서도 같은 현상이 나타나는지 모의실험으로 확인했습니다. 결과를 재현할 수 있도록 난수 생성 시작값은 20260922로 고정했습니다.

가상 인물 100만 명에게 0 이상 1 미만의 외모 점수와 성격 점수를 각각 독립적으로 부여했습니다. 두 점수는 서로 영향을 주지 않도록 생성했습니다. 전체 자료에서 계산된 피어슨 상관계수는 약 -0.00003으로 사실상 0이었습니다.

이 가운데 두 점수의 합이 1.4 이상인 사람만 선택했습니다. 전체의 약 18.05%인 180,507명이 남았습니다. 선택된 집단의 외모 평균은 약 0.8001, 성격 평균은 약 0.7999였습니다. 두 특성의 평균은 전체보다 높아졌지만, 두 특성 사이의 상관계수는 약 -0.501로 바뀌었습니다.

전체 100만 명의 상관계수: 약 -0.00003
합계 1.4 이상인 180,507명의 상관계수: 약 -0.501

선택된 사람들의 외모와 성격이 전체보다 나빠진 것이 아닙니다. 두 점수의 평균은 모두 높았습니다. 다만 합계 기준을 통과하려면 한 점수가 낮을 때 다른 점수가 이를 보완해야 하므로 표본 안에서 음의 관계가 생겼습니다.

이 계산은 실제 사람의 매력이나 성격을 측정한 연구가 아닙니다. 독립적인 균등분포와 단순 합계 기준을 사용한 설명용 모의실험입니다. 실제 자료의 상관 방향과 크기는 모집단의 원래 관계, 측정 방법, 선택 규칙에 따라 달라집니다.

조건부확률로 보면 왜 관계가 뒤집히나요?

A를 외모가 높은 사건, B를 성격이 높은 사건, S를 연애 후보로 선택되는 사건이라고 하겠습니다. 전체 모집단에서 A와 B가 독립이면 다음 관계가 성립합니다.

P(B | A) = P(B)

A라는 정보를 알아도 B의 확률은 바뀌지 않는다는 뜻입니다. 하지만 S=1인 사람만 분석할 때 질문은 달라집니다.

P(B | A, S=1)과 P(B | A가 아님, S=1)은 같은가?

앞의 400명 예시에서 P(B | A, S=1)는 100÷200=50%입니다. 반면 P(B | A가 아님, S=1)는 100÷100=100%입니다. S에 조건을 추가하자 독립 관계가 사라졌습니다.

중요한 변화는 외모와 성격의 본질이 아니라 조건부확률의 분모입니다. 전체 400명이 아니라 선택된 300명만 분모에 들어갔고, 그 과정에서 외모와 성격이 모두 낮은 100명이 체계적으로 빠졌습니다.

콜라이더란 무엇인가요?

방향성 비순환 그래프(DAG)에서 콜라이더는 두 화살표가 마주치는 변수입니다. 다음 구조에서 S가 콜라이더입니다.

A → S ← B

A와 B가 모두 S의 원인이거나 S와 관련된 원인의 선행 요인이라면, S에 조건을 걸 때 A와 B 사이에 비인과적 경로가 열릴 수 있습니다. 여기서 ‘조건을 건다’는 말은 여러 작업을 포함합니다.

  • S=1인 사람만 표본으로 선택합니다.
  • S의 값에 따라 집단을 나눠 분석합니다.
  • 회귀모형에 S를 통제변수로 넣습니다.
  • S 때문에 일부 자료가 누락된 완전 사례만 분석합니다.
  • S의 결과 변수에 조건을 겁니다.

즉 표본을 직접 삭제하지 않아도 콜라이더를 회귀분석에서 통제하면 같은 종류의 문제가 생길 수 있습니다. 펠릭스 엘워트와 크리스토퍼 윈십은 2014년 Annual Review of Sociology 논문에서 이를 내생적 선택 편향으로 설명하며, 단순한 표본 제한뿐 아니라 통제와 층화도 콜라이더 조건화가 될 수 있다고 정리했습니다.

버크슨의 역설과 교란변수는 정반대인가요?

교란변수와 콜라이더는 화살표 구조가 다릅니다. 교란변수 C는 두 변수의 공통 원인입니다.

A ← C → B

예를 들어 연령이 어떤 노출과 질병에 모두 영향을 준다면 연령을 적절히 통제해 비인과적 경로를 막을 수 있습니다. 교란변수를 누락하면 편향이 생길 수 있습니다.

콜라이더 S는 두 변수의 공통 결과입니다.

A → S ← B

이 경로는 S에 조건을 걸지 않으면 원래 막혀 있습니다. 그런데 S를 통제하거나 S의 한 값만 선택하면 경로가 열릴 수 있습니다. 교란 문제에서는 필요한 변수를 통제하지 않아 편향이 생기지만, 콜라이더 문제에서는 통제하지 말아야 할 변수를 무심코 통제해 편향이 생길 수 있습니다.

모든 변수를 회귀모형에 넣으면 분석이 더 정확해진다는 생각은 인과추론에서 성립하지 않습니다. 어떤 변수를 조정해야 하는지는 상관계수의 크기나 데이터가 수집된 시점만으로 정할 수 없습니다. 연구 대상 변수들이 어떤 원인과 결과 구조를 이루는지 먼저 판단해야 합니다.

병원 자료에서 나타나는 버크슨 편향

질병 A와 질병 B가 각각 입원 가능성을 높인다고 가정하겠습니다. 일반 인구에서 두 질병이 독립이어도 입원 환자만 조사하면 한 질병이 없는 환자는 다른 질병 때문에 입원했을 가능성이 커집니다. 입원이라는 조건 안에서 두 질병이 서로 대체하는 것처럼 보일 수 있습니다.

다만 모든 병원 자료가 자동으로 편향되는 것은 아닙니다. 두 질병이 입원 확률에 미치는 방식, 대조군을 고른 방법, 진료 기록이 생성되는 과정에 따라 편향의 크기와 방향이 달라집니다. 병원 표본의 연관성을 일반 인구에 적용하려면 대상 모집단과 선택 과정을 확인해야 합니다.

전자건강기록 연구에서도 같은 문제가 이어집니다. 의료 이용은 여러 질환, 보험, 의료 접근성, 건강 행동의 영향을 받을 수 있습니다. 기록이 있는 환자만 분석한다는 사실 자체가 의료 이용이라는 선택 조건을 만들 수 있습니다. 따라서 기록의 규모가 커도 표본이 만들어지는 과정에서 생긴 구조적 편향은 자동으로 사라지지 않습니다.

채용과 대학 입학에서 생기는 상관관계

채용에서 기술 점수와 면접 점수 가운데 어느 하나가 매우 높으면 합격할 수 있다고 가정하겠습니다. 전체 지원자에게 두 점수가 무관해도 합격자 안에서는 기술 점수가 낮은 사람이 높은 면접 점수로 이를 보완했을 가능성이 큽니다. 기술 점수가 높은 합격자는 상대적으로 낮은 면접 점수로도 통과할 수 있습니다.

합격자만 분석하면 기술과 면접 능력 사이에 음의 상관이 보일 수 있습니다. 그렇다고 전체 노동시장에서 기술이 뛰어난 사람이 면접을 못한다고 결론 내릴 수는 없습니다. 합격 여부가 두 점수의 공통 결과이기 때문입니다.

대학 입학에서도 시험 성적, 비교과 활동, 추천서처럼 여러 평가 항목이 합격에 영향을 줍니다. 한 요소의 약점을 다른 요소의 강점으로 보완할 수 있는 선발 방식이라면 합격생 내부의 항목별 상관관계는 전체 지원자 집단의 상관관계와 다를 수 있습니다.

온라인 플랫폼과 고객 데이터에서도 발생합니다

온라인 서비스는 가입자, 구매자, 후기 작성자처럼 특정 행동을 한 사람의 자료를 주로 관찰합니다. 제품 만족도와 할인 민감도가 구매 여부에 함께 영향을 준다면 구매자만 분석했을 때 두 특성 사이에 인위적인 관계가 생길 수 있습니다.

예를 들어 제품 선호가 강한 사람은 할인이 작아도 구매하고, 선호가 약한 사람은 큰 할인이 있을 때만 구매할 수 있습니다. 구매자 자료 안에서는 선호가 강할수록 할인에 덜 민감한 관계가 나타날 수 있습니다. 이 결과를 구매하지 않은 사람까지 포함한 전체 잠재 고객에게 그대로 적용할 수는 없습니다.

설문 응답도 선택 변수입니다. 조사 주제에 관심이 크거나 불만이 강한 사람이 더 자주 응답한다면 응답자 집단에서 변수의 분포와 관계가 전체 대상자와 달라질 수 있습니다. 응답자 수가 많다는 사실만으로 비응답 편향이 해결되지는 않습니다.

버크슨의 역설은 언제 음의 상관을 만들까요?

외모와 성격 예시처럼 두 특성 가운데 하나의 높은 값이 다른 하나의 낮은 값을 보완하는 선택 규칙에서는 음의 관계가 나타나기 쉽습니다. 합계가 기준을 넘으면 통과하거나, 둘 중 하나만 좋아도 선발되는 구조가 여기에 해당합니다.

그러나 콜라이더에 조건을 걸었다고 해서 언제나 음의 상관관계가 생기는 것은 아닙니다. 선택 확률이 두 변수와 어떤 함수 관계를 이루는지, 두 변수가 원래 어떤 관계였는지, 다른 원인이 있는지에 따라 편향의 방향과 크기는 달라질 수 있습니다. 어떤 조건에서는 관계가 약해지거나 강해지고, 부호가 바뀌지 않을 수도 있습니다.

따라서 버크슨의 역설을 “선택하면 무조건 음의 상관이 생긴다”는 공식으로 외우면 안 됩니다. 정확한 핵심은 공통 결과에 조건을 걸면 원래의 관계가 왜곡될 수 있다는 것입니다. 음의 상관은 보완적인 문턱 선택에서 자주 사용하는 대표 사례입니다.

상관관계와 인과관계를 어떻게 구분해야 하나요?

선택된 집단에서 음의 상관이 실제로 계산됐더라도 그 상관은 표본 내부의 기술 통계로서는 맞을 수 있습니다. 오류는 그 값을 전체 모집단의 관계나 한 특성이 다른 특성을 변화시키는 인과효과로 해석할 때 발생합니다.

연애 후보 안에서 외모와 성격의 상관계수가 음수라는 결과가 나왔다면 다음 세 질문은 서로 다릅니다.

  1. 현재 후보 집단 안에서 두 점수는 함께 어떻게 변하나요?
  2. 전체 사람들 사이에서 두 점수는 어떤 관계인가요?
  3. 외모를 변화시키면 성격이 달라지나요?

첫 번째는 선택된 표본의 연관성, 두 번째는 모집단의 연관성, 세 번째는 인과관계에 관한 질문입니다. 한 질문의 답을 다른 질문의 답으로 바꿔 사용할 수 없습니다.

버크슨 편향을 발견하는 점검 질문

자료를 분석하기 전에 표본이 만들어진 과정을 확인해야 합니다.

  1. 분석 대상은 전체 모집단인가요, 특정 기준을 통과한 사람인가요?
  2. 표본 포함 여부에 두 개 이상의 변수가 영향을 주나요?
  3. 연구하려는 원인과 결과가 모두 참여, 입원, 합격 또는 응답에 영향을 주나요?
  4. 특정 집단만 남기거나 자료가 완전한 사례만 분석했나요?
  5. 회귀모형에 결과의 공통 원인이 아니라 공통 결과를 넣었나요?
  6. 선택되지 않은 사람의 분포를 확인할 외부 자료가 있나요?
  7. 선택 규칙을 바꿔도 상관관계의 방향과 크기가 유지되나요?

특히 “왜 이 행들이 데이터에 들어왔는가?”라는 질문이 중요합니다. 표본 크기, 유의확률, 회귀계수만 확인해서는 선택 과정을 알 수 없습니다.

버크슨의 역설을 줄이는 분석 방법

가장 먼저 목표 모집단과 관찰 표본을 구분합니다. 병원 환자에게만 답하려는 연구와 일반 인구의 질병 관계를 알고 싶은 연구는 필요한 표본이 다릅니다. 연구 질문을 관찰 가능한 집단으로 한정하면 일반화 범위도 그에 맞게 밝혀야 합니다.

가능하면 선택 이전의 모집단에서 자료를 수집합니다. 병원 환자만 비교하는 대신 인구 기반 표본을 사용하고, 합격자만 분석하는 대신 전체 지원자 자료를 포함하는 방식입니다. 표본 포함 여부와 그 원인을 기록하면 선택 구조를 평가하는 데 도움이 됩니다.

인과관계를 분석할 때는 자료를 보기 전에 분야 지식을 바탕으로 DAG를 작성할 수 있습니다. 변수의 역할은 이름만으로 정해지지 않습니다. 같은 변수도 연구 질문과 경로에 따라 교란변수, 매개변수 또는 콜라이더가 될 수 있습니다.

이미 선택된 자료만 있다면 선택 확률에 대한 가정을 명시하고 역확률 가중치, 표준화, g-계산 같은 방법을 검토할 수 있습니다. 2022년 학술지 Epidemiology에 발표된 선택 편향 정리 논문은 유형에 따라 역확률 가중치와 g-계산 등을 사용할 수 있다고 설명합니다. 다만 선택되지 않은 대상에 관한 정보가 전혀 없으면 어떤 방법도 확인할 수 없는 가정을 자동으로 없애 주지는 않습니다.

서로 다른 선택 모형을 적용한 민감도 분석도 필요합니다. 특정 집단이 표본에 포함될 확률을 여러 범위로 바꿨을 때 결론이 얼마나 달라지는지 확인하면 선택 편향에 대한 의존성을 보여 줄 수 있습니다.

자주 묻는 질문

버크슨의 역설은 상관계수가 잘못 계산됐다는 뜻인가요?

아닙니다. 선택된 표본 안에서 계산한 상관계수 자체는 정확할 수 있습니다. 문제는 선택 과정 때문에 그 상관이 전체 모집단의 관계와 달라졌는데도 이를 일반화하거나 인과관계로 해석하는 데 있습니다.

매력적인 사람은 실제로 성격이 나쁘다는 뜻인가요?

아닙니다. 이 문장은 선택 편향의 구조를 설명하는 가상 사례입니다. 버크슨의 역설은 외모와 성격 사이의 실제 관계를 증명하지 않습니다. 그런 관계를 확인하려면 대표성 있는 표본과 타당한 측정 방법이 필요합니다.

선택된 집단의 두 특성 평균도 낮아지나요?

반드시 그렇지 않습니다. 합계가 높은 사람만 선택한 100만 명 모의실험에서는 외모와 성격의 평균이 모두 약 0.8로 전체 평균 0.5보다 높았습니다. 두 특성의 수준은 모두 높으면서 표본 내부 상관은 음수가 될 수 있습니다.

콜라이더는 항상 통제하면 안 되나요?

변수의 역할은 연구 질문과 인과 구조에 따라 달라집니다. 특정 경로에서 콜라이더인 변수를 무조건 조정하면 편향을 만들 수 있지만, 복잡한 구조에서는 같은 변수가 다른 경로에서 별도의 역할을 할 수도 있습니다. 조정 여부는 사전에 설정한 인과모형과 분석 목표를 바탕으로 결정해야 합니다.

표본이 크면 버크슨 편향이 사라지나요?

사라지지 않습니다. 큰 표본은 무작위 표본오차를 줄이지만 잘못된 선택 구조를 바로잡지는 않습니다. 같은 기준으로 선택된 자료를 더 많이 모으면 편향된 관계를 더 정밀하게 추정할 수도 있습니다.

무작위 실험이면 콜라이더 편향이 없나요?

처치가 무작위로 배정됐더라도 처치 이후의 참여 유지, 생존, 검사 여부가 처치와 결과의 공통 영향을 받는다면 그 조건에 따른 분석에서 선택 편향이 생길 수 있습니다. 무작위 배정은 시작 시점의 교란을 줄이지만 이후의 선택 과정을 자동으로 해결하지는 않습니다.

결론: 데이터에 들어오는 문부터 확인하세요

버크슨의 역설은 관찰된 상관관계가 표본을 선택한 규칙에서 만들어질 수 있음을 보여 줍니다. 외모와 성격이 전체 모집단에서 독립이어도 두 점수의 합이 기준을 넘은 사람만 보면 음의 상관관계가 나타날 수 있습니다. 이는 매력적인 사람의 성격이 실제로 나쁘다는 증거가 아닙니다.

조지프 버크슨이 1946년 병원 자료에서 지적한 문제도 같은 구조입니다. 두 질병이 각각 입원 가능성을 높일 때 입원 환자만 분석하면 일반 인구에 없던 질병 간 관계가 생길 수 있습니다. 현대 인과추론은 이를 두 원인의 공통 결과인 콜라이더에 조건을 건 결과로 설명합니다.

분석에서 가장 먼저 확인할 것은 상관계수보다 표본의 입구입니다. 누가 포함됐는지, 어떤 기준으로 제외됐는지, 연구하려는 두 변수가 선택 여부에 함께 영향을 주는지 살펴봐야 합니다. 선택된 집단의 관계와 전체 모집단의 관계를 구분해야 버크슨의 역설이 만든 통계적 착시를 피할 수 있습니다.

참고 자료