잡종 완두콩을 자가수분했더니 노란 종자와 녹색 종자가 나왔습니다. 관측 비율이 정확히 3:1이 아니라면 멘델의 분리 법칙과 맞지 않는 것일까요? 유전 확률은 장기적으로 3:1을 예측하지만 유한한 수의 종자를 세면 우연한 표본변동 때문에 관측값은 조금씩 달라집니다.
이 차이가 자연스러운 무작위 변동인지, 3:1 모형으로 설명하기 어려울 만큼 큰지를 판단하는 도구가 피어슨 카이제곱 적합도 검정입니다. 멘델이 보고한 종자 색 자료 8,023개를 사용하면 관측도수와 기대도수의 차이를 직접 계산할 수 있습니다.
χ² = Σ[(관측도수−기대도수)²/기대도수]
먼저 바로잡을 점: 독립성 검정이 아니라 적합도 검정
카이제곱 검정에는 여러 종류가 있습니다. 완두콩의 노란색·녹색 관측 빈도가 미리 정한 3:1 분포와 맞는지 확인하는 문제는 카이제곱 적합도 검정입니다. 범주형 변수 하나의 관측 분포를 이론 분포와 비교합니다.
카이제곱 독립성 검정은 서로 다른 두 범주형 변수가 관련되어 있는지를 교차표로 검사합니다. 예를 들어 재배 지역과 종자 색이 독립인지 보려면 지역×색의 행과 열이 있는 표가 필요합니다. 3:1이라는 하나의 이론 비율에 맞는지를 볼 때는 독립성 검정이라는 이름을 쓰지 않습니다. 두 검정은 피어슨의 χ² 통계량을 사용하지만 귀무가설과 기대도수 계산법이 다릅니다.
| 구분 | 적합도 검정 | 독립성 검정 |
|---|---|---|
| 질문 | 한 변수의 분포가 이론 비율과 맞는가 | 두 범주형 변수가 서로 독립인가 |
| 자료 구조 | 범주별 관측도수 한 줄 | r×c 교차표 |
| 기대도수 | 전체 수×가정 확률 | 행 합계×열 합계/전체 수 |
| 자유도 | 보통 k−1−추정 모수 수 | (r−1)(c−1) |
| 완두콩 3:1 문제 | 해당 | 해당하지 않음 |
왜 단성잡종 교배에서 표현형이 3:1이 될까
대립유전자 A가 우성이고 a가 열성인 한 유전자 좌위를 생각하겠습니다. 순종 부모 AA와 aa를 교배하면 F₁ 자손은 모두 Aa가 됩니다. F₁ 개체 Aa가 만드는 생식세포에는 A와 a가 각각 절반의 확률로 들어갑니다.
| F₁ 생식세포 조합 | F₂ 유전자형 | 확률 | 표현형 |
|---|---|---|---|
| A×A | AA | 1/4 | 우성 |
| A×a | Aa | 1/4 | 우성 |
| a×A | Aa | 1/4 | 우성 |
| a×a | aa | 1/4 | 열성 |
유전자형 비율은 AA:Aa:aa=1:2:1입니다. 완전우성에서는 AA와 Aa가 같은 우성 표현형으로 보이므로 표현형은 우성 3/4, 열성 1/4이 됩니다. 이것이 단성잡종 F₂ 세대에서 기대하는 3:1 분리비입니다. 불완전우성이나 공우성처럼 이형접합체를 따로 구분할 수 있다면 표현형도 1:2:1로 보일 수 있습니다.
멘델이 실제로 기록한 노란색과 녹색 종자
멘델의 《식물 잡종에 관한 실험》에 따르면 종자 내부의 색을 조사한 두 번째 실험에서 258개 식물이 모두 8,023개의 종자를 만들었습니다. 이 가운데 노란색은 6,022개, 녹색은 2,001개였습니다. 멘델은 관측 비율을 약 3.01:1로 보고했습니다.
| 표현형 | 관측도수 O | 관측 비율 |
|---|---|---|
| 노란색 종자 | 6,022 | 약 75.06% |
| 녹색 종자 | 2,001 | 약 24.94% |
| 합계 | 8,023 | 100% |
노란색을 녹색으로 나누면 `6022/2001≈3.0095`입니다. 3과 매우 가까워 보이지만 눈대중만으로 판정하면 표본 크기를 반영하지 못합니다. 같은 비율 차이라도 종자 20개에서 나온 것과 8,023개에서 나온 것은 통계적 의미가 다를 수 있습니다.
1단계: 귀무가설과 대립가설 세우기
적합도 검정은 먼저 비교할 확률 모형을 정합니다. 이 문제의 귀무가설 H₀는 노란색과 녹색 종자의 모집단 확률이 각각 0.75와 0.25라는 것입니다. 대립가설 H₁은 실제 분포가 이 3:1 비율과 다르다는 것입니다.
H₀: P(노란색)=0.75, P(녹색)=0.25
H₁: 두 확률 가운데 적어도 하나가 H₀의 값과 다르다
유의수준 α는 자료를 보고 나서 유리하게 고르는 것이 아니라 검정 전에 정합니다. 설명을 위해 흔히 쓰는 α=0.05를 사용하겠습니다. 이는 H₀가 맞을 때 장기적으로 5%의 검정에서 우연한 표본변동을 근거로 H₀를 잘못 기각할 수 있도록 정한 기준입니다.
2단계: 3:1 비율로 기대도수 계산하기
기대도수 E는 귀무가설이 맞을 때 각 범주에서 평균적으로 기대하는 개수입니다. 전체 종자 수 8,023에 이론 확률을 곱합니다. 기대도수가 정수가 아니어도 문제가 없습니다. 실제 관측 개수가 아니라 반복 표본에서의 평균적인 기준값이기 때문입니다.
노란색 기대도수 = 8,023×3/4 = 6,017.25
녹색 기대도수 = 8,023×1/4 = 2,005.75
| 표현형 | 관측도수 O | 기대도수 E | 차이 O−E |
|---|---|---|---|
| 노란색 | 6,022 | 6,017.25 | +4.75 |
| 녹색 | 2,001 | 2,005.75 | −4.75 |
두 차이의 절댓값이 같은 것은 전체 개수가 고정되어 있기 때문입니다. 노란색이 기대보다 4.75개 많으면 녹색은 반드시 4.75개 적습니다. 범주별 차이는 독립적으로 두 개가 아니라 하나의 제약으로 연결됩니다. 이 점이 자유도가 1이 되는 이유와 이어집니다.
3단계: 피어슨 카이제곱 통계량 계산하기
피어슨 카이제곱 통계량은 각 범주의 관측값과 기대값 차이를 제곱한 뒤 기대도수로 나누어 더합니다. 제곱하므로 기대보다 많든 적든 양의 기여를 합니다. 기대도수로 나누는 과정은 범주의 규모에 맞춰 차이를 표준화합니다.
χ² = (6022−6017.25)²/6017.25 + (2001−2005.75)²/2005.75
χ² ≈ 0.00375 + 0.01125 = 0.0149985 ≈ 0.0150
χ²는 0 이상입니다. 관측도수와 기대도수가 완전히 같으면 0이 되고 차이가 커질수록 증가합니다. 여기서는 전체 8,023개 가운데 기대값과의 차이가 4.75개에 불과해 통계량이 매우 작습니다.
4단계: 자유도는 왜 1일까
범주가 k개이고 이론 확률을 자료에서 따로 추정하지 않았다면 적합도 검정의 자유도는 보통 `k−1`입니다. 이 문제는 노란색과 녹색 두 범주이므로 자유도는 `2−1=1`입니다.
전체 종자 수가 8,023개로 고정되면 노란색 개수를 아는 순간 녹색 개수도 자동으로 정해집니다. 자유롭게 달라질 수 있는 정보가 하나뿐입니다. 만약 기대 확률을 같은 자료에서 모수 추정으로 얻었다면 추정한 독립 모수 수만큼 자유도를 더 빼야 하지만, 여기서는 유전 모형이 0.75와 0.25를 미리 정합니다.
5단계: p값과 임계값으로 판단하기
자유도 1인 카이제곱분포에서 `χ²≈0.0150`보다 크거나 같은 통계량이 나올 위쪽 꼬리확률은 약 0.9025입니다. 이것이 p값입니다. α=0.05일 때 자유도 1의 임계값은 약 3.841이므로 검정통계량은 기각 영역에서 멀리 떨어져 있습니다.
| 항목 | 값 |
|---|---|
| 카이제곱 통계량 | χ²≈0.0150 |
| 자유도 | 1 |
| p값 | 약 0.9025 |
| 유의수준 | 0.05 |
| 임계값 | 약 3.841 |
| 판정 | 귀무가설을 기각하지 못함 |
관측 결과는 3:1 모형에서 예상할 수 있는 표본변동과 매우 잘 맞습니다. 정확한 통계 표현은 ‘3:1이라는 귀무가설을 기각할 충분한 증거가 없다’입니다. ‘3:1이 참이라고 증명됐다’거나 ‘3:1일 확률이 90.25%다’라고 말하면 p값을 잘못 해석한 것입니다.
p=0.9025는 무엇을 뜻하고 무엇을 뜻하지 않을까
p값은 귀무가설과 검정 가정이 맞다고 전제했을 때 현재 통계량 이상으로 3:1에서 벗어난 결과가 나올 확률입니다. 이 자료에서는 관측 편차가 아주 작아서 그런 결과가 흔하다는 뜻입니다.
- p값은 귀무가설이 참일 확률이 아닙니다.
- 1−p는 대립가설이 참일 확률이 아닙니다.
- p가 크다고 두 비율이 정확히 같다는 뜻은 아닙니다.
- p가 작으면 효과의 크기가 크다는 뜻도 아닙니다.
- 판정은 표본 추출과 독립성 같은 검정 가정이 타당할 때 의미가 있습니다.
귀무가설을 채택한다는 표현이 조심스러운 이유
유의하지 않은 결과는 3:1과 다른 모든 가능한 비율을 배제하지 않습니다. 표본이 작거나 변동이 크면 실제 차이가 있어도 검정이 잡아내지 못할 수 있습니다. 그래서 통계학에서는 보통 귀무가설을 ‘채택한다’보다 ‘기각하지 못한다’고 표현합니다.
이번 자료는 표본이 크고 관측 비율도 3:1에 매우 가깝지만 논리 구조는 같습니다. p값은 모형과 자료의 불일치를 찾는 도구입니다. 불일치를 찾지 못했다는 사실만으로 모형이 유일한 참이라고 입증되지는 않습니다.
가상의 65:35 자료라면 결과가 어떻게 달라질까
차이를 비교하기 위해 종자 100개 중 우성 65개, 열성 35개가 나온 가상 실험을 보겠습니다. 3:1 모형의 기대도수는 75개와 25개입니다.
χ² = (65−75)²/75 + (35−25)²/25 = 1.3333+4 = 5.3333
자유도 1에서 p값은 약 0.0209입니다. α=0.05보다 작으므로 이 가상 자료에서는 3:1 귀무가설을 기각합니다. 관측 비율이 1.86:1로 크게 달라진 데다 기대도수도 충분히 커 카이제곱 근사를 사용할 수 있습니다. 이 예시는 멘델의 실제 자료가 아닙니다.
표본 크기가 커지면 같은 비율 차이도 달라진다
카이제곱 통계량은 단순한 비율 차이만 보지 않습니다. 관측도수와 기대도수의 차이를 기대도수와 함께 계산합니다. 같은 70:30 비율이라도 전체가 10개인지 10,000개인지에 따라 통계량과 p값이 달라집니다.
표본이 매우 크면 실질적으로 작은 비율 차이도 통계적으로 유의할 수 있습니다. 반대로 표본이 작으면 눈에 띄는 차이가 있어도 우연한 변동과 구분하기 어렵습니다. p값과 함께 관측 비율, 이론 비율의 차이와 생물학적 의미를 같이 봐야 합니다.
카이제곱 근사를 쓰기 위한 조건
피어슨 통계량이 카이제곱분포를 따른다는 결과는 큰 표본에서의 근사입니다. NIST는 일반적인 기준으로 각 기대도수가 적어도 5가 되어야 한다고 설명합니다. 멘델 종자 색 자료의 기대도수는 6,017.25와 2,005.75이므로 이 조건을 넉넉히 만족합니다.
- 범주는 서로 겹치지 않아 각 관측이 한 범주에만 들어가야 합니다.
- 이론 확률의 합은 1이어야 하고 기대도수 합은 전체 관측 수와 같아야 합니다.
- 관측은 모형이 요구하는 방식으로 무작위적이고 충분히 독립적이어야 합니다.
- 기대도수가 너무 작으면 카이제곱 근사의 정확도가 떨어집니다.
- 자료를 본 뒤 임의로 범주나 가설을 바꿨다면 p값 해석이 달라집니다.
작은 표본에서는 정확 이항검정을 고려한다
우성·열성처럼 범주가 둘이고 각 자손을 독립적인 베르누이 시행으로 볼 수 있다면 귀무가설 아래 우성 개수는 `X~Binomial(n,0.75)`입니다. 표본이 작을 때는 이항분포에서 관측값 이상으로 극단적인 결과의 확률을 직접 더하는 정확 이항검정을 사용할 수 있습니다.
카이제곱 검정은 계산이 간단하고 여러 범주로 쉽게 확장되지만 근사법입니다. 표본이 작고 기대도수가 5 미만이라면 범주를 무리하게 합치기보다 실험 설계와 가설에 맞는 정확검정을 선택하는 편이 낫습니다.
종자들이 정말 완전히 독립일까
단순 검정은 8,023개 종자를 같은 확률을 가진 독립 시행처럼 다룹니다. 그러나 멘델의 종자들은 258개 식물과 여러 꼬투리에서 나왔습니다. 같은 식물이나 꼬투리에서 나온 종자 사이에 공통 환경이나 생물학적 군집 효과가 있다면 완전한 독립 가정과 차이가 날 수 있습니다.
이런 구조가 중요하다면 식물 또는 꼬투리를 군집 단위로 반영한 모형이 필요합니다. 고전적인 3:1 적합도 계산은 유전 모형을 이해하기에 유용하지만 현대적인 원자료 분석에서는 실험 단위, 표본 추출 방식과 군집 구조를 함께 확인해야 합니다.
분리 법칙과 독립의 법칙은 다른 내용이다
분리 법칙은 한 유전자 좌위의 두 대립유전자가 생식세포 형성 과정에서 갈라져 각 생식세포에 하나씩 들어간다는 내용입니다. Aa×Aa 단성잡종 교배의 1:2:1 유전자형과 3:1 표현형 비율이 여기서 나옵니다.
독립의 법칙은 서로 다른 유전자 좌위의 대립유전자 쌍이 생식세포로 전달될 때 독립적으로 조합된다는 내용입니다. 유전자들이 같은 염색체에서 가까이 연결되어 있으면 독립분배에서 벗어날 수 있습니다. 통계학의 카이제곱 독립성 검정과 유전학의 독립의 법칙도 이름이 비슷하지만 같은 개념은 아닙니다.
두 유전자의 9:3:3:1 비율도 같은 방식으로 검정한다
서로 독립적으로 분리되는 두 유전자에 대해 `AaBb×AaBb`를 교배하고 완전우성을 가정하면 네 표현형의 이론 비율은 9:3:3:1입니다. 전체 자손 수 n에 각각 9/16, 3/16, 3/16, 1/16을 곱해 기대도수를 구합니다.
χ² = Σ(Oᵢ−Eᵢ)²/Eᵢ, 자유도 = 4−1 = 3
이 역시 미리 정한 네 범주 비율과 비교하면 적합도 검정입니다. 부모의 종류, 처리 조건, 지역과 표현형처럼 두 분류 기준을 교차표로 만들고 관련성을 묻는 경우에 독립성 또는 동질성 검정을 사용합니다.
심슨의 역설과 교차표 분석의 차이
부분 집단과 전체 집단에서 관계가 뒤집히는 심슨의 역설은 여러 집단을 합쳤을 때 숨어 있던 교란 구조가 결과를 바꿀 수 있음을 보여 줍니다. 지역이나 교배 조건별 자료를 합쳐 하나의 3:1 비율로 검사한다면 집단별 차이가 가려질 수 있습니다.
단일 적합도 검정은 전체 분포가 3:1과 맞는지만 알려 줍니다. 서로 다른 식물군이나 처리군이 같은 비율을 공유하는지 확인하려면 층별 자료와 교차표 또는 계층 모형이 필요합니다. 전체 χ²가 작다는 이유만으로 모든 하위 집단이 같은 유전 확률을 가진다고 결론 내릴 수는 없습니다.
p<0.05만 골라 보면 생기는 문제
유의한 결과만 논문에 남아 전체 근거가 왜곡되는 출판 편향은 카이제곱 검정에서도 생길 수 있습니다. 수많은 형질과 교배 조건을 시험한 뒤 p<0.05인 결과만 보고하면 실제보다 분리비 위반이 흔한 것처럼 보일 수 있습니다.
가설과 분석 계획을 미리 정하고 모든 결과를 보고해야 p값의 의미가 유지됩니다. 여러 가설을 동시에 검사했다면 다중검정으로 우연한 유의 결과가 늘어나는 문제도 고려해야 합니다. 유의한지 여부만이 아니라 관측치, 기대치, 표본 크기와 실험 조건을 함께 공개해야 합니다.
p값은 조건부 확률이라는 점
기저율을 무시하면 양성 검사 결과를 잘못 해석하게 되는 베이즈 계산에서 `P(양성|질병)`과 `P(질병|양성)`은 다릅니다. 같은 이유로 카이제곱 검정의 `P(현재 이상 편차|H₀)`를 `P(H₀|자료)`로 뒤집을 수 없습니다.
귀무가설 자체의 확률을 계산하려면 가설에 대한 사전확률과 대립 모형의 가능도까지 정하는 베이즈 분석이 필요합니다. 피어슨 카이제곱 검정은 그런 사후확률을 출력하지 않습니다.
멘델은 카이제곱 검정을 직접 사용했을까
멘델은 연구 결과를 1865년에 발표하고 1866년에 출판했습니다. 카를 피어슨이 카이제곱 적합도 기준을 발표한 것은 1900년입니다. 따라서 멘델이 자신의 완두콩 자료에 오늘날의 피어슨 카이제곱 검정을 직접 적용했다고 설명하면 연대가 맞지 않습니다.
멘델은 관측 개수와 비율을 상세히 기록하고 이론적 분리비와 비교했습니다. 지금 계산하는 χ²와 p값은 후대에 확립된 통계 방법으로 그 자료를 다시 평가한 결과입니다. 역사적 실험과 현대적 검정을 구분하면 멘델의 관측과 피어슨의 통계학이 각각 한 역할이 분명해집니다.
멘델의 다른 단성잡종 자료도 계산할 수 있다
멘델의 첫 번째 실험인 종자 모양에서는 둥근 종자 5,474개와 주름진 종자 1,850개가 보고됐습니다. 합계 7,324개에 3:1을 적용하면 기대도수는 5,493개와 1,831개입니다.
χ² = (5474−5493)²/5493 + (1850−1831)²/1831 ≈ 0.2629
자유도 1에서 p값은 약 0.6081입니다. 이 자료도 α=0.05에서 3:1 귀무가설을 기각하지 못합니다. 종자 색 자료보다 χ²가 크지만 여전히 표본변동으로 설명할 수 있는 범위입니다. 서로 다른 실험의 p값 크기만 줄 세우기보다 각 표본과 실험 설계를 함께 살펴야 합니다.
멘델 분리비 카이제곱 검정에서 자주 생기는 오류
- 3:1 이론 비율과 한 변수의 관측도수를 비교하면서 독립성 검정이라고 부릅니다.
- 3과 1을 기대도수에 직접 넣고 전체 표본 수를 반영하지 않습니다.
- 관측 비율을 반올림해 계산하여 원래 정수 도수 정보를 잃습니다.
- 자유도를 범주 수 2로 둡니다. 모수를 추정하지 않은 두 범주 적합도 검정은 자유도 1입니다.
- p>0.05를 3:1이 참일 확률이 95%보다 높다는 뜻으로 해석합니다.
- p<0.05이면 유전 법칙이 무조건 틀렸다고 결론 냅니다. 표본, 분류와 실험 조건도 점검해야 합니다.
- 기대도수가 작은데도 카이제곱 근사를 그대로 사용합니다.
- 여러 꼬투리와 식물에서 나온 종자를 모두 완전히 독립이라고 가정하면서 군집 구조를 확인하지 않습니다.
멘델의 3:1 분리비 검정 FAQ
관측값이 정확히 3:1이어야 분리 법칙과 맞나요?
아닙니다. 3/4과 1/4은 각 자손의 확률이며 유한 표본의 실제 개수는 무작위로 흔들립니다. 검정은 관측 편차가 이 표본변동으로 설명하기 어려울 만큼 큰지 판단합니다.
기대도수가 소수여도 괜찮나요?
괜찮습니다. 기대도수는 반복 실험에서의 평균 기준값이므로 6,017.25처럼 소수가 될 수 있습니다. 실제 관측도수만 개수를 세므로 정수여야 합니다.
왜 차이를 제곱하나요?
양의 차이와 음의 차이가 서로 상쇄되지 않도록 하고 큰 편차에 더 큰 가중을 주기 위해서입니다. 기대도수로 나누면 범주의 규모에 비례해 편차를 비교할 수 있습니다.
p값이 매우 크면 자료가 지나치게 잘 맞는 것인가요?
큰 p값 하나만으로 자료 수집에 문제가 있다고 판단할 수 없습니다. 귀무가설 아래 p값은 표본마다 달라질 수 있습니다. 여러 독립 실험의 결과가 체계적으로 기대값에 지나치게 가까운지 평가하려면 실험 선택, 분류 과정과 전체 자료를 별도로 분석해야 합니다.
3:1 검정에 카이제곱 독립성 검정을 쓸 수는 없나요?
단일 표본의 우성·열성 개수를 3:1과 비교할 때는 적합도 검정이 맞습니다. 여러 교배군 또는 처리군과 표현형을 교차표로 만들고 두 변수의 관계를 묻는다면 독립성이나 동질성 검정을 사용할 수 있습니다.
6,022대 2,001 계산의 핵심 정리
멘델은 노란색 종자 6,022개와 녹색 종자 2,001개를 보고했습니다. 3:1 모형 아래 기대도수는 6,017.25개와 2,005.75개입니다. 피어슨 공식 `χ²=Σ(O−E)²/E`에 넣으면 χ²는 약 0.0150입니다.
범주가 둘이고 이론 확률을 자료에서 추정하지 않았으므로 자유도는 1입니다. p값은 약 0.9025로 α=0.05에서 3:1 귀무가설을 기각하지 못합니다. 이 결과는 관측 자료가 분리비와 매우 잘 맞는다는 뜻이지만 3:1을 확률 90.25%로 증명하는 것은 아닙니다. 또한 이 문제의 정확한 검정 이름은 피어슨 카이제곱 독립성 검정이 아니라 피어슨 카이제곱 적합도 검정입니다.