같은 질문을 다룬 연구가 100편 있다고 생각해 보겠습니다. 효과가 없거나 방향이 예상과 다른 연구는 논문으로 나오지 않고, 통계적으로 유의한 결과만 학술지에 실린다면 독자가 보는 문헌은 실제 연구 전체와 달라집니다. 공개된 논문만 모아 분석하면 효과가 실제보다 크게 보이거나, 존재하지 않는 효과가 있는 것처럼 보일 수 있습니다. 이를 출판 편향(publication bias)이라고 합니다.
출판 편향을 ‘p<0.05인 결과만 학술지에 실리는 현상’이라고만 정의하면 범위가 너무 좁습니다. 통계적으로 유의한 결과가 선택되는 현상이 대표적이지만 효과의 방향과 크기, 연구 주제의 새로움, 후원자에게 유리한지 여부, 출판 속도와 언어도 결과 공개에 영향을 줄 수 있습니다. 연구자가 원고를 제출하지 않는 과정과 학술지가 게재 여부를 결정하는 과정 모두 선택에 관여할 수 있습니다.
펀넬 플롯(funnel plot)은 이런 선택 때문에 작은 연구의 결과가 한쪽에서 사라졌는지 살펴보는 그래프입니다. 그러나 그래프가 비대칭이라고 출판 편향이 입증되는 것은 아닙니다. 반대로 대칭이라고 편향이 없다고 보장할 수도 없습니다. 펀넬 플롯이 무엇을 계산하고 어떤 조건에서 해석해야 하는지까지 알아야 결과를 정확하게 읽을 수 있습니다.
출판 편향이란 무엇인가요?
출판 편향은 연구 결과의 내용이 연구의 출판 가능성과 관련되어, 공개된 연구가 수행된 연구 전체를 대표하지 못하는 현상입니다. 효과가 크고 통계적으로 유의하며 예상한 방향과 일치하는 결과가 더 쉽게 공개되면 이용 가능한 증거와 사라진 증거 사이에 체계적인 차이가 생깁니다. 단순히 논문 수가 줄어드는 문제가 아니라 남은 표본의 구성이 달라지는 선택 편향입니다.
코크란 지침은 연구 전체가 공개되지 않는 경우와 한 연구 안에서 특정 결과만 공개되지 않는 경우를 구분합니다. 임상시험 자체가 논문으로 나오지 않으면 연구 수준의 미출판입니다. 논문은 나왔지만 사전에 정한 주요 결과나 특정 시점의 결과가 빠지면 선택적 결과 보고입니다. 두 경우 모두 메타분석에 필요한 증거가 결과값에 따라 사라질 수 있습니다.
- 출판 편향: 연구 결과에 따라 연구 전체의 출판 여부가 달라집니다.
- 선택적 결과 보고: 한 연구에서 측정한 여러 결과 중 일부만 공개합니다.
- 시간 지연 편향: 유의하거나 긍정적인 결과가 더 빨리 출판됩니다.
- 언어 편향: 결과에 따라 국제 학술지나 특정 언어로 출판될 가능성이 달라집니다.
- 중복 출판 편향: 같은 데이터의 긍정적인 결과가 여러 논문에 반복될 수 있습니다.
- 인용 편향: 긍정적이거나 뚜렷한 결과가 더 많이 인용되어 검색에 잘 드러납니다.
서랍 효과(File Drawer Effect)는 무엇인가요?
심리학자 로버트 로젠탈(Robert Rosenthal)은 1979년 논문에서 통계적으로 유의하지 않은 연구 결과가 연구자의 서랍에 남는 문제를 ‘파일 서랍 문제(file drawer problem)’라고 표현했습니다. 공개된 논문은 유의한 결과를 보여 주지만 비슷한 질문에서 나온 수많은 영가설 기각 실패 결과는 보이지 않는 상황을 가리킵니다.
효과가 실제로 0이고 하나의 사전 지정된 양측 검정을 유의수준 0.05로 반복한다면 장기적으로 약 5%는 우연만으로 p<0.05가 됩니다. 100개의 독립 연구가 모두 같은 영가설을 검정할 경우 유의한 결과의 기대 개수는 100×0.05 = 5개입니다. 이 5개만 출판되고 나머지 95개가 서랍에 남으면 문헌에는 거짓양성 결과만 보일 수 있습니다. 실제 연구에서는 검정력과 연구 설계, 진짜 효과와 분석 선택이 서로 다르므로 이 숫자는 원리를 보여 주는 단순 모형입니다.
영가설이 참이고 α=0.05인 사전 지정 검정 100개에서 우연히 유의한 결과의 기대 개수 = 100×0.05 = 5개
p≥0.05는 효과가 없다는 증명이 아닙니다. 표본이 작아 불확실성이 크거나 실제 효과가 작으면 의미 있는 효과가 있어도 유의수준을 넘지 못할 수 있습니다. 반대로 p<0.05도 효과가 크거나 실용적으로 중요하다는 뜻은 아닙니다. 출판 여부를 0.05라는 문턱 하나로 결정하면 연속적인 불확실성이 ‘성공’과 ‘실패’로 잘립니다.
p<0.05 선택이 효과크기를 부풀리는 계산
연구가 보고한 효과추정치를 y, 그 표준오차를 SE라고 하겠습니다. 영가설이 효과 0이라는 양측 검정에서 z 통계량은 y/SE입니다. 정규근사를 사용하면 |z|>1.96일 때 p<0.05입니다.
z = y/SE, 양측검정에서 p<0.05가 되려면 |y| > 1.96×SE
표준오차가 0.10인 큰 연구는 효과추정치의 절댓값이 0.196보다 커야 유의합니다. 표준오차가 0.30인 작은 연구는 절댓값이 0.588보다 커야 합니다. 작은 연구가 p<0.05 문턱을 넘으려면 우연 변동으로라도 훨씬 큰 효과가 관찰되어야 합니다. 유의한 작은 연구만 선택하면 공개 문헌의 작은 연구 효과가 커지는 이유입니다.
| 표준오차 SE | 양측 p<0.05에 필요한 |y| | 95% 기준 계산 |
|---|---|---|
| 0.10 | 0.196 초과 | 1.96×0.10 |
| 0.20 | 0.392 초과 | 1.96×0.20 |
| 0.30 | 0.588 초과 | 1.96×0.30 |
| 0.50 | 0.980 초과 | 1.96×0.50 |
이 현상은 작은 표본의 결과가 모두 틀렸다는 뜻이 아닙니다. 작은 연구는 표준오차가 커서 효과추정치가 넓게 흩어집니다. 그중 특정 방향으로 크고 유의한 결과만 선택할 때 조건부 평균이 원래 평균에서 멀어지는 것이 문제입니다. 선택 과정이 없다면 큰 양의 값과 큰 음의 값, 0에 가까운 값이 함께 관찰됩니다.
펀넬 플롯은 어떻게 그리나요?
펀넬 플롯은 각 연구를 점 하나로 표시합니다. 가로축에는 효과추정치 y를 놓고 세로축에는 표준오차 SE 또는 정밀도 1/SE를 놓습니다. 표준오차를 쓰는 그래프에서는 보통 작은 표준오차가 위로 오도록 세로축을 뒤집습니다. 큰 연구는 표준오차가 작아 위쪽에, 작은 연구는 표준오차가 커 아래쪽에 놓입니다.
연구들이 하나의 공통 효과 θ를 추정하고 선택 편향과 큰 이질성이 없다면 효과추정치는 대략 θ를 중심으로 퍼집니다. 표준오차가 작은 위쪽에서는 좁게 모이고 아래쪽에서는 넓게 벌어집니다. 이 모습이 뒤집힌 깔때기와 비슷해 펀넬 플롯이라는 이름이 붙었습니다.
예상 95% 깔때기 경계 = 요약 효과 θ̂ ± 1.96×SE
요약 효과가 0.20이라고 하겠습니다. SE=0.10인 높이에서 예상 경계는 0.20±1.96×0.10이므로 0.004부터 0.396입니다. SE=0.30인 아래쪽에서는 0.20±1.96×0.30이므로 -0.388부터 0.788입니다. 표준오차가 커질수록 좌우 경계가 넓어져 깔때기 모양이 됩니다. 이 선은 개별 연구 분포를 살펴보기 위한 의사 신뢰한계이며 출판 편향 유무를 판정하는 절대 경계가 아닙니다.
| SE | 아래쪽 경계 θ̂-1.96SE | 위쪽 경계 θ̂+1.96SE |
|---|---|---|
| 0.10 | 0.004 | 0.396 |
| 0.20 | -0.192 | 0.592 |
| 0.30 | -0.388 | 0.788 |
| 0.40 | -0.584 | 0.984 |
가상의 연구 8편으로 보는 선택 편향 계산
다음은 계산 원리를 보여 주기 위해 만든 가상 자료입니다. 효과가 양수인 방향만 바람직하다고 가정하고, 양측 p<0.05인 긍정적 연구만 공개되는 극단적인 선택 규칙을 적용하겠습니다. 실제 출판 과정을 측정한 데이터는 아닙니다.
| 연구 | 효과 y | SE | z=y/SE | 긍정적 p<0.05 |
|---|---|---|---|---|
| A | 0.05 | 0.10 | 0.50 | 아니요 |
| B | -0.04 | 0.12 | -0.33 | 아니요 |
| C | 0.10 | 0.15 | 0.67 | 아니요 |
| D | -0.12 | 0.18 | -0.67 | 아니요 |
| E | 0.42 | 0.20 | 2.10 | 예 |
| F | 0.55 | 0.24 | 2.29 | 예 |
| G | -0.15 | 0.28 | -0.54 | 아니요 |
| H | 0.62 | 0.30 | 2.07 | 예 |
고정효과 메타분석에서는 일반적으로 각 연구에 역분산 가중치 w=1/SE²을 줍니다. 표준오차가 작은 정밀한 연구가 더 큰 가중치를 받습니다. 가중평균 효과는 다음과 같습니다.
요약 효과 θ̂ = Σ(wi×yi) / Σwi, wi = 1/SEi²
8편을 모두 넣으면 역분산 가중평균 효과는 약 0.090입니다. 하지만 긍정적이면서 p<0.05인 E, F, H만 남기면 약 0.504가 됩니다. 같은 원자료에서 선택 규칙 하나만 적용했는데 요약 효과가 5배 이상 커졌습니다. 이 값은 가상 예시의 결과이며 출판 편향의 크기가 언제나 이 정도라는 뜻은 아닙니다.
펀넬 플롯에서는 E, F, H가 표준오차가 큰 아래쪽 오른편에 나타납니다. 반면 아래쪽의 0에 가까운 점과 음의 점은 사라집니다. 아래쪽 한쪽이 비어 보이는 비대칭 모양이 만들어집니다. 출판 편향이 펀넬 플롯에 흔적을 남기는 대표적인 방식입니다.
펀넬 플롯의 비대칭이 출판 편향의 증거인가요?
비대칭은 출판 편향과 일치할 수 있지만 그 원인을 하나로 확정하지는 못합니다. 펀넬 플롯은 본질적으로 작은 연구의 효과가 큰 연구와 체계적으로 다른지 보여 주는 소규모 연구 효과(small-study effects) 그래프입니다. 선택적 미출판은 가능한 원인 중 하나입니다.
- 작은 연구가 고위험 환자처럼 효과가 더 큰 집단을 조사한 진짜 이질성
- 작은 연구의 설계나 분석 품질이 달라 생긴 편향
- 용량, 추적 기간과 개입 방식의 차이
- 우연한 표본 변동
- 효과크기와 표준오차 사이에 생기는 수학적 상관
- 특정 방향이나 유의확률에 따른 선택적 출판과 결과 보고
연구 간 실제 효과가 크게 다르면 대칭 깔때기라는 기준 자체가 맞지 않을 수 있습니다. 이분형 결과의 오즈비나 표준화 평균차처럼 효과크기와 표준오차가 구조적으로 관련되는 지표도 가짜 비대칭을 만들 수 있습니다. 그래서 효과 지표에 맞는 세로축과 검정법을 선택해야 합니다.
에거 검정(Egger's Test)은 무엇을 계산하나요?
에거 검정은 펀넬 플롯의 비대칭을 회귀분석으로 살펴보는 대표적인 방법입니다. 각 연구의 표준정규화 효과 SND=y/SE를 정밀도 Precision=1/SE에 회귀합니다. 가장 널리 알려진 표현은 다음과 같습니다.
SNDᵢ = β₀ + β₁×Precisionᵢ + εᵢ
절편 β₀가 0에서 체계적으로 벗어나는지를 검정해 작은 연구의 비대칭을 평가합니다. β₀에 대한 p값이 작으면 비대칭 신호가 있다는 뜻이지 출판 편향이 확정됐다는 뜻은 아닙니다. 회귀가 유의하지 않아도 연구 수가 적으면 검정력이 부족해 실제 비대칭을 놓칠 수 있습니다.
코크란은 경험적 기준으로 메타분석에 연구가 10편 이상 있을 때 비대칭 검정을 고려하라고 권고합니다. 10편 미만이면 검정력이 낮습니다. 연구들의 크기와 표준오차가 거의 같아도 회귀에 필요한 범위가 부족하므로 검정을 사용하지 않는 것이 좋습니다. 오즈비나 표준화 평균차에는 원래 에거 검정 대신 해당 효과 지표에 맞는 방법이 필요할 수 있습니다.
등고선 펀넬 플롯과 보정 방법의 한계
등고선 강화 펀넬 플롯(contour-enhanced funnel plot)은 p<0.10, p<0.05, p<0.01 같은 유의확률 구역을 배경에 표시합니다. 비어 있는 부분이 주로 비유의 영역이라면 유의하지 않은 결과의 미출판이라는 설명과 잘 맞습니다. 빠진 것처럼 보이는 부분이 오히려 매우 유의한 영역이라면 이질성이나 다른 원인을 먼저 살펴야 합니다.
트림 앤 필(trim-and-fill)은 비대칭을 바탕으로 누락된 점을 추정해 채우고 조정된 요약 효과를 계산하는 방법입니다. 그러나 비대칭이 모두 출판 편향에서 왔다는 가정에 민감합니다. 이질성이나 설계 차이가 원인이라면 채워 넣은 연구는 실제 누락 연구를 나타내지 않습니다. 따라서 조정값은 확정된 정답이 아니라 가정에 따른 민감도 분석으로 해석해야 합니다.
선택 모형(selection model)은 효과의 크기, 방향과 p값에 따라 결과가 관찰될 확률이 달라진다고 가정합니다. 여러 선택 규칙을 적용했을 때 결론이 얼마나 바뀌는지 분석할 수 있지만 어떤 연구가 왜 사라졌는지 데이터만으로 완전히 알 수는 없습니다. 통계적 보정은 등록 자료와 연구계획서를 직접 확인하는 일을 대신하지 못합니다.
실제 자료에서 확인된 항우울제 임상시험 사례
에릭 터너와 동료들은 2008년 미국 식품의약국(FDA)이 검토한 항우울제 12종의 임상시험과 학술지 논문을 비교했습니다. FDA 자료에는 성인 환자 12,564명이 참여한 연구 74편이 포함됐습니다. 이 가운데 31%에 해당하는 연구가 출판되지 않았고, 미출판 연구의 참가자는 3,449명이었습니다.
FDA가 긍정적으로 판단한 연구 38편 가운데 37편은 출판됐습니다. 반면 부정적이거나 결과가 불확실하다고 판단된 연구들은 세 편을 제외하면 출판되지 않았거나, 논문에서 긍정적인 결론을 전달하는 방식으로 보고됐습니다. 출판된 문헌만 보면 시험의 94%가 긍정적으로 보였지만 FDA 자료 전체에서는 51%가 긍정적이었습니다.
학술지 자료에서 계산한 효과크기는 FDA의 전체 자료로 계산한 효과크기보다 개별 약물에서 11%부터 69% 높았고 전체적으로는 32% 높았습니다. 이 연구는 규제기관에 제출된 시험 목록이 있어 수행됐지만 논문에서 보이지 않는 연구를 확인할 수 있었던 사례입니다. 펀넬 플롯의 모양만 추정한 것이 아니라 알려진 연구 집합과 공개 문헌을 직접 대조했다는 점이 중요합니다.
출판 편향은 메타분석을 어떻게 왜곡하나요?
메타분석은 포함된 연구들의 효과를 결합합니다. 포함되지 않은 연구의 데이터는 아무리 정교한 가중치를 사용해도 자동으로 복원되지 않습니다. 누락이 결과와 무관한 무작위 과정이라면 주로 정밀도가 낮아지지만, 부정적이거나 비유의한 결과가 선택적으로 빠지면 요약 효과 자체가 한쪽으로 이동합니다.
무작위효과 모형을 사용한다고 출판 편향이 사라지지도 않습니다. 소규모 연구에서 더 큰 효과가 보이는 상황에서는 무작위효과 모형이 고정효과 모형보다 작은 연구에 상대적으로 더 많은 가중치를 줄 수 있습니다. 코크란은 소규모 연구 효과와 이질성이 있을 때 두 모형의 결과를 비교하고 차이가 생기는 원인을 검토하도록 안내합니다.
왜곡된 요약 효과는 치료의 이익을 과대평가하거나 위해를 과소평가할 수 있습니다. 후속 연구의 표본 수 계산도 부풀려진 효과에 의존하면 필요한 표본을 지나치게 작게 잡을 수 있습니다. 같은 가설을 반복해서 검증하는 연구자와 정책 결정자는 이용 가능한 문헌이 수행된 연구 전체인지 확인해야 합니다.
출판 편향을 확인하는 실무 순서
펀넬 플롯 하나만 보는 것보다 연구가 시작된 시점의 기록부터 추적하는 방법이 더 직접적입니다. 임상시험 등록부, 연구계획서, 윤리심의 기록과 규제기관 문서를 확인하면 논문으로 나오지 않은 연구와 빠진 결과를 찾을 수 있습니다.
- 체계적 문헌검색 전에 포함 기준과 분석 계획을 정합니다.
- 학술지뿐 아니라 임상시험 등록부, 학위논문, 학회 초록과 규제기관 자료를 검색합니다.
- 등록된 주요 결과와 논문에 보고된 결과를 비교합니다.
- 연구가 충분하면 효과크기와 표준오차로 펀넬 플롯을 그립니다.
- 연구 수와 효과 지표에 맞는 비대칭 검정을 선택합니다.
- 이질성, 설계 품질과 대상 집단 차이를 대안 설명으로 검토합니다.
- 선택 모형 등 여러 가정에서 민감도 분석을 수행합니다.
- 누락 증거의 위험과 분석 한계를 결론에 함께 보고합니다.
출판 편향을 줄이는 방법
임상시험 사전 등록은 연구가 시작되기 전에 연구 목적, 주요 결과와 분석 계획을 공개합니다. 국제의학학술지편집인위원회(ICMJE)는 첫 연구대상자의 동의를 받기 전이나 그 시점까지 공개 등록부에 임상시험을 등록할 것을 권고합니다. 등록 기록과 최종 논문을 비교하면 연구 전체의 미출판과 결과 변경을 찾기 쉬워집니다.
등록 보고서(Registered Reports)는 결과가 나오기 전에 연구 질문과 방법, 분석 계획을 심사합니다. 1단계 심사를 통과하면 정해진 계획과 품질 기준을 지키는 조건으로 결과의 방향과 관계없이 원칙적 게재 승인을 받습니다. 유의한 결과인지 확인한 뒤 출판 여부를 정하는 연결고리를 끊는 방식입니다.
모든 결과를 공개하는 결과 등록, 연구계획서와 분석 코드 공유, 영가설 기각 실패 결과를 포함하는 보고 정책도 누락을 줄입니다. 사전 등록만 하고 결과를 공개하지 않으면 문제는 남습니다. 등록 시점, 계획 변경 내역과 최종 결과가 서로 연결되어야 검증할 수 있습니다.
자주 묻는 질문
p<0.05인 논문은 믿을 수 없다는 뜻인가요?
아닙니다. p값은 가정한 통계 모형과 영가설 아래에서 관찰 결과 이상으로 극단적인 데이터가 나올 확률입니다. 개별 연구의 설계, 표본 크기, 효과크기와 신뢰구간을 함께 봐야 합니다. 출판 편향은 특정 논문 한 편의 진위를 판정하기보다 공개된 연구 집합이 전체를 대표하는지 묻는 문제입니다.
펀넬 플롯이 대칭이면 출판 편향이 없나요?
그렇게 결론 내릴 수 없습니다. 연구 수가 적으면 비대칭을 알아보기 어렵고 양쪽 방향의 연구가 함께 누락되면 대칭처럼 보일 수도 있습니다. 사전 등록부와 연구계획서를 함께 확인해야 합니다.
펀넬 플롯이 비대칭이면 출판 편향이 확정되나요?
아닙니다. 실제 효과의 이질성, 작은 연구의 설계 차이, 우연과 효과 지표의 수학적 특성도 비대칭을 만들 수 있습니다. 비대칭은 추가 조사가 필요한 신호로 해석해야 합니다.
연구가 10편보다 적으면 펀넬 플롯을 그릴 수 없나요?
그래프를 표시할 수는 있지만 점이 적어 모양을 안정적으로 판단하기 어렵습니다. 코크란의 10편 기준은 주로 비대칭 통계검정의 낮은 검정력에 관한 경험적 지침입니다. 적은 연구로 대칭이나 비대칭을 단정해서는 안 됩니다.
트림 앤 필로 보정한 결과가 진짜 효과인가요?
아닙니다. 이 방법은 관찰된 비대칭이 특정 누락 과정에서 생겼다고 가정해 가상의 연구를 채웁니다. 원인이 이질성이나 연구 설계 차이라면 보정값도 맞지 않을 수 있습니다. 여러 가정에서 결론이 얼마나 달라지는지 확인하는 민감도 분석으로 사용해야 합니다.
결론: 보이는 논문뿐 아니라 사라진 연구를 계산해야 합니다
출판 편향은 유의하고 긍정적인 결과가 더 쉽게 공개되어 이용 가능한 문헌이 수행된 연구 전체와 달라지는 선택 편향입니다. 서랍 효과는 유의하지 않은 연구가 보이지 않는 대표적인 형태입니다. p<0.05인 결과만 고르면 특히 표준오차가 큰 작은 연구에서 효과크기가 과장될 수 있습니다.
펀넬 플롯은 효과추정치와 표준오차의 관계를 그려 작은 연구의 비대칭을 살펴봅니다. 깔때기 경계는 θ̂±1.96SE로 계산할 수 있고 에거 검정은 표준화 효과를 정밀도에 회귀합니다. 그러나 어느 방법도 단독으로 출판 편향을 확진하거나 배제하지 못합니다.
가장 직접적인 접근은 연구가 시작될 때 남긴 등록 기록과 연구계획서를 최종 논문과 비교하는 것입니다. 메타분석에서는 미출판 자료를 찾고 이질성을 조사한 뒤 여러 선택 가정에서 민감도 분석을 해야 합니다. 공개된 논문의 숫자만 합치는 것이 아니라 어떤 연구와 결과가 보이지 않는지 확인해야 전체 증거를 올바르게 평가할 수 있습니다.
참고 자료
- Cochrane Handbook, Chapter 13: Assessing Risk of Bias Due to Missing Evidence in a Meta-analysis
- Robert Rosenthal, The File Drawer Problem and Tolerance for Null Results, 1979
- Matthias Egger et al., Bias in Meta-analysis Detected by a Simple, Graphical Test, BMJ, 1997
- Erick H. Turner et al., Selective Publication of Antidepressant Trials and Its Influence on Apparent Efficacy, NEJM, 2008
- ICMJE, Clinical Trial Registration Recommendations
- Center for Open Science, Registered Reports