모두의 계산기
← 블로그로 돌아가기

재미있는 확률

검사 역설(Inspection Paradox): 평균 배차 간격 10분인데 버스 대기시간이 길어지는 이유

평균 배차 간격이 10분인 버스의 평균 대기시간은 몇 분일까요? 검사 역설과 길이 편향, 잔여 대기시간 공식을 정확한 계산과 사례로 설명합니다.

평균 배차 간격이 10분인 버스 정류장에 아무 때나 도착했다면 얼마나 기다리게 될까요? 흔히 10분의 절반인 5분을 떠올립니다. 버스가 정확히 10분마다 온다면 이 답이 맞습니다. 하지만 실제 배차 간격이 들쭉날쭉하면 무작위로 도착한 승객은 짧은 간격보다 긴 간격에 들어갈 가능성이 큽니다. 이 표본 선택 효과 때문에 승객이 경험하는 평균 대기시간은 5분보다 길어집니다. 변동성이 충분히 크면 배차 간격의 평균인 10분보다도 길어질 수 있습니다.

이 현상의 정확한 이름은 검사 역설(Inspection Paradox)입니다. 대기시간 역설(waiting-time paradox), 버스 역설(bus paradox), 갱신 역설과 연결해서 설명하기도 합니다. 질문에 적힌 ‘스펙터클 역설’은 통계학에서 일반적으로 사용하는 명칭이 아닙니다. 또한 대기시간이 ‘항상 10분보다 길다’는 표현도 정확하지 않습니다. 개별 승객은 바로 오는 버스를 탈 수도 있고, 평균 대기시간도 배차 간격의 분산에 따라 5분, 10분 또는 10분 초과가 될 수 있습니다.

검사 역설이란 무엇인가요?

검사 역설은 어떤 시점을 무작위로 골라 그 시점이 포함된 시간 구간을 관찰하면, 짧은 구간보다 긴 구간이 더 자주 선택되는 현상입니다. 버스가 도착한 시각과 다음 버스가 도착한 시각 사이를 하나의 구간이라고 생각하면 이해하기 쉽습니다. 5분짜리 구간은 승객이 들어갈 수 있는 시간이 5분뿐이지만, 20분짜리 구간은 20분 동안 승객을 받아들입니다. 따라서 20분짜리 구간은 5분짜리 구간보다 무작위 도착 승객에게 선택될 기회가 네 배 많습니다.

운영자가 배차 기록을 계산할 때는 각 구간을 한 번씩 셉니다. 반면 승객은 시간을 표본으로 삼습니다. 구간별 표본과 시간별 표본은 같은 분포가 아닙니다. 긴 구간이 그 길이에 비례해 과대표집되는 현상을 길이 편향(length bias)이라고 합니다. 검사 역설은 이 길이 편향이 시간 구간에서 나타난 대표적인 사례입니다.

평균 배차 간격과 평균 대기시간은 다른 숫자입니다

배차 간격을 확률변수 X라고 하겠습니다. X의 평균을 μ, 분산을 σ²이라고 두면 운영자가 기록한 평균 배차 간격은 E[X] = μ입니다. 이 값이 10분이라는 사실만으로 승객의 평균 대기시간은 정해지지 않습니다. 대기시간을 계산하려면 배차 간격이 평균 주변에서 얼마나 흔들리는지, 즉 분산이나 두 번째 모멘트 E[X²]도 알아야 합니다.

  • 배차 간격 X: 연속한 두 버스가 도착한 시각의 차이
  • 관찰 구간 L: 승객이 정류장에 도착한 순간을 포함하는 배차 구간의 전체 길이
  • 경과시간 A: 직전 버스가 떠난 뒤 승객이 도착할 때까지 지난 시간
  • 잔여 대기시간 W: 승객이 도착한 뒤 다음 버스가 올 때까지 남은 시간

관찰 구간은 L = A + W입니다. 정상 상태에서 시간과 독립적으로 무작위 도착한 승객을 가정하면, 승객이 길이 x인 구간에 들어갈 확률은 그 구간의 발생 확률뿐 아니라 길이 x에도 비례합니다. 연속분포에서 원래 배차 간격의 밀도를 fX(x)라고 할 때 승객이 관찰하는 구간 길이의 밀도는 다음과 같습니다.

gL(x) = x fX(x) / E[X]

식 앞에 x가 곱해지는 이유가 바로 긴 구간에 들어갈 기회가 더 많기 때문입니다. 이 길이 편향 분포에서 관찰 구간의 평균은 다음과 같이 계산됩니다.

E[L] = E[X²] / E[X] = μ + σ² / μ

분산이 0보다 크면 승객이 경험하는 구간의 평균 E[L]은 운영자가 계산한 평균 구간 μ보다 큽니다. 이것이 검사 역설의 핵심입니다. 여기서 ‘역설’은 수학적 모순을 뜻하지 않습니다. 서로 다른 방식으로 표본을 뽑았는데 같은 평균일 것이라고 착각할 때 뜻밖의 결과가 나타난다는 의미입니다.

버스 평균 대기시간 공식은 어떻게 나오나요?

승객이 길이 L인 한 배차 구간 안에서 균등하게 도착한다고 하겠습니다. 구간 시작 직후 도착하면 거의 L분을 기다리고, 구간 끝 직전에 도착하면 거의 기다리지 않습니다. 그 구간 안에서 잔여 대기시간의 평균은 L/2입니다. 여기에 승객이 관찰하는 구간 길이의 평균을 적용하면 장기 평균 대기시간을 얻습니다.

E[W] = E[X²] / (2E[X]) = μ/2 + σ²/(2μ)

변동계수 CV = σ/μ를 사용하면 같은 공식을 E[W] = μ(1 + CV²)/2로 쓸 수 있습니다. 첫 항 μ/2는 일정한 간격일 때의 평균 대기시간이고, 두 번째 항 σ²/(2μ)는 배차 변동 때문에 더해지는 시간입니다. 평균 배차 간격이 같아도 분산이 커질수록 승객의 평균 대기시간이 길어지는 이유가 식에 그대로 나타납니다.

정상 상태의 갱신 과정에서는 평균 경과시간 E[A]와 평균 잔여 대기시간 E[W]가 같습니다. 따라서 승객이 들어선 구간의 평균 전체 길이는 두 값의 합인 E[L] = 2E[W]입니다. 다만 경과시간과 잔여시간이 매번 같다는 뜻은 아닙니다. 장기 평균이 같다는 뜻입니다.

평균 10분인 버스를 숫자로 비교해 보기

평균 배차 간격 μ를 모두 10분으로 고정해도 분산에 따라 평균 대기시간은 달라집니다. 다음 계산은 승객이 운행 과정과 독립적으로 무작위 시각에 도착한다는 조건을 사용합니다.

배차 모형평균 μ분산 σ²평균 대기시간 E[W]
항상 10분10분05분
5분 또는 15분, 각각 50%10분256.25분
2분 또는 18분, 각각 50%10분648.2분
지수분포10분10010분
1분(2/3) 또는 28분(1/3)10분16213.1분

첫 번째 경우에는 버스가 정확히 10분마다 옵니다. 승객의 도착 시각이 구간 안에서 균등하다면 0분부터 10분 사이를 기다리므로 평균은 5분입니다. 배차 간격의 평균 10분과 승객의 평균 대기시간 5분을 혼동해서는 안 됩니다.

두 번째 경우에는 배차 간격이 5분과 15분으로 번갈아 나타날 수 있습니다. 두 구간을 발생 횟수로 세면 각각 절반이지만, 시간의 25%는 5분 구간에 있고 75%는 15분 구간에 있습니다. 무작위 시각에 온 승객이 15분 구간에 걸릴 확률도 75%입니다. 공식에 μ = 10, σ² = 25를 넣으면 E[W] = 5 + 25/20 = 6.25분입니다.

마지막 경우에는 배차 간격이 1분일 확률이 2/3, 28분일 확률이 1/3입니다. 발생 횟수만 보면 짧은 간격이 더 흔하지만 평균은 (2/3)×1 + (1/3)×28 = 10분입니다. 전체 시간 가운데 28분 구간이 차지하는 비율은 ((1/3)×28)/10 = 93.33%입니다. 승객 대부분이 드문 28분 구간에 들어가는 이유입니다. E[X²] = (2/3)×1² + (1/3)×28² = 262이므로 평균 대기시간은 262/(2×10) = 13.1분입니다.

언제 평균 대기시간이 10분을 넘나요?

평균 배차 간격이 μ = 10분일 때 E[W] = 5 + σ²/20입니다. 이 값이 10분보다 크려면 σ²/20 > 5여야 하므로 σ² > 100이어야 합니다. 표준편차 σ가 10분보다 크거나, 변동계수 CV가 1보다 클 때 평균 대기시간이 10분을 넘습니다. 분산이 정확히 100이면 평균 대기시간은 10분이고, 분산이 100보다 작으면 5분보다는 크지만 10분보다는 작습니다.

μ = 10일 때: σ² < 100이면 E[W] < 10, σ² = 100이면 E[W] = 10, σ² > 100이면 E[W] > 10

따라서 ‘평균 배차 간격이 10분이면 체감 대기시간이 항상 10분보다 길다’고 말할 수 없습니다. 정확한 설명은 ‘배차 간격에 변동이 있으면 무작위 승객의 평균 대기시간은 단순한 절반인 5분보다 길고, 변동계수가 1보다 크면 10분도 넘는다’입니다. 여기서 체감이라는 말은 심리적으로 더 길게 느낀다는 뜻이 아니라, 승객 표본에서 실제로 계산한 장기 평균이 달라진다는 뜻으로 사용해야 합니다.

포아송 버스에서는 왜 평균 10분을 기다리나요?

버스 도착이 시간당 일정한 비율의 포아송 과정이라고 가정하면 배차 간격 X는 지수분포를 따릅니다. 평균이 10분인 지수분포의 분산은 100분²입니다. 대기시간 공식에 넣으면 E[W] = 5 + 100/20 = 10분입니다. 이 모형에서는 승객이 이미 얼마나 기다렸든 앞으로 남은 시간의 분포가 처음과 같습니다. 지수분포의 무기억성(memoryless property) 때문입니다.

포아송 모형에서 무작위 승객이 들어선 전체 구간의 평균은 20분입니다. 직전 버스 이후의 평균 경과시간이 10분이고 다음 버스까지의 평균 잔여시간도 10분이기 때문입니다. 운영자가 버스 도착부터 다음 도착까지 구간을 하나씩 세면 평균은 10분이지만, 승객이 서 있는 시점이 포함된 구간은 평균 20분입니다. 같은 사건을 서로 다른 표본 방식으로 관찰한 결과입니다.

실제 버스가 반드시 포아송 과정이라는 뜻은 아닙니다. 시간표, 신호, 승하차 인원, 도로 혼잡과 앞차와의 간격이 다음 운행에 영향을 줄 수 있어 배차 간격이 서로 독립적이지 않을 수 있습니다. 포아송 과정은 무기억성과 검사 역설을 분명하게 보여 주는 기준 모형입니다.

버스 몰림은 대기시간을 어떻게 늘리나요?

평균 배차 간격만 유지한다고 승객 서비스가 같아지는 것은 아닙니다. 버스 두 대가 짧은 간격으로 연달아 온 뒤 긴 공백이 생기면 짧은 구간과 긴 구간의 평균은 그대로일 수 있지만 분산은 커집니다. 무작위로 도착한 승객은 연달아 오는 두 버스 사이의 짧은 구간보다 이후의 긴 공백에 들어갈 가능성이 훨씬 큽니다.

검사 역설이 버스 몰림의 원인은 아닙니다. 버스 몰림은 교통 상황, 정류장 체류시간과 차량 간 상호작용 등 운행 과정에서 생길 수 있습니다. 검사 역설은 그렇게 커진 배차 간격의 변동이 승객 표본에서 왜 더 크게 드러나는지, 그리고 평균 대기시간을 왜 늘리는지를 설명합니다. 평균 배차 간격과 함께 배차 간격의 분산이나 변동계수를 관리해야 하는 수학적 이유도 여기에 있습니다.

공식이 성립하려면 어떤 조건이 필요한가요?

E[W] = E[X²]/(2E[X])은 갱신 이론의 정상 상태 결과입니다. 모든 버스 노선과 모든 승객에게 조건 없이 적용되는 경험 법칙은 아닙니다. 기본 계산에는 다음과 같은 가정이 들어갑니다.

  • 배차 간격은 양수이고 같은 분포를 따르는 독립 확률변수입니다.
  • 관찰은 충분히 오래 운행한 정상 상태에서 이루어집니다.
  • 승객의 도착 시각은 버스 운행 과정과 독립적이며 시간축에서 무작위입니다.
  • 평균 E[X]와 두 번째 모멘트 E[X²]가 유한합니다.
  • 승객은 정류장에 도착한 뒤 다음 버스를 기다립니다. 시간표를 보고 도착 시각을 조절하지 않습니다.

출근 시간과 한산한 시간의 운행 빈도가 다르면 하나의 정상 분포로 묶기 어렵습니다. 승객도 시간표나 실시간 도착 정보를 보고 정류장에 맞춰 온다면 도착 시각이 버스와 독립적이지 않습니다. 이런 경우에는 시간대별 배차 분포와 승객의 도착 전략을 함께 모형화해야 하며, 위 공식을 그대로 적용할 수 없습니다.

배차 간격의 평균은 유한하지만 E[X²]가 무한한 매우 두꺼운 꼬리 분포라면 이론적 평균 잔여 대기시간은 무한대가 될 수도 있습니다. 긴 구간은 드물어도 시간 점유율과 제곱항에 매우 큰 영향을 줍니다. 이는 평균 하나만으로 대기 경험을 설명할 수 없다는 사실을 극단적으로 보여 줍니다.

검사 역설은 버스 밖에서도 나타납니다

무작위 시점에 진행 중인 일을 관찰하는 상황에는 같은 길이 편향이 나타납니다. 짧게 끝나는 작업보다 오래 걸리는 작업이 관찰 시점에 진행 중일 가능성이 큽니다. 그래서 현재 처리 중인 작업의 전체 소요시간은 작업 완료 기록을 한 건씩 뽑아 계산한 평균보다 길어질 수 있습니다.

재직 기간도 같은 방식으로 설명할 수 있습니다. 어느 날 무작위로 만난 재직자는 짧게 근무하고 퇴사한 사람보다 장기 재직자일 가능성이 큽니다. 의료 연구에서 특정 시점에 존재하는 환자 사례를 모으면 질병 지속 기간이 긴 사례가 더 쉽게 포함되는 유병 사례 표본의 길이 편향도 관련된 원리입니다. 각 사례에서는 무엇을 한 건으로 세었는지와 무엇을 한 시점에서 관찰했는지를 구분해야 합니다.

친선의 역설도 큰 값이 더 자주 관찰되는 크기 편향이라는 점에서 닮았습니다. 친구가 많은 사람은 더 많은 우정 관계의 끝점에 나타나므로 ‘친구를 통해 만난 사람’ 표본에 자주 들어갑니다. 다만 친선의 역설은 네트워크의 차수에 관한 결과이고, 검사 역설은 주로 시간 구간과 갱신 과정에 관한 결과이므로 동일한 확률 모형은 아닙니다.

버스 데이터를 볼 때 확인할 항목

버스 대기시간을 평가할 때 ‘평균 10분 간격’만 제시하면 승객 경험을 충분히 설명할 수 없습니다. 같은 평균이라도 10분 간격이 안정적으로 유지되는 노선과 1분 간격 뒤 19분 공백이 생기는 노선은 대기시간 분포가 다릅니다. 다음 항목을 함께 확인해야 합니다.

  • 배차 간격의 산술평균과 중앙값
  • 배차 간격의 분산, 표준편차와 변동계수
  • 긴 공백이 나타나는 빈도와 상위 분위수
  • 승객 수로 가중한 평균 대기시간
  • 시간대와 정류장별 배차 분포
  • 시간표 이용 승객과 무작위 도착 승객의 비율
  • 버스 몰림과 결행 여부

승객이 많이 오는 시간대에 긴 공백이 집중된다면 단순 시간평균보다 승객 가중 평균 대기시간이 더 커질 수 있습니다. 반대로 승객이 정확한 시간표에 맞춰 도착한다면 무작위 도착 모형보다 짧아질 수 있습니다. 어떤 평균을 보고하는지 명시해야 서로 다른 지표를 잘못 비교하지 않습니다.

자주 묻는 질문

평균 배차 간격이 10분이면 평균 5분만 기다리는 것 아닌가요?

버스가 정확히 10분마다 오고 승객이 무작위로 도착한다면 평균은 5분입니다. 배차 간격에 변동이 있으면 긴 구간이 더 자주 관찰되므로 평균은 5분보다 길어집니다. 정확한 값은 배차 간격의 분산까지 알아야 계산할 수 있습니다.

평균 대기시간은 언제 10분보다 길어지나요?

평균 배차 간격이 10분인 정상 갱신 모형에서는 배차 간격의 분산이 100분²보다 클 때입니다. 같은 말로 표준편차가 10분보다 크거나 변동계수가 1보다 클 때 평균 대기시간이 10분을 넘습니다.

이미 10분을 기다렸다면 버스가 곧 올 확률이 높아지나요?

배차 간격의 분포에 따라 다릅니다. 지수분포에서는 무기억성 때문에 이미 10분을 기다렸어도 앞으로 남은 평균 대기시간은 여전히 10분입니다. 정확한 시간표에 가까운 운행에서는 예정 시각이 가까워질수록 잔여시간이 줄어듭니다. 평균값만으로는 조건부 대기시간을 정할 수 없습니다.

시간표 앱을 보고 출발해도 같은 공식이 적용되나요?

그대로 적용되지 않습니다. 앱을 본 승객은 버스 운행과 독립적인 무작위 시각에 도착하지 않습니다. 예측 정보의 오차와 승객이 정류장까지 이동하는 시간까지 포함해 별도의 조건부 대기시간을 계산해야 합니다.

검사 역설은 단지 심리적인 착각인가요?

아닙니다. 긴 구간이 길이에 비례해 더 자주 표본에 포함되는 수학적 표본 편향입니다. 기다리는 시간이 심리적으로 길게 느껴지는 현상과 별개로, 일정한 가정 아래 실제 관측 평균이 달라집니다.

버스가 몰려오면 평균 배차 간격도 늘어나나요?

반드시 그렇지는 않습니다. 전체 운행 횟수가 같으면 장기 평균 배차 간격은 유지되면서 짧은 간격과 긴 공백이 함께 늘어 분산만 커질 수 있습니다. 검사 역설 공식에서는 평균이 그대로여도 분산이 커지면 평균 대기시간이 늘어납니다.

결론: 평균 10분보다 배차 간격의 분산을 함께 봐야 합니다

검사 역설은 무작위 승객이 짧은 배차 구간보다 긴 배차 구간에 들어갈 가능성이 더 크다는 길이 편향에서 시작합니다. 운영자가 구간을 하나씩 세어 얻은 평균 E[X]와 승객이 시간축에서 마주치는 구간의 평균 E[X²]/E[X]은 서로 다릅니다. 승객의 평균 잔여 대기시간은 E[X²]/(2E[X])입니다.

평균 배차 간격이 10분이라고 해서 대기시간이 언제나 10분보다 길지는 않습니다. 간격이 정확히 10분이면 평균 대기는 5분이고, 지수분포라면 10분입니다. 분산이 100분²보다 큰 경우에만 위 모형의 평균 대기시간이 10분을 넘습니다. 따라서 대기시간을 정확히 설명하려면 평균과 함께 분산, 승객 도착 방식과 시간대별 운행 조건을 확인해야 합니다.

이 결과는 평균이라는 숫자가 틀렸다는 뜻이 아닙니다. 배차 구간을 기준으로 낸 평균과 무작위 시점의 승객을 기준으로 낸 평균이 서로 다른 질문에 답한다는 뜻입니다. 무엇을 표본으로 삼았는지 확인하면 평균 10분인 노선에서 승객의 대기 경험이 더 길어지는 이유를 정확하게 계산할 수 있습니다.

참고 자료