모두의 계산기
← 블로그로 돌아가기

재미있는 통계

벤포드의 법칙(Benford's Law): 회계 장부와 인구수에서 첫째 자리 1이 약 30.1% 나오는 원리

실제 데이터의 첫째 숫자는 왜 1이 가장 많을까요? 벤포드의 법칙 공식과 로그 원리, 세계은행 인구 데이터 분석, 회계 감사 활용 조건과 한계를 설명합니다.

1부터 9까지 아홉 개의 숫자가 데이터의 첫째 자리에 나올 가능성은 모두 1/9일까요? 모든 숫자가 똑같이 등장한다면 각각 약 11.1%여야 합니다. 하지만 인구수, 기업 매출, 거래 금액, 강의 길이처럼 자연스럽게 만들어지고 크기의 범위가 넓은 여러 데이터에서는 첫째 유효숫자가 1인 값이 훨씬 자주 나타납니다.

벤포드의 법칙에 따르면 첫째 자리 숫자가 1일 확률은 약 30.1%입니다. 2는 약 17.6%, 3은 약 12.5%이며 숫자가 커질수록 확률은 계속 낮아집니다. 첫째 자리가 9일 확률은 약 4.6%입니다.

이 법칙은 모든 숫자 목록에 자동으로 적용되는 규칙이 아닙니다. 전화번호나 계좌번호처럼 식별을 위해 부여한 번호, 값의 범위가 좁은 데이터, 최소·최대 기준으로 잘린 자료에는 맞지 않을 수 있습니다. 회계 장부가 벤포드 분포에서 벗어났다고 해서 조작이 입증되는 것도 아닙니다. 적용 조건을 먼저 확인한 뒤 이상 징후를 찾는 선별 도구로 사용해야 합니다.

벤포드의 법칙이란 무엇인가요?

벤포드의 법칙은 여러 실제 수치 자료에서 첫째 유효숫자가 균등하게 나타나지 않고 로그 분포를 따르는 현상입니다. ‘첫째 자리 법칙’, ‘첫째 유효숫자 법칙’, ‘뉴컴-벤포드 법칙’ 또는 ‘이상 숫자 법칙’이라고도 부릅니다.

여기서 첫째 유효숫자는 0이 아닌 가장 왼쪽 숫자입니다. 1,250의 첫째 유효숫자는 1이고, 0.0047의 첫째 유효숫자는 4입니다. 음수라면 부호를 제외하고 봅니다. 첫째 유효숫자에는 0이 올 수 없으므로 1부터 9까지만 계산합니다.

첫째 자리 숫자가 d일 확률은 다음 공식으로 구합니다.

P(d) = log10(1 + 1/d), d는 1부터 9까지

d에 1을 넣으면 log10(2)가 되고 값은 약 0.30103입니다. 백분율로 바꾸면 약 30.103%입니다. d에 9를 넣으면 log10(10/9)이며 약 4.576%입니다.

첫째 숫자별 벤포드 확률

공식에 1부터 9까지 차례로 대입하면 다음 분포를 얻습니다.

  • 숫자 1: 약 30.103%
  • 숫자 2: 약 17.609%
  • 숫자 3: 약 12.494%
  • 숫자 4: 약 9.691%
  • 숫자 5: 약 7.918%
  • 숫자 6: 약 6.695%
  • 숫자 7: 약 5.799%
  • 숫자 8: 약 5.115%
  • 숫자 9: 약 4.576%

아홉 확률을 모두 더하면 100%가 됩니다. 첫째 자리가 1일 확률은 9일 확률보다 약 6.58배 높습니다. 따라서 벤포드 법칙이 적용되는 자료에서 첫째 숫자가 고르게 나오지 않는 것은 이상 현상이 아니라 예상되는 패턴입니다.

왜 숫자 1이 약 30.1%나 나올까요?

핵심은 일반적인 숫자 간격이 아니라 로그 간격을 보는 데 있습니다. 양수를 과학적 표기법처럼 10의 거듭제곱과 1 이상 10 미만인 유효숫자 부분으로 나눠 보겠습니다.

첫째 자리가 1인 수의 유효숫자 부분은 1 이상 2 미만입니다. 1.2, 1.95, 18, 150, 0.0017은 자릿수 크기는 달라도 모두 이 구간에 해당합니다. 상용로그를 취하면 이 구간은 log10(1)부터 log10(2)까지입니다. 길이는 log10(2) - log10(1) = log10(2), 약 0.30103입니다.

첫째 자리가 2인 수는 유효숫자 부분이 2 이상 3 미만입니다. 로그 구간의 길이는 log10(3) - log10(2)이며, 로그의 성질에 따라 log10(3/2)입니다. 값은 약 0.17609입니다.

첫째 자리가 9인 수는 9 이상 10 미만이므로 로그 구간의 길이는 log10(10) - log10(9) = log10(10/9), 약 0.04576입니다. 로그값의 소수 부분이 0부터 1까지 고르게 퍼진 자료라면 각 첫째 숫자의 확률은 해당 로그 구간의 길이와 같아집니다.

그래서 첫째 자리 확률 공식이 log10(1 + 1/d)로 정리됩니다. log10(d + 1) - log10(d)는 log10((d + 1)/d)이고, 이는 log10(1 + 1/d)와 같습니다.

1에서 2로 가는 구간과 9에서 10으로 가는 구간

비율의 관점에서도 차이를 볼 수 있습니다. 1에서 2가 되려면 값이 100% 증가해야 합니다. 2에서 3은 50%, 3에서 4는 약 33.3% 증가해야 합니다. 반면 9에서 10으로 넘어가는 데 필요한 증가는 약 11.1%입니다.

일정한 비율로 성장하는 이상적인 과정을 같은 시간 간격으로 관찰하면 값은 1로 시작하는 범위를 지나는 데 상대적으로 더 긴 구간을 사용하고, 9로 시작하는 범위는 더 빨리 통과합니다. 10을 넘으면 첫째 자리는 다시 1로 돌아갑니다. 100, 1,000, 10,000을 지날 때도 같은 구조가 반복됩니다.

이 설명은 일정한 비율로 성장하는 자료에서 벤포드 패턴이 생기는 방식을 보여 주는 예입니다. 모든 실제 데이터가 성장 과정 하나만으로 벤포드 법칙을 따르는 것은 아닙니다. 여러 크기 범위에 걸친 분포의 혼합, 곱셈으로 만들어지는 과정, 로그 척도에서 넓게 퍼진 자료 등 다양한 조건에서 벤포드와 가까운 분포가 나타날 수 있습니다.

단위를 바꿔도 분포가 유지되는 이유

벤포드 법칙의 중요한 성질 가운데 하나는 척도 불변성입니다. 길이를 미터에서 피트로 바꾸거나 금액을 원에서 달러로 환산하면 모든 값에 일정한 양수를 곱합니다. 벤포드 분포를 정확히 따르는 데이터는 이런 단위 변환 뒤에도 같은 첫째 자리 분포를 유지합니다.

로그로 보면 모든 값에 일정한 수를 곱하는 것은 각 로그값에 같은 상수를 더하는 일입니다. 로그값의 소수 부분이 0부터 1 사이에 고르게 퍼져 있다면 같은 상수를 더하고 1을 넘어간 부분을 다시 처음으로 돌려도 균등한 분포는 유지됩니다.

이 성질 때문에 데이터의 단위에 따라 첫째 자리 법칙이 달라지는 문제를 피할 수 있습니다. 원 단위에서만 맞고 달러 단위로 바꾸면 사라지는 규칙이라면 자연 자료의 일반적인 숫자 법칙으로 사용하기 어렵습니다.

세계은행 인구 데이터로 직접 확인한 결과

인구수는 벤포드의 법칙을 설명할 때 자주 쓰이는 자료입니다. 국가마다 인구 규모가 수십만 명 이하부터 10억 명 이상까지 여러 자릿수 범위에 걸쳐 있기 때문입니다.

이 글에서는 세계은행 Indicators API의 ‘Population, total’ 지표인 SP.POP.TOTL을 조회했습니다. 2026년 9월 22일 조회 시 API가 제공한 국가·경제권의 최신 비결측값은 모두 2025년 자료였습니다. ‘세계’, 소득 그룹, 지역 합계 같은 집계 항목을 제외하고 217개 국가·경제권을 분석했습니다.

첫째 유효숫자를 집계한 결과는 다음과 같습니다.

  • 숫자 1: 67개, 약 30.876% · 벤포드 기대값 30.103%
  • 숫자 2: 35개, 약 16.129% · 기대값 17.609%
  • 숫자 3: 28개, 약 12.903% · 기대값 12.494%
  • 숫자 4: 19개, 약 8.756% · 기대값 9.691%
  • 숫자 5: 24개, 약 11.060% · 기대값 7.918%
  • 숫자 6: 15개, 약 6.912% · 기대값 6.695%
  • 숫자 7: 11개, 약 5.069% · 기대값 5.799%
  • 숫자 8: 9개, 약 4.147% · 기대값 5.115%
  • 숫자 9: 9개, 약 4.147% · 기대값 4.576%

첫째 자리가 1인 비율은 약 30.876%로 벤포드 기대값 30.103%와 약 0.773%포인트 차이가 났습니다. 각 숫자의 관측 빈도와 벤포드 기대 빈도를 카이제곱 적합도 검정으로 비교하면 통계량은 약 3.942, 자유도는 8, p값은 약 0.862였습니다. 이 표본에서는 벤포드 분포와 다르다고 판단할 통계적 근거가 나타나지 않았습니다.

이 결과가 모든 해와 모든 인구 데이터에서 같은 비율을 보장하는 것은 아닙니다. 217개라는 유한한 표본에서는 기대값과 관측값 사이에 차이가 생길 수 있습니다. 데이터 제공 범위, 국가 분류와 기준 연도가 달라져도 집계 결과가 바뀔 수 있습니다. 분석 절차와 조회 시점을 함께 적은 이유입니다.

벤포드의 법칙은 어떻게 발견되었나요?

미국의 천문학자이자 수학자인 사이먼 뉴컴은 1881년 American Journal of Mathematics에 ‘Note on the Frequency of Use of the Different Digits in Natural Numbers’를 발표했습니다. 뉴컴은 로그표에서 작은 숫자로 시작하는 앞부분의 페이지가 큰 숫자로 시작하는 뒷부분보다 더 많이 닳아 있다는 점을 언급하고, 로그의 가수 부분이 균등하게 나타난다는 형태로 첫째 숫자 확률을 제시했습니다.

물리학자 프랭크 벤포드는 1938년 Proceedings of the American Philosophical Society에 ‘The Law of Anomalous Numbers’를 발표했습니다. 벤포드는 강의 면적, 인구수, 물리 상수 등 서로 다른 분야의 자료를 모아 첫째 숫자 분포를 조사했습니다. 그의 논문은 20개 자료군, 총 20,229개 관측값을 분석한 것으로 알려져 있습니다.

현재는 벤포드의 이름을 따라 널리 불리지만 뉴컴이 앞서 같은 현상을 논의했기 때문에 뉴컴-벤포드 법칙이라고도 합니다. 미국 국립표준기술연구소의 알고리즘·자료구조 사전도 일반적인 유효숫자 확률을 log10(1 + 1/n)으로 설명하고 뉴컴의 1881년 연구와 벤포드의 1938년 연구를 함께 소개합니다.

어떤 데이터가 벤포드 법칙에 가까워질까요?

모든 조건을 만족해야 하는 단일 체크리스트가 있는 것은 아니지만, 다음 특성을 가진 자료는 벤포드 분포와 가까워질 가능성이 있습니다.

  • 값이 수십, 수백, 수천처럼 여러 자릿수 규모에 걸쳐 있습니다.
  • 숫자가 식별번호가 아니라 실제 크기나 양을 측정합니다.
  • 값에 인위적인 최소값이나 최대값이 강하게 적용되지 않습니다.
  • 덧셈보다 비율 변화나 곱셈 과정의 영향을 많이 받습니다.
  • 서로 다른 분포와 크기 범위에서 나온 값들이 섞여 있습니다.
  • 표본이 첫째 자리 빈도를 비교할 수 있을 만큼 충분합니다.

기업의 다양한 거래 금액, 여러 지역의 인구, 하천 길이, 시장 가치처럼 값의 범위가 넓은 자료가 대표적인 후보입니다. 그러나 같은 이름의 데이터라도 수집 방식과 범위에 따라 적합성이 달라질 수 있습니다. 모든 회계 자료나 모든 인구 자료가 반드시 벤포드 분포를 따라야 하는 것은 아닙니다.

벤포드 법칙을 적용하면 안 되는 데이터

다음과 같은 자료는 벤포드 법칙과 비교할 근거가 약하거나 구조적으로 맞지 않을 수 있습니다.

  • 전화번호, 주민등록번호, 우편번호, 계좌번호처럼 대상을 구별하기 위한 번호
  • 복권 번호나 균등한 난수처럼 각 숫자가 같은 확률로 생성되도록 설계된 값
  • 키, 시험 점수, 특정 제품 가격처럼 범위가 좁은 자료
  • 100만 원 미만 결제처럼 상한이나 하한으로 잘린 자료
  • 9,900원처럼 사람이 정한 가격 규칙이 강하게 반영된 자료
  • 같은 정액 요금이나 반복 거래가 많이 포함된 장부
  • 표본 수가 너무 작아 우연한 변동이 큰 자료

예를 들어 모든 값이 100에서 199 사이면 첫째 숫자는 무조건 1입니다. 첫째 자리 1이 100%라고 해서 조작을 뜻하지 않습니다. 자료의 범위가 그렇게 정해졌기 때문입니다. 직원 번호에 1이 적다고 해서 직원 수량이 1로 시작한다는 의미도 없습니다. 식별자는 측정값이 아니므로 벤포드 공식의 대상이 아닙니다.

회계 감사에서는 어떻게 활용할까요?

회계 자료에서 벤포드 분석은 거래 금액의 첫째 자리 또는 첫 두 자리 분포를 기대값과 비교해 추가 검토가 필요한 영역을 찾는 데 사용될 수 있습니다. 사람이 임의로 만든 금액, 특정 승인 한도 바로 아래에 몰린 금액, 반복되는 거래 등은 예상 분포와 차이를 만들 수 있습니다.

분석 절차는 보통 적용 가능한 거래 집단을 정하고, 취소·중복·고정금액처럼 구조적으로 다른 항목을 확인한 뒤, 첫째 자리나 첫 두 자리의 관측 빈도를 벤포드 기대 빈도와 비교하는 방식으로 진행됩니다. 카이제곱 통계량, 평균절대편차 같은 지표를 사용할 수 있지만 표본 크기와 자료의 생성 구조를 함께 봐야 합니다.

표본이 매우 크면 실무적으로 작은 차이도 통계 검정에서 유의하게 나타날 수 있습니다. 반대로 조작된 거래가 전체 자료에서 차지하는 비율이 작으면 집계 분포 속에 묻힐 수 있습니다. 분석 단위를 회사 전체, 지점, 거래 유형, 담당자 등으로 어떻게 나누는지도 결과에 영향을 줍니다.

미국 공인부정조사관협회는 벤포드 분석을 잠재적인 부정 활동을 검사하는 추가 방법으로 설명하면서도 완전무결한 검사가 아니라고 밝힙니다. 숫자 분포를 세는 것만으로 부정의 존재나 부재를 확정할 수 없으며, 이상이 나타나면 원거래 증빙과 업무 절차를 추가로 조사해야 합니다.

벤포드 분포에서 벗어나면 조작일까요?

아닙니다. 벤포드 분포와의 차이는 자료를 더 살펴볼 이유가 될 수 있지만 조작의 증거 자체는 아닙니다. 정상적인 사업 구조에서도 정액 계약, 세율, 가격 정책, 승인 한도, 계절성, 중복 회계 처리 때문에 특정 숫자가 많이 나타날 수 있습니다.

캐나다 국경서비스청의 조달 감사에서는 회계 자료의 첫째 숫자에 비정상적인 차이가 처음 발견됐지만 추가 분석 결과 반복적인 번역·통역 서비스와 일부 계정의 중복 빈도 등이 원인으로 확인됐습니다. 해당 벤포드 분석에서는 잠재적 부정 지표나 비정상 거래가 확인되지 않았습니다.

반대 방향도 마찬가지입니다. 자료가 벤포드 분포에 잘 맞는다고 해서 모든 거래가 정상이라는 뜻은 아닙니다. 누락, 허위 거래, 관련 당사자 거래처럼 첫째 숫자 분포를 크게 바꾸지 않는 문제도 존재할 수 있습니다. 벤포드 검사는 증빙 확인, 내부통제 검토, 거래 관계 분석과 함께 사용하는 선별 절차입니다.

첫째 자리 외에도 검사할 수 있나요?

벤포드 법칙은 첫째 자리뿐 아니라 첫 두 자리, 둘째 자리와 이후 유효숫자의 확률도 계산할 수 있습니다. 미국 국립표준기술연구소는 첫째 유효숫자 묶음이 n일 확률을 log10(1 + 1/n)으로 제시합니다. n이 12라면 첫 두 자리가 12일 확률은 log10(13/12)입니다.

뒤 자리로 갈수록 개별 숫자의 확률 차이는 작아집니다. 뉴컴의 1881년 논문도 둘째 자리 분포를 제시했으며 셋째 자리 이후에는 숫자별 차이가 더 작아진다고 설명했습니다. 실무에서는 첫째 자리 검사만으로 결론을 내리지 않고 첫 두 자리, 중복 금액, 반올림 금액, 임계값 주변 거래 등 여러 검사를 함께 사용할 수 있습니다.

자주 묻는 질문

첫째 자리 1이 정확히 30.1%여야 하나요?

아닙니다. 30.103%는 벤포드 모형의 기대 확률입니다. 유한한 표본의 관측 비율은 이 값과 정확히 같지 않습니다. 표본 수, 값의 범위와 생성 과정에 따라 차이가 날 수 있으므로 적합도와 적용 조건을 함께 확인해야 합니다.

숫자 0은 왜 첫째 자리 표에 없나요?

첫째 유효숫자는 0이 아닌 첫 숫자를 뜻합니다. 0.0062의 첫째 유효숫자는 6입니다. 앞에 붙은 0은 소수점의 위치를 나타낼 뿐 유효숫자로 세지 않습니다.

모든 회계 장부가 벤포드 법칙을 따르나요?

아닙니다. 거래 금액이 여러 규모에 걸쳐 자연스럽게 발생한 자료는 적합할 수 있지만, 고정 수수료, 제한된 가격표, 최소·최대 금액, 반복 거래가 많은 장부는 분포가 달라질 수 있습니다. 분석 전에 업무 규칙과 데이터 범위를 확인해야 합니다.

벤포드 법칙만으로 탈세나 회계 부정을 적발할 수 있나요?

확정할 수 없습니다. 벤포드 검사는 기대 분포와 다른 영역을 찾아 추가 검토 대상을 좁히는 방법입니다. 부정 여부를 판단하려면 계약서, 세금계산서, 승인 기록, 거래 상대방과 자금 흐름 같은 별도의 증거가 필요합니다.

표본은 많을수록 무조건 좋은가요?

충분한 표본은 빈도 추정의 우연 변동을 줄이지만 규모만으로 적합성이 보장되지는 않습니다. 적용 대상이 아닌 데이터를 수백만 건 모아도 올바른 벤포드 검사가 되지 않습니다. 반대로 서로 다른 성격의 거래를 지나치게 크게 합치면 작은 집단에서 발생한 이상이 전체 분포에 묻힐 수 있습니다.

결론: 30.1%는 로그 간격에서 나옵니다

벤포드의 법칙에서 첫째 자리 1의 확률이 약 30.1%인 이유는 1부터 2까지의 로그 구간이 전체 한 자릿수 로그 구간의 약 30.1%를 차지하기 때문입니다. 일반식 P(d) = log10(1 + 1/d)에 따라 첫째 숫자가 커질수록 확률은 낮아지고, 9는 약 4.6%가 됩니다.

세계은행의 2025년 국가·경제권 인구 자료 217개를 직접 확인한 결과 첫째 자리 1은 67개, 약 30.876%였습니다. 이는 벤포드 기대값 30.103%와 가까웠습니다. 다만 한 데이터의 일치는 법칙이 모든 자료에 적용된다는 뜻이 아니며, 조회 범위와 분석 조건을 함께 밝혀야 합니다.

회계 감사에서 벤포드 법칙은 유용한 이상 탐지 도구가 될 수 있지만 부정을 판정하는 공식은 아닙니다. 숫자가 어떤 과정으로 만들어졌는지, 값의 범위가 얼마나 넓은지, 식별번호나 고정값이 섞였는지부터 확인해야 합니다. 기대 분포와의 차이는 조사의 출발점이며 최종 결론은 원자료와 증빙을 통해 내려야 합니다.

참고 자료