모두의 계산기
← 블로그로 돌아가기

재미있는 통계

친선의 역설(Friendship Paradox): 통계적으로 "내 친구들은 나보다 친구가 더 많다"가 참이 되는 그래프 이론

왜 내 친구들은 나보다 친구가 더 많아 보일까요? 친선의 역설을 그래프 이론, 표본 선택 편향, 평균과 분산 공식으로 정확하게 계산합니다.

친구들의 소식을 보다 보면 “다른 사람들은 나보다 아는 사람이 훨씬 많은 것 같다”는 느낌이 들 수 있습니다. 단순한 기분으로만 치부할 일은 아닙니다. 친구 관계를 네트워크로 나타내고 평균을 계산하면, 한 사람의 친구들은 그 사람을 포함한 일반 구성원보다 평균적으로 친구가 더 많은 경향이 실제로 나타납니다. 이를 친선의 역설 또는 친구 관계의 역설(Friendship Paradox)이라고 합니다.

이름에는 ‘역설’이 붙지만 논리적 모순은 없습니다. 사람을 똑같은 확률로 한 명 뽑는 방법과 친구 관계를 따라가 한 명을 만나는 방법이 서로 다른 표본을 만들기 때문에 생기는 결과입니다. 친구가 많은 사람은 여러 사람의 친구 목록에 반복해서 등장합니다. 반대로 친구가 한 명뿐인 사람은 친구 목록에도 한 번만 등장합니다. 그 결과 친구 목록에서 관찰되는 사람들은 전체 인구에서 무작위로 뽑은 사람보다 연결 수가 많은 쪽으로 치우칩니다.

이 현상은 사회학자 스콧 L. 펠드(Scott L. Feld)가 1991년 《American Journal of Sociology》에 발표한 논문 「Why Your Friends Have More Friends Than You Do」에서 수학적으로 설명했습니다. 핵심은 인기도에 관한 심리적 추측이 아니라, 네트워크의 연결선을 통해 표본을 얻을 때 발생하는 크기 편향 표집(size-biased sampling)입니다.

친선의 역설이란 무엇인가요?

친구 관계를 그래프로 바꾸면 사람은 정점(vertex), 두 사람의 친구 관계는 간선(edge)이 됩니다. 서로를 친구로 인정하는 관계라고 가정하면 선에 방향이 없는 무방향 그래프를 사용할 수 있습니다. 한 정점에 연결된 간선의 수를 차수(degree)라고 하며, 이 글에서는 한 사람의 친구 수를 뜻합니다.

친선의 역설의 기본적인 네트워크 수준 명제는 다음과 같습니다.

무작위로 선택한 사람의 평균 친구 수보다, 친구 관계를 통해 만난 사람의 평균 친구 수가 크거나 같다.

모두의 친구 수가 같다면 두 평균도 같습니다. 사람마다 친구 수가 다르고 그 분산이 0보다 크면 친구 쪽 평균이 더 커집니다. 여기서 중요한 표현은 ‘평균적으로’입니다. 모든 사람이 자기 친구 전부보다 친구가 적다는 뜻은 아니며, 특정 개인에게 반드시 적용되는 진술도 아닙니다.

친구가 많은 사람이 더 자주 뽑히는 이유

친구가 1명인 민수와 친구가 10명인 지수가 있다고 하겠습니다. 전체 사람 중 한 명을 동일한 확률로 선택하면 민수와 지수는 각각 한 번씩 후보가 됩니다. 하지만 모든 사람의 친구 목록에서 이름 하나를 뽑는다면 상황이 달라집니다.

민수의 이름은 친구 목록에 1번 등장하고 지수의 이름은 10번 등장합니다. 연결선을 따라 사람을 표집할 때 지수가 선택될 기회는 민수의 10배입니다. 이처럼 관찰 대상이 가진 크기, 여기서는 친구 수에 비례해 선택 확률이 커지는 현상을 크기 편향이라고 합니다.

비슷한 현상은 학급 규모에서도 볼 수 있습니다. 학교가 집계한 학급당 평균 학생 수와 학생들이 실제로 경험하는 평균 학급 규모는 다를 수 있습니다. 큰 학급에는 학생이 더 많이 들어 있으므로 학생 한 명을 뽑아 그 학생의 학급 규모를 물으면 큰 학급이 더 자주 표본에 잡힙니다. 펠드의 원 논문도 친선의 역설과 이러한 학급 규모 역설이 같은 표집 원리를 공유한다고 설명합니다.

그래프 이론 공식으로 계산하기

사람이 n명인 무방향 그래프를 생각하겠습니다. i번째 사람의 친구 수를 kᵢ라고 쓰고, 전체 친구 수의 평균을 μ라고 하면 다음과 같습니다.

μ = (k₁ + k₂ + ··· + kₙ) / n = E[K]

무방향 그래프에서 모든 사람의 차수를 합하면 간선 수의 두 배가 됩니다. 한 친구 관계가 양쪽 사람에게 각각 한 번씩 연결되기 때문입니다. 이것이 그래프 이론의 악수 정리(handshaking lemma)입니다.

이제 모든 친구 목록에 적힌 이름을 하나의 긴 목록으로 합치겠습니다. 친구가 kᵢ명인 사람은 이 목록에 kᵢ번 나타나며, 나타날 때마다 그 사람의 친구 수도 kᵢ입니다. 따라서 친구 목록에서 본 평균 친구 수는 다음 공식으로 계산됩니다.

친구를 통해 만난 사람의 평균 친구 수 = Σkᵢ² / Σkᵢ = E[K²] / E[K]

분산의 정의 `Var(K) = E[K²] - E[K]²`를 이용하면 이 식은 더 직관적으로 바뀝니다.

E[K²] / E[K] = E[K] + Var(K) / E[K]

따라서 두 평균의 차이는 다음과 같습니다.

친구 쪽 평균 - 전체 평균 = Var(K) / E[K]

분산은 음수가 될 수 없으므로 친구 쪽 평균은 전체 평균보다 작아질 수 없습니다. 모든 사람의 친구 수가 같아 분산이 0이면 차이가 0입니다. 친구 수가 서로 다르면 분산이 양수이므로 친구 쪽 평균이 더 큽니다. 친구 수의 격차가 클수록 `Var(K) / E[K]`도 커질 수 있습니다.

6명짜리 네트워크로 직접 확인하기

가운데 한 사람 A가 나머지 다섯 명 B, C, D, E, F와 모두 친구이고, 바깥의 다섯 사람끼리는 친구가 아닌 별 모양 네트워크를 예로 들겠습니다.

  • A의 친구 수는 5명입니다.
  • B, C, D, E, F의 친구 수는 각각 1명입니다.
  • 전체 차수의 합은 `5 + 1 + 1 + 1 + 1 + 1 = 10`입니다.
  • 전체 사람의 평균 친구 수는 `10 / 6`, 즉 약 1.67명입니다.

친구 목록에는 A가 다섯 번 등장하고, 나머지 다섯 사람은 각각 한 번씩 등장합니다. 이 목록에서 관찰되는 친구 수의 합은 다음과 같습니다.

5×5 + 1×1 + 1×1 + 1×1 + 1×1 + 1×1 = 30

친구 목록의 항목은 모두 10개이므로 친구를 통해 만난 사람의 평균 친구 수는 `30 / 10 = 3명`입니다. 전체 평균 1.67명보다 큽니다.

같은 결과를 분산 공식으로도 확인할 수 있습니다. 이 네트워크에서 `E[K²] = 30/6 = 5`, `E[K] = 10/6`이므로 `E[K²]/E[K] = 5 ÷ (10/6) = 3`입니다.

개인별로 보면 바깥의 다섯 사람은 친구가 5명인 A만 바라보므로 모두 자신보다 친구가 많은 사람과 연결돼 있습니다. 반면 A의 친구들은 모두 친구가 1명이라 A에게는 역설이 성립하지 않습니다. 이 예에서는 6명 중 5명에게 개인 수준의 현상이 나타나지만, 이것이 모든 네트워크에서 과반수에게 항상 성립한다는 증명은 아닙니다.

평균 명제와 개인 명제는 다릅니다

친선의 역설을 정확히 이해하려면 서로 다른 질문을 구분해야 합니다.

첫 번째 질문은 “친구 목록에서 표집한 사람들의 평균 친구 수가 전체 사람의 평균보다 큰가?”입니다. 무방향 그래프에서 친구 수에 차이가 있다면 `E[K²]/E[K]` 공식에 따라 그렇습니다.

두 번째 질문은 “특정 개인의 친구들은 평균적으로 그 개인보다 친구가 많은가?”입니다. i번째 사람에게 이 현상이 성립하려면 다음 부등식이 맞아야 합니다.

(i의 모든 친구가 가진 친구 수의 합) / kᵢ > kᵢ

이 부등식의 성립 여부는 누가 누구와 연결됐는지에 따라 달라집니다. 친구 수가 같은 정점끼리 주로 연결되는지, 친구가 적은 정점이 허브와 많이 연결되는지 같은 네트워크 구조가 영향을 줍니다.

세 번째 질문은 “전체 사람 중 과반수가 자기 친구들의 평균보다 친구가 적은가?”입니다. 이 비율도 그래프의 구체적인 연결 구조에 달려 있습니다. 네트워크 전체 평균에 관한 공식만으로 개인 수준의 과반수를 보장할 수 없습니다. 2024년 《Proceedings of the National Academy of Sciences》에 실린 연구도 친선의 역설을 여러 수준의 서로 다른 명제로 나누어 분석하며, 개인 수준의 역설이 한 네트워크의 모든 사람에게 동시에 성립할 수는 없다고 설명합니다.

따라서 “내 친구들은 나보다 친구가 더 많다”는 문장은 통계적 평균을 압축한 표현입니다. 누구에게나 예외 없이 참인 문장으로 해석하면 정확하지 않습니다.

산술평균과 중앙값도 구분해야 합니다

기본 공식은 산술평균을 사용합니다. 친구가 매우 많은 소수의 허브는 여러 친구 목록에 반복해서 등장할 뿐 아니라 평균값도 크게 끌어올릴 수 있습니다. 중앙값은 자료를 크기순으로 놓았을 때 가운데 값이므로 같은 방식으로 계산되지 않습니다.

“내 친구들의 평균 친구 수가 나보다 많다”와 “내 친구의 절반 이상이 나보다 친구가 많다”는 다른 명제입니다. 후자는 흔히 강한 친선의 역설(strong friendship paradox)이라고 구분합니다. 평균에 관한 원래 공식이 성립한다고 해서 중앙값이나 과반수에 관한 강한 형태까지 자동으로 성립하는 것은 아닙니다.

친구가 한 명도 없는 사람은 어떻게 계산하나요?

친구가 0명인 고립 정점은 전체 사람의 평균을 계산할 때 포함할 수 있습니다. 그러나 따라갈 친구 관계가 없으므로 그 사람의 ‘친구 평균’은 정의할 수 없습니다. 또한 친구 목록을 통한 표집에서는 이름이 한 번도 등장하지 않습니다.

고립 정점이 있는 그래프에서도 전체 평균과 친구 목록 평균은 계산할 수 있습니다. 단, `E[K²]/E[K]`에서 전체 간선이 하나도 없어 `E[K]=0`이면 분모가 0이 되므로 친구를 통한 표집 자체가 성립하지 않습니다. 연구나 데이터 분석에서는 고립 정점을 포함했는지, 개인별 친구 평균을 계산할 때 어떻게 처리했는지를 밝혀야 합니다.

온라인 팔로워 관계에도 그대로 적용될까요?

상호 친구 관계는 보통 무방향 그래프로 단순화할 수 있지만, 팔로우 관계는 방향 그래프입니다. 내가 팔로우하는 사람 수인 진출차수와 나를 팔로우하는 사람 수인 진입차수가 서로 다릅니다. 따라서 무방향 그래프의 친구 수 공식 하나를 그대로 적용하면 안 됩니다.

방향 그래프에서는 어떤 방향으로 연결선을 따라가는지, 팔로워 수와 팔로잉 수 중 무엇을 비교하는지, 상호 연결만 친구로 볼 것인지 먼저 정해야 합니다. 계정 중복, 비활성 계정, 추천 알고리즘, 공개 범위도 관측된 네트워크에 영향을 줄 수 있습니다. 온라인 서비스에서 표시되는 숫자를 현실의 친밀한 친구 수와 같은 개념으로 간주할 근거도 없습니다.

일반화된 친선의 역설이란 무엇인가요?

친구 수가 아니라 다른 특성에도 같은 표집 원리가 나타날 수 있습니다. 사람의 어떤 특성을 X, 친구 수를 K라고 하면 친구 관계를 통해 관찰한 X의 평균은 다음과 같이 나타낼 수 있습니다.

친구 표본의 특성 평균 = E[KX] / E[K]

공분산의 정의를 사용하면 전체 평균과의 차이는 다음과 같습니다.

친구 표본의 특성 평균 - E[X] = Cov(K, X) / E[K]

특성 X와 친구 수 K의 공분산이 양수라면 친구 표본에서 그 특성의 평균이 더 높게 관찰됩니다. 이를 일반화된 친선의 역설(Generalized Friendship Paradox)이라고 합니다.

2014년 《Scientific Reports》에 발표된 연구는 물리학 분야와 네트워크 과학 분야의 공동 저자 네트워크를 분석했습니다. 연구진은 공동 연구자가 평균적으로 더 많은 공동 저자, 논문, 인용 수를 가지는 현상을 보고했으며, 네트워크 수준의 일반화된 역설이 차수와 해당 특성 사이의 양의 상관관계에서 나온다는 공식을 제시했습니다. 다만 어떤 특성이든 무조건 역설이 생기는 것은 아닙니다. 친구 수와 특성 사이의 공분산이 0이거나 음수라면 결론이 달라집니다.

소수가 다수처럼 보이는 ‘다수의 착각’

연결 수가 많은 사람이 여러 사람의 주변에 동시에 나타나면, 전체에서는 드문 특성이 각자의 주변에서는 흔하게 보일 수 있습니다. 이를 다수의 착각(majority illusion)이라고 합니다.

2016년 《PLOS ONE》 연구는 같은 모양의 14개 정점 네트워크에서도 특정 특성을 가진 3개 정점을 어디에 배치하느냐에 따라 관찰 결과가 크게 달라질 수 있음을 예시로 보였습니다. 그 3개가 연결이 많은 위치에 있으면 많은 정점이 자기 이웃의 절반 이상이 해당 특성을 가졌다고 관찰할 수 있습니다. 같은 3개가 주변부에 있으면 그러한 관찰이 나타나지 않을 수 있습니다.

이는 네트워크에서 내가 자주 마주치는 비율과 전체 집단의 비율이 같지 않을 수 있다는 뜻입니다. 주변에서 어떤 행동이나 의견이 흔하게 보인다는 사실만으로 전체 인구에서도 다수라고 결론 내리면 표집 편향이 생길 수 있습니다.

감염병 조기 감지에 활용된 사례

친선의 역설은 네트워크에서 연결이 많은 사람을 전체 지도를 만들지 않고도 찾는 표집 방법에 활용할 수 있습니다. 무작위로 사람을 뽑은 뒤 그 사람의 친구를 지명받으면, 지명된 집단은 평균적으로 네트워크의 중심에 더 가까울 가능성이 커집니다.

니컬러스 크리스타키스와 제임스 파울러가 2010년 발표한 연구는 2009년 하버드대학교 학부생 744명을 추적했습니다. 무작위 집단과 그들이 지명한 친구 집단을 비교했을 때, 의료진의 진단 자료를 기준으로 친구 집단의 독감 유행 곡선이 무작위 집단보다 13.9일 앞섰으며 95% 신뢰구간은 9.9일에서 16.6일이었습니다.

이 수치는 모든 감염병이나 모든 네트워크에서 항상 같은 조기 감지 효과가 난다는 뜻이 아닙니다. 연구 논문도 선행 시간은 감염 확산과 네트워크의 특성에 따라 달라진다고 밝힙니다. 활용의 핵심은 친구 관계를 따라 얻은 표본이 무작위 표본보다 평균적으로 연결이 많은 사람을 포함한다는 점입니다.

친선의 역설을 해석할 때 주의할 점

첫째, ‘친구’의 정의가 자료마다 다릅니다. 설문에서 서로 지명한 가까운 친구, 한쪽만 지명한 사람, 온라인 팔로우, 공동 저자 관계는 같은 종류의 간선이 아닙니다.

둘째, 네트워크가 완전하게 관측됐는지 확인해야 합니다. 조사에 참여하지 않은 사람이나 비공개 관계가 빠지면 차수가 실제보다 작게 측정될 수 있습니다. 플랫폼 자료에는 중복 계정과 자동화 계정이 섞일 수도 있습니다.

셋째, 평균과 개인 경험을 분리해야 합니다. 네트워크 전체에서 친구 표본의 평균 차수가 높다는 사실은 특정 개인의 친구들이 모두 더 인기 있다는 뜻이 아닙니다.

넷째, 친구 수는 관계의 친밀도나 만족도를 측정하지 않습니다. 그래프의 차수는 연결 개수일 뿐이며, 관계의 질에 관한 판단은 친선의 역설 공식에서 나오지 않습니다.

다섯째, 상관관계와 인과관계를 구분해야 합니다. 친구 표본에서 어떤 특성이 더 높다고 해서 친구 관계가 그 특성을 만들어 냈다고 결론 내릴 수 없습니다. 일반화된 친선의 역설은 차수와 특성의 공분산에 따른 관측 차이를 설명하는 식입니다.

자주 묻는 질문

친선의 역설은 모든 사람에게 참인가요?

아닙니다. 네트워크 수준에서는 친구 수에 분산이 있을 때 친구 표본의 평균 친구 수가 전체 평균보다 큽니다. 특정 개인에게 성립하는지는 그 사람과 이웃의 연결 구조에 따라 달라집니다.

친구 수가 모두 같으면 어떻게 되나요?

분산이 0이므로 `Var(K)/E[K]`도 0입니다. 모든 정점의 차수가 같은 정규 그래프에서는 전체 평균과 친구 표본 평균이 같아 기본적인 평균 차이가 사라집니다.

친구가 많은 몇 명 때문에 생기는 현상인가요?

연결 수가 많은 정점이 친구 목록에 더 자주 나타나는 것이 직접적인 원인입니다. 친구 수 분산이 클수록 평균 차이가 커질 수 있습니다. 다만 개인 수준에서 몇 명에게 역설이 나타나는지는 허브의 존재만이 아니라 구체적인 연결 배치에도 좌우됩니다.

소셜미디어에서 친구들이 더 행복해 보이는 것도 같은 원리인가요?

친구 수와 행복 사이의 양의 공분산이 확인되고 측정 조건이 적절하다면 일반화된 친선의 역설 공식으로 친구 표본의 평균 차이를 설명할 수 있습니다. 그러나 게시물의 선택적 공개, 추천 알고리즘, 행복의 측정 방식도 관찰에 영향을 줍니다. 친구 수에 관한 원래 정리만으로 친구들이 실제로 더 행복하다고 결론 내릴 수는 없습니다.

평균 친구 수는 어떻게 구하나요?

모든 사람의 친구 수를 합해 사람 수로 나눕니다. 무방향 그래프에서는 차수 합이 간선 수의 두 배이므로 `평균 차수 = 2×간선 수 / 정점 수`로도 계산할 수 있습니다.

친구 한 명을 무작위로 뽑는 방법은 무엇인가요?

기본 공식의 친구 표본은 모든 친구 관계의 끝점 가운데 하나를 같은 확률로 선택하는 방식입니다. 그러면 차수가 k인 사람은 k개의 끝점에 나타나므로 선택 확률이 k에 비례합니다. 사람을 먼저 균등하게 뽑은 다음 그 사람의 친구를 하나 뽑는 방식은 네트워크 구조에 따라 다른 가중치를 만들 수 있어 표집 절차를 명시해야 합니다.

결론: 친구 목록은 전체 인구의 축소판이 아닙니다

친선의 역설은 친구가 많은 사람이 여러 사람의 친구 목록에 반복해서 나타나는 크기 편향 표집에서 발생합니다. 전체 사람의 평균 친구 수가 `E[K]`라면 친구 관계의 끝점에서 관찰한 평균 친구 수는 `E[K²]/E[K]`입니다. 두 값의 차이는 `Var(K)/E[K]`이므로 친구 수가 서로 다른 무방향 네트워크에서는 친구 쪽 평균이 더 큽니다.

그러나 이 결과는 모든 개인의 친구가 그 개인보다 친구가 많다는 뜻이 아닙니다. 네트워크 평균, 개인별 이웃 평균, 친구의 과반수가 더 인기 있는지를 묻는 강한 형태는 서로 다른 명제입니다. 온라인 팔로우처럼 방향이 있는 관계에서는 진입차수와 진출차수를 구분해야 합니다.

친선의 역설이 알려 주는 사실은 비교 대상이 어떻게 표집됐는지에 따라 관찰되는 평균이 달라질 수 있다는 점입니다. 친구 목록에서 자주 보이는 사람이 전체 집단에서도 전형적인 사람이라고 볼 수는 없습니다. 계산할 때는 친구의 정의, 네트워크 방향, 평균의 종류와 표집 절차를 함께 확인해야 합니다.

참고 자료