두 사람이 함께 협력하면 모두 편해질 수 있는데도 서로 자기 몫을 지키려다 둘 다 손해를 보는 일이 있습니다. 조별 과제에서 상대가 일하지 않을까 걱정해 나도 노력을 줄이거나, 경쟁하는 가게가 상대의 광고비를 의식해 광고를 계속 늘리는 상황을 떠올릴 수 있습니다. 죄수의 딜레마는 이런 갈등 가운데 특정한 보상 구조를 분석하는 모형입니다. 사람들이 원래 이기적이라는 성격 검사도, 어떤 갈등이든 배신으로 끝난다는 예언도 아닙니다.
두 사람의 선택을 표로 고정해 봅니다
설명을 위해 두 용의자 A와 B가 서로 연락할 수 없는 상황을 가정하겠습니다. 둘 다 침묵하면 각각 징역 1년, 둘 다 자백하면 각각 3년을 받습니다. 한 사람만 자백하면 자백한 사람은 풀려나고 침묵한 사람은 5년을 받습니다. 이 형량은 실제 법률이나 수사 관행을 설명하는 수치가 아닙니다. 선택의 구조를 보여 주려고 임의로 정한 예입니다. 여기서는 상대와 약속한 침묵을 협력, 혼자 자백하는 선택을 배신이라고 부릅니다.
| A의 선택 | B의 선택 | A의 형량 | B의 형량 |
|---|---|---|---|
| 침묵 | 침묵 | 1년 | 1년 |
| 자백 | 침묵 | 0년 | 5년 |
| 침묵 | 자백 | 5년 | 0년 |
| 자백 | 자백 | 3년 | 3년 |
A의 자리에서 계산해 보겠습니다. B가 침묵한다면 나도 침묵할 때 1년이지만 자백하면 0년입니다. B가 자백한다면 내가 침묵할 때 5년이지만 자백하면 3년입니다. 상대가 무엇을 하든 자백하는 편이 내 형량을 줄입니다. B에게도 똑같은 계산이 적용됩니다. 각자 자기 형량만 줄이고 표에 적힌 결과를 확실히 믿는다면 두 사람은 모두 자백을 선택하게 됩니다.
서로 자백해서 3년씩 받는 결과는 둘 다 침묵해 1년씩 받는 결과보다 두 사람 모두에게 나쁩니다. 그럼에도 상대가 자백하는 상태에서 나 혼자 침묵으로 바꾸면 내 형량은 3년에서 5년으로 늘어납니다. 혼자 선택을 바꿔서는 이득을 볼 수 없다는 점에서 상호 자백은 내시균형입니다. 균형이라는 단어가 공정하거나 행복한 결과를 뜻하지 않는다는 사실이 드러납니다.
모든 협력 문제가 죄수의 딜레마는 아닙니다
보상이 클수록 좋은 점수로 바꿔 쓰면, 혼자 배신해서 얻는 점수 T가 상호 협력 점수 R보다 크고, R은 상호 배신 점수 P보다 크며, P는 혼자 협력했다가 당하는 점수 S보다 커야 합니다. 흔히 T>R>P>S라고 적습니다. 예를 들어 5, 3, 1, 0점을 배치하면 이 조건을 만족합니다. 점수는 돈일 수도 있지만 편의나 만족을 포함한 효용을 뜻할 수도 있습니다.
상대가 협력할 때 나도 협력하는 편이 더 좋다면 배신은 더 이상 언제나 유리한 선택이 아닙니다. 함께 약속 장소를 정하는 문제는 조정게임에 더 가까울 수 있고, 둘 다 양보하지 않으면 큰 충돌이 생기는 상황은 다른 보상 구조를 가질 수 있습니다. 겉으로 갈등이 있다는 이유만으로 죄수의 딜레마라고 이름 붙이면 어떤 제도가 도움이 되는지까지 잘못 판단할 수 있습니다.
또한 표에서 무엇을 보상으로 계산했는지 확인해야 합니다. 돈만 보면 혼자 빠져나가는 것이 이익이어도 약속을 지킨 만족이나 상대를 해친 죄책감이 크다면 당사자의 실제 선호는 달라집니다. 이런 사람에게 협력은 계산을 못 한 결과가 아닐 수 있습니다. 경제적 보수와 심리적 효용을 구분하지 않은 채 ‘합리적이면 반드시 배신한다’고 말하는 것은 모형의 가정을 사람에게 강요하는 셈입니다.
다시 만날 가능성이 선택을 바꿉니다
한 번 만나고 끝나는 게임에서는 오늘 배신한 대가가 미래 관계에 반영되지 않습니다. 같은 상대와 거래를 반복하면 이야기가 달라집니다. 지금 약속을 어겨 이득을 얻더라도 다음 거래가 끊기면 더 큰 손해가 날 수 있습니다. 반복게임은 현재의 유혹과 미래의 협력 가치를 함께 계산합니다. 반복한다고 협력이 자동으로 생기는 것은 아니며, 상대 행동을 관찰할 수 있는지와 관계가 얼마나 이어지는지가 중요합니다.
앞의 점수 예에서 서로 협력하면 매번 3점을 받고 혼자 배신하면 이번에 5점을 받는다고 하겠습니다. 배신이 한 번이라도 관찰되면 이후 둘 다 계속 배신해 매번 1점을 받는 전략을 가정합니다. 미래 점수에 곱하는 할인계수를 δ라고 하면 협력을 유지할 가치는 3/(1−δ)입니다. 지금 배신할 가치는 5+δ/(1−δ)입니다. 첫 번째 값이 두 번째 이상이면 배신의 유혹을 견딜 수 있습니다.
식을 정리하면 3≥5−4δ이므로 δ≥0.5가 됩니다. 이 조건에서는 상대가 약속한 전략을 따른다는 전제 아래 계속 협력하는 것이 지금 배신하는 것보다 불리하지 않습니다. δ는 미래 보상을 얼마나 중시하는지를 나타내며 모형에 따라 다음 만남이 이어질 확률과 연결해 해석할 수도 있습니다. 현실의 모든 관계에서 재회 확률이 50%를 넘으면 협력한다는 보편 법칙은 아닙니다. 보상과 처벌 방식이 달라지면 문턱도 달라집니다.
관계가 정확히 몇 번 후 끝나는지 모두 알고, 매 단계의 보상 구조와 합리성에 대한 가정이 유지된다면 마지막 회차부터 거꾸로 따지는 분석에서는 협력이 무너질 수 있습니다. 그러나 현실에는 상대의 선호를 모르거나 마지막 만남이 불확실한 경우가 많습니다. 알려진 종료 시점이 있는 실험에서도 실제 참가자의 행동은 단순한 이론 예측과 다를 수 있습니다. 유한 반복게임의 결과를 가족이나 직장에 그대로 대입할 수 없는 이유입니다.
팃포탯은 유명하지만 만능 전략은 아닙니다
팃포탯은 먼저 협력하고 다음부터는 상대가 직전에 한 선택을 따라 하는 전략입니다. 상대가 협력하면 협력하고 배신하면 다음 차례에 배신합니다. 액설로드의 컴퓨터 대회로 널리 알려졌습니다. 복잡한 속임수 없이 협력의 기회를 열어 두고 일방적인 착취에는 반응한다는 특징이 있습니다. 다만 특정 대회에서 성적이 좋았다는 사실과 가능한 모든 상대에게 최선이라는 주장은 다릅니다.
실수나 관찰 오류가 있으면 문제가 생깁니다. 둘 다 협력하려 했는데 A의 선택이 한 번 배신으로 전달됐다고 해 보겠습니다. B는 다음 차례에 보복하고 A는 그 보복을 보고 다시 배신할 수 있습니다. 오해가 번갈아 이어지면 원래 협력적이던 두 사람이 불필요한 손해를 봅니다. 때때로 용서하거나 의도를 확인하는 장치가 도움이 될 수 있지만, 너무 쉽게 용서하면 악용될 가능성도 있습니다.
상대를 무조건 따라 하는 행동과 책임 있는 상호성도 구분해야 합니다. 업무에서 동료가 한 번 마감에 늦었다고 나도 일부러 늦으면 공동 작업이 더 망가질 수 있습니다. 반복게임의 통찰을 현실에 활용한다면 작은 위반에 비례해 반응하고 설명할 기회를 주며 다시 협력할 경로를 마련하는 쪽을 생각해 볼 수 있습니다. 게임의 두 버튼을 사람 사이의 다양한 선택으로 그대로 바꾸기는 어렵습니다.
협력을 가능하게 하는 것은 선의만이 아닙니다
업무 기록이 남고 서로의 기여를 확인할 수 있으면 무임승차를 숨기기 어려워집니다. 약속을 지킨 사람이 다음에도 거래할 기회를 얻으면 미래 협력의 가치가 커집니다. 공동 비용을 나누는 규칙이 명확하면 누가 얼마나 부담해야 하는지에 관한 오해가 줄어듭니다. 이런 장치는 사람의 성격을 바꾸지 않고도 선택이 가져오는 결과를 바꿀 수 있습니다.
노워크가 정리한 협력 진화 연구는 반복적인 상호작용 외에도 평판이나 집단 구조 등 여러 조건을 다룹니다. 생물학적 진화 모형과 사람이 의식적으로 맺는 계약은 같은 것이 아닙니다. 다만 서로 돕는 행동이 언제 유지될 수 있는지 설명하려면 행동의 비용과 이익이 누구에게 언제 돌아가는지 살펴야 한다는 공통점이 있습니다. ‘협력은 착해서 한다’와 ‘협력은 언제나 손해다’ 어느 쪽만으로도 충분하지 않습니다.
제도를 만들 때는 처벌을 강하게 하는 것만 생각해서도 안 됩니다. 관찰이 부정확한 상태에서 제재를 늘리면 협력한 사람까지 벌을 받을 수 있습니다. 기여를 평가하는 기준이 한쪽에게 유리하면 신뢰가 더 떨어집니다. 규칙을 미리 공개하고 오류를 바로잡을 절차를 두는 일은 보상표 바깥의 장식이 아니라 실제 선택을 바꾸는 조건입니다. 갈등의 비용을 줄일 수 있는 소통 수단도 살펴야 합니다.
현실 사례를 분석할 때 던질 질문
조별 과제를 예로 들면 먼저 각자의 선택을 구체적으로 정해야 합니다. ‘착하게 행동하기’보다는 맡은 자료를 기한 안에 제출하는지처럼 관찰 가능한 행동이 낫습니다. 그다음 한 사람이 일을 하지 않을 때 누가 추가 부담을 지는지, 모두 노력하지 않을 때 어떤 결과가 생기는지 적어 봅니다. 상대의 선택과 관계없이 일을 안 하는 편이 정말 유리한지 확인해야 죄수의 딜레마라는 설명이 맞는지 판단할 수 있습니다.
이어서 만남이 반복되는지, 기여를 확인할 수 있는지, 약속을 바꿀 수 있는지 살펴봅니다. 공동 성적만 주는 방식과 개인별 기여를 반영하는 방식은 보상 구조가 다릅니다. 구성원이 일을 안 하는 이유가 무임승차가 아니라 역할을 이해하지 못해서라면 처벌보다 업무를 분명히 나누는 것이 먼저일 수 있습니다. 같은 결과처럼 보여도 원인에 따라 해결 방법은 달라집니다.
죄수의 딜레마가 보여 주는 것은 개인의 유리한 선택을 모은 결과가 모두에게 유리하지 않을 수 있다는 점입니다. 이 모형을 제대로 쓰려면 사람에게 배신자라는 꼬리표를 붙이기보다 선택의 조건을 적어 봐야 합니다. 어떤 결과를 보상으로 보는지, 미래 관계가 얼마나 가치 있는지, 오해를 어떻게 풀 수 있는지 확인하면 협력을 기대할 근거와 기대하기 어려운 이유를 더 구체적으로 말할 수 있습니다.