언어 모델이 긴 글과 코드를 만들어 내는 과정을 다음 단어 맞히기라고 설명하곤 합니다. 출발점을 이해하는 데는 도움이 되지만, 바로 앞 단어만 보고 사전에서 다음 단어를 고른다는 뜻으로 받아들이면 부족합니다. 많은 현대 언어 모델은 긴 문맥을 수치로 처리하고 다음에 올 토큰의 확률을 계산합니다. 그 결과를 반복해 문장을 만들며, 사용자 요청에 맞게 답하도록 추가 학습과 도구가 결합되기도 합니다.
토큰은 단어와 정확히 같은 단위가 아닙니다
모델은 글을 그대로 눈으로 읽는 대신 토큰이라는 단위로 나눠 처리합니다. 토큰은 단어 하나일 수도 있고 단어의 일부나 구두점 등일 수도 있습니다. 어떤 단위를 사용하는지는 토큰화 방식에 달려 있습니다. 한국어 한 단어가 언제나 한 토큰이라는 규칙은 없고, 같은 문장도 모델의 토크나이저가 다르면 다른 수의 토큰으로 나뉠 수 있습니다. 글자 수와 토큰 수를 무조건 일정 비율로 바꾸기는 어렵습니다.
각 토큰은 번호로 표현되고 모델 내부에서는 여러 수치로 된 벡터로 변환됩니다. 이 수치 표현이 여러 계산 층을 지나면서 문맥에 따라 달라집니다. 같은 글자가 포함돼도 앞뒤 내용에 따라 의미와 역할이 달라지기 때문에 단순히 단어별로 고정된 뜻풀이 하나를 찾아 붙이는 과정과 다릅니다. 다만 내부 수치 하나가 사람이 정한 개념 하나와 깔끔하게 일대일 대응한다고 생각하는 것도 피해야 합니다.
다음 토큰의 확률을 조건부로 계산합니다
자기회귀 언어 모델은 지금까지 주어진 토큰을 조건으로 다음 토큰의 분포를 계산합니다. 문장 전체의 확률은 각 단계의 조건부 확률을 곱하는 방식으로 표현할 수 있습니다. 예를 들어 두 단계에서 선택한 토큰의 조건부 확률이 각각 0.5와 0.2라면 해당 두 단계의 결합 확률은 0.1입니다. 여기서 0.1은 그 문장의 내용이 사실일 확률 10%라는 뜻이 아닙니다. 모델이 그 토큰열에 부여한 확률과 사실 검증은 서로 다른 문제입니다.
모델이 계산한 분포에서 어떤 토큰을 고를지는 생성 설정에 달려 있습니다. 가장 높은 후보를 선택하는 방법도 있고 확률적으로 표본을 뽑는 방법도 있습니다. 그래서 같은 질문에 표현이 달라질 수 있습니다. 온도 같은 설정은 분포의 상대적인 뾰족함을 바꾸는 데 쓰이지만, 온도를 낮추면 사실 오류가 자동으로 사라지는 것은 아닙니다. 가장 높은 점수를 받은 답도 잘못된 내용일 수 있습니다.
대규모 자기회귀 언어 모델 연구는 큰 텍스트 자료에서 사전 학습한 모델이 문맥에 제시된 예시를 활용해 여러 작업을 수행하는 모습을 다룹니다. 다음 토큰 예측이라는 학습 목표가 단순해 보이더라도, 다양한 문맥에서 예측을 잘하려면 문법과 사실 관계, 문서 형식 같은 복잡한 규칙을 활용하는 표현을 배울 수 있습니다. 학습 목표의 짧은 설명만으로 모델의 모든 능력을 단순한 자동 완성 수준으로 축소하기는 어렵습니다.
학습할 때와 답할 때는 하는 일이 다릅니다
학습에서는 실제 자료의 다음 토큰을 더 잘 예측하도록 모델의 매개변수를 조정합니다. 예측과 목표 사이의 손실을 계산하고, 그 손실을 줄이는 방향으로 수많은 수치를 업데이트합니다. 경사하강법 계열의 최적화가 이 과정에 쓰입니다. 한 문장을 외우는 작업만 반복한다기보다 많은 예시에서 공통되는 구조를 포착하도록 수치를 바꾸는 과정입니다. 물론 일부 학습 자료가 그대로 재현되는 암기 현상도 생길 수 있어 일반화와 암기를 완전히 양분해서는 안 됩니다.
일반적인 추론에서는 이미 학습된 매개변수와 현재 제공된 문맥을 이용해 출력을 계산합니다. 대화 중 새로운 정보를 알려줬다고 해서 그 순간 기본 모델의 모든 매개변수가 다시 학습되는 것은 아닙니다. 대화 문맥에서 참고하는 것과 별도의 장기 저장 기능, 후속 학습에 활용되는 것은 구분해야 합니다. 실제 서비스가 대화를 저장하고 학습에 사용하는지는 해당 서비스의 정책과 설정 문제이며 다음 토큰 예측 원리만으로 결정되지 않습니다.
사용자가 예시를 몇 개 보여준 뒤 같은 형식으로 답하게 할 수 있는 이유도 이 구분에서 이해할 수 있습니다. 모델은 현재 문맥에 있는 패턴을 조건으로 출력을 만들 수 있습니다. 이를 매번 사용자 맞춤 모델을 새로 훈련했다고 표현하면 부정확합니다. 대화가 길어졌을 때 앞의 정보를 놓치는 현상 역시 문맥 처리와 실제로 전달된 정보의 범위를 확인해야 하며, 사람이 기억을 잊는 과정과 동일하다고 단정할 수는 없습니다.
트랜스포머는 문맥 속 관계를 계산하는 구조입니다
트랜스포머의 어텐션은 여러 위치의 정보를 서로 참고하도록 가중치를 계산하는 장치입니다. 문장 앞부분의 인물과 뒤에 나온 지시 표현의 관계처럼 멀리 떨어진 단서도 계산에 활용할 수 있습니다. 트랜스포머 원 논문은 2017년 기계번역 과제에서 이 구조를 제안했습니다. 이후 언어 생성 등 여러 작업에서 변형된 구조가 사용됐지만, 모든 생성형 AI가 같은 구조와 학습 방식을 쓰는 것은 아닙니다.
어텐션이라는 이름 때문에 사람이 주의를 기울이듯 특정 부분을 의식적으로 바라본다고 상상하기 쉽습니다. 실제로는 수치 연산의 구성 요소를 가리킵니다. 내부 가중치가 높다는 이유만으로 그것이 답변의 유일한 원인이나 사람이 읽을 수 있는 완전한 설명이 되는 것도 아닙니다. 모델의 내부 처리와 인간의 이해를 비교하는 비유는 도움이 될 수 있지만, 비유를 곧바로 심리적 사실로 바꾸지 않는 편이 정확합니다.
대화형 답변에는 추가 학습이 관여합니다
문장을 이어 쓰는 능력만으로는 사용자가 원한 지시를 따르는 좋은 도우미가 되지 않을 수 있습니다. 질문에 답하는 대신 질문과 비슷한 글을 더 이어 쓸 수도 있습니다. 그래서 모범 응답으로 학습하거나 여러 응답의 선호를 비교하는 등 후속 학습을 적용합니다. 사람의 피드백을 이용한 지시 수행 연구는 이런 접근의 대표적인 원 연구입니다. 모든 제품이 그 논문과 똑같은 절차를 사용한다는 뜻은 아닙니다.
후속 학습은 형식과 도움의 정도, 지시 준수 등을 개선할 수 있지만 사실 오류가 없다는 보증은 아닙니다. 사람이 선호하는 답과 진실인 답이 항상 일치하지도 않습니다. 자신감 있는 설명이 평가에서 좋아 보일 수 있고, 문제에 필요한 자료가 없는데도 자연스러운 답을 만들어 낼 수 있습니다. 매끄러운 문장과 정중한 어조를 정확성의 증거로 취급하지 않는 것이 좋습니다.
그럴듯한 오류는 왜 생길까요
언어 모델의 출력은 학습된 패턴과 주어진 문맥에서 생성됩니다. 정확한 사실을 뒷받침할 정보가 부족하거나 질문의 전제가 틀렸을 때도 익숙한 답변 형식이 이어질 수 있습니다. 논문 제목과 저자, 날짜처럼 각각은 그럴듯한 조각이 결합해 존재하지 않는 출처가 만들어질 수도 있습니다. 이를 흔히 환각이라고 부르지만, 오류의 종류와 원인은 다양하므로 한 가지 현상으로만 설명하기 어렵습니다.
계산도 마찬가지입니다. 숫자를 포함한 문장을 잘 이어 쓰는 능력과 모든 자릿수의 연산을 정확히 실행하는 능력은 같지 않습니다. 짧은 계산을 맞히더라도 긴 계산이나 단위 변환에서 실수할 수 있습니다. 중요한 수치는 계산기나 코드로 확인하고, 입력값과 단위를 함께 검토하는 편이 좋습니다. 정답을 다시 묻는 것만으로 검증이 끝났다고 볼 수는 없습니다. 같은 잘못된 전제를 반복할 가능성이 남기 때문입니다.
| 확인할 대상 | 오해하기 쉬운 점 | 실제 검증 방법 |
|---|---|---|
| 논문과 기사 출처 | 형식이 정확하면 실재한다고 생각함 | 원문을 열어 제목·저자·내용 확인 |
| 수치 계산 | 자신 있게 답하면 계산이 맞다고 생각함 | 독립 계산과 단위 검토 |
| 최신 정보 | 유창한 답은 최근 사실이라고 생각함 | 발표일과 공식 최신 자료 확인 |
| 주어진 문서 요약 | 첨부했다고 모두 반영됐다고 생각함 | 중요 문장과 원문 위치 대조 |
검색과 도구는 모델의 기억과 다릅니다
검색 증강은 관련 문서를 찾아 모델에 제공하고 그 자료를 참고해 답하게 하는 접근입니다. 검색 증강 생성 연구는 모델의 매개변수에 저장된 정보와 외부에서 검색한 문서를 결합합니다. 최신 자료나 특정 조직의 문서가 필요한 경우에 유용할 수 있습니다. 하지만 검색한 자료가 틀리거나 관계없는 문서가 선택되면 답변에도 문제가 생길 수 있으므로 검색 기능 자체가 정확성의 보증서는 아닙니다.
계산기나 프로그램 실행 도구를 연결하면 모델이 직접 긴 산술을 생성하는 대신 도구의 결과를 활용할 수 있습니다. 이때도 어떤 입력을 도구에 보냈는지, 결과를 올바르게 해석했는지 확인해야 합니다. 도구를 사용했다고 주장하는 문장과 실제 도구 실행 기록도 다릅니다. 검증 가능한 작업에서는 사용한 자료와 계산 과정을 남기면 결과를 평가하기 쉬워집니다.
생성형 AI를 활용할 때는 원하는 결과의 형식과 근거 자료를 명확히 주고, 확인되지 않은 부분은 구분하도록 요청하는 편이 좋습니다. 초안 작성과 아이디어 정리에서는 빠른 생성이 도움이 되고, 사실과 수치가 중요한 부분에서는 별도의 대조 과정이 필요합니다. 다음 토큰 예측이라는 원리를 이해하면 모델의 능력을 과소평가하지 않으면서도 유창함을 신뢰의 전부로 삼지 않을 수 있습니다.