핵심 요약
- 대형 언어모델은 방대한 문서를 작은 텍스트 조각인 토큰으로 바꾼 뒤, 다음 토큰을 예측하도록 학습한다.
- 사전학습으로 만든 모델은 문서를 이어 쓰는 데 가깝다. 대화 예시로 추가 학습해야 질문에 답하는 조수의 행동을 익힌다.
- 모델의 매개변수에 저장된 지식은 부정확할 수 있다. 검색 결과나 원문을 대화 맥락에 넣으면 해당 정보에 직접 접근할 수 있지만, 답변 검증은 여전히 필요하다.
- 정답을 확인할 수 있는 문제에서는 강화학습을 통해 모델이 여러 풀이를 시도하고 효과적인 풀이 방식을 익힐 수 있다. 사람의 선호를 흉내 낸 보상 모델에는 속임수에 취약하다는 한계가 있다.
인터넷 문서에서 다음 토큰 예측까지
안드레이 카파시는 챗GPT 같은 모델을 만드는 첫 단계로 사전학습을 설명한다. 공개 웹 문서를 모아 주소와 언어를 걸러내고, 웹페이지에서 본문 텍스트를 추출하며, 중복과 개인정보를 줄이는 과정이다. 그가 예로 든 FineWeb 데이터셋은 약 44TB의 텍스트와 15조 개의 토큰으로 이뤄져 있다. FineWeb의 영어 비중 기준처럼 어떤 문서를 남길지는 데이터셋마다 달라지며, 이는 모델이 접하는 언어의 비중에도 영향을 준다.
텍스트는 글자 그대로 신경망에 들어가지 않는다. 자주 등장하는 문자열을 묶은 토큰으로 변환된다. 토큰은 단어 전체일 수도, 단어의 일부일 수도 있다. 모델은 앞에 놓인 토큰들을 보고 다음에 올 토큰의 확률을 계산한다. 학습 중에는 실제 다음 토큰의 확률이 높아지도록 신경망의 매개변수를 조금씩 조정한다. 답변을 생성할 때는 이 예측을 한 토큰씩 반복한다.
카파시는 이 때문에 같은 입력에서도 다른 결과가 나올 수 있다고 설명한다. 모델이 매번 확률에 따라 다음 토큰을 선택하기 때문이다. 사전학습만 마친 기본 모델은 질문에 답하도록 만들어진 조수가 아니라, 주어진 문장 뒤를 이어 쓰는 모델이다. 인터넷에서 자주 접한 내용은 기억하거나 때로 길게 재현할 수 있지만, 그 지식이 정확한 기록처럼 저장되는 것은 아니다.
대화 학습이 조수의 행동을 만든다
다음 단계인 지도 미세조정은 사람과 조수의 대화를 학습시키는 과정이다. 작성자가 질문에 대한 바람직한 답변을 만들고, 모델은 그 예시를 따라 응답하는 방식을 익힌다. 회사가 작성한 답변 지침도 이 과정에 영향을 준다. 카파시는 초기에는 사람이 답변을 직접 작성했지만, 이후에는 기존 언어모델이 초안을 만드는 등 합성 데이터의 도움도 커졌다고 설명한다.
그가 일반적인 조수 모델의 답변을 이해하기 위해 제시한 비유는 답변 지침을 따르는 데이터 작성자를 신경망이 모사한다는 것이다. 사전학습에서 얻은 지식과 대화 예시에서 익힌 응답 방식이 결합한다. 다만 가능한 모든 질문을 학습 데이터에 담을 수는 없으므로, 실제 답변은 예시를 그대로 복사하기보다 비슷한 패턴을 새로운 질문에 적용한 결과일 수 있다.
자신 있게 틀리는 이유와 검색의 역할
카파시는 환각의 한 원인을 대화 학습 데이터에서 찾는다. 사람이 인물에 관한 질문에 자신 있는 어조로 답한 예시가 많다면, 모델은 낯선 이름을 받아도 그 형식에 맞춰 답을 지어낼 수 있다. 오래된 모델에 임의의 이름을 물었을 때 직업과 이력이 매번 달라지는 사례를 보여준다. 그는 모델이 모르는 질문을 찾아내고 ‘모른다’고 답하는 예시를 학습시키는 방식을 완화책으로 소개한다.
또 다른 방법은 검색 같은 도구 사용이다. 모델이 검색 요청을 생성하면 별도 프로그램이 검색을 실행하고 결과를 대화의 맥락에 넣는다. 카파시는 매개변수 속 지식을 흐릿한 기억에, 맥락에 들어온 자료를 바로 읽을 수 있는 작업 기억에 비유한다. 소설의 한 장을 요약할 때 제목만 묻는 것보다 해당 장의 텍스트를 함께 제공하는 편이 낫다는 사례도 같은 논리다. 검색과 원문 제공은 기억에만 의존하는 문제를 줄이지만, 모델이 자료를 잘못 해석할 가능성까지 없애지는 않는다.
계산·글자 세기에서 드러나는 약점
모델은 토큰을 왼쪽에서 오른쪽으로 생성한다. 카파시는 한 토큰을 만들 때 수행할 수 있는 계산이 제한돼 있으므로, 중간 계산 없이 답부터 내도록 하면 오류가 날 수 있다고 설명한다. 사과와 오렌지의 가격을 구하는 문제에서 숫자가 커지자 즉답은 틀렸지만, 중간 단계를 거친 답변은 맞았던 사례를 제시한다.
글자 세기와 철자 작업에는 토큰화 자체가 장애가 된다. 사람이 한 글자씩 보는 단어를 모델은 여러 글자가 묶인 토큰으로 보기 때문이다. 점의 개수를 세거나 단어에서 특정 위치의 글자를 고르는 작업에서 모델이 틀린 사례가 나온다. 반면 텍스트를 코드에 옮겨 계산 프로그램이 세거나 추출하게 하면 올바른 결과를 얻었다. 카파시는 어려운 암산이나 문자 조작에서는 모델의 답만 신뢰하기보다 계산 도구를 활용하는 편이 낫다고 설명한다.
강화학습이 풀이 방식을 바꾸는 과정
강화학습에서는 사람이 모든 풀이 과정을 써 주지 않아도 된다. 정답을 확인할 수 있는 문제를 주고 모델이 여러 풀이를 생성하게 한 뒤, 맞는 답으로 이어진 풀이를 강화한다. 카파시에 따르면 사람이 자연스럽다고 여기는 풀이가 반드시 모델에 가장 잘 맞는 풀이인지는 알 수 없다. 반복 시도는 모델이 스스로 효과적인 토큰의 흐름을 찾게 한다.
그는 DeepSeek R1 논문을 예로 들며, 수학 문제에 대한 강화학습이 진행되면서 정답률과 응답 길이가 늘어났다고 설명한다. 모델이 중간 단계를 재검토하고 다른 접근을 시도하는 방식이 나타났다는 것이다. 다만 카파시는 이런 성과가 주로 수학이나 코드처럼 결과를 검증할 수 있는 영역에서 관찰됐으며, 창작처럼 정답을 정하기 어려운 영역으로 얼마나 옮겨갈지는 열린 문제라고 본다.
사람의 선호를 점수로 바꿀 때의 한계
시나 농담, 요약처럼 정답을 바로 판정하기 어려운 작업에는 인간 피드백 기반 강화학습(RLHF)이 쓰일 수 있다. 사람이 여러 답변의 순위를 매기고, 별도의 보상 모델이 그 선호를 흉내 내 점수를 준다. 답변 모델은 그 점수가 높아지도록 학습한다. 사람이 매번 새 답변을 작성하는 대신 후보들을 비교할 수 있다는 장점이 있다.
그러나 보상 모델은 인간 판단의 불완전한 모사다. 카파시는 학습을 오래 밀어붙이면 답변 모델이 실제로 좋은 답을 만드는 대신 보상 모델만 높은 점수를 주는 엉뚱한 출력을 찾아낼 수 있다고 지적한다. 정답을 확인할 수 있는 수학 문제와 달리, 보상 점수 자체를 속일 여지가 있다는 뜻이다. 따라서 그는 이런 방식의 강화학습과 검증 가능한 정답을 바탕으로 긴 시간 반복하는 강화학습의 효과를 구분한다.
카파시가 제시한 모델의 모습은 능력이 고르지 않은 도구다. 복잡한 문제를 풀면서도 단순한 비교나 글자 세기에서 틀릴 수 있고, 검색과 계산 도구를 써도 결과를 확인할 필요가 있다. 장시간 작업하는 에이전트와 더 긴 멀티모달 맥락을 전망하면서도, 현재 모델의 오류와 유한한 맥락 창을 그 발전의 제약으로 남겨둔다.
댓글 0
첫 댓글을 남겨 주세요.