핵심 요약

  • 대규모 언어모델은 방대한 텍스트로 다음 단어를 예측하도록 학습한다. 학습된 매개변수를 실행하는 일보다 그 매개변수를 얻는 학습 과정에 훨씬 많은 자원이 든다.
  • 인터넷 문서를 이어 쓰는 기본 모델은 고품질 질문·답변으로 미세조정해야 대화형 조수에 가까워진다. 사람의 답변 비교를 추가 학습에 활용할 수도 있다.
  • 모델은 검색, 계산기, 코드 실행 같은 도구를 사용해 작업을 수행한다. 다만 그 결과와 모델이 만든 추정은 확인된 사실과 구분해야 한다.
  • 카파시는 긴 사고 과정과 자기 개선을 연구 방향으로 제시하면서도, 일반적인 언어 작업에는 바둑의 승패처럼 명확한 평가 기준이 없다고 짚었다.
  • 탈옥, 프롬프트 인젝션, 학습 데이터 오염은 서로 다른 경로로 모델의 행동을 바꿀 수 있다.

다음 단어 예측으로 얻는 모델

카파시는 대규모 언어모델을 매개변수 파일과 이를 실행하는 코드로 설명한다. 강연에서 든 메타의 Llama 2 70B는 매개변수가 700억 개다. 각 매개변수를 2바이트로 저장하면 파일 크기는 약 140GB가 된다. 카파시에 따르면 신경망 구조를 실행하는 코드는 비교적 짧게 작성할 수 있지만, 매개변수를 얻는 학습에는 훨씬 큰 비용이 든다.

그가 제시한 Llama 2 70B의 학습 규모는 텍스트 약 10TB, GPU 약 6,000개, 약 12일, 비용 약 200만 달러다. 그는 이를 인터넷 텍스트를 매개변수로 압축하는 과정에 비유했다. 다만 원문을 그대로 복원하는 압축은 아니다. 모델은 앞선 단어를 보고 다음 단어를 예측하도록 훈련되며, 그 과정에서 텍스트에 담긴 지식과 형식을 일부 익힌다.

학습된 기본 모델에 앞부분을 주고 예측한 단어를 계속 이어 붙이면 웹 문서처럼 보이는 글이 나온다. 카파시가 보여준 상품 소개 형태의 출력에는 그럴듯한 ISBN도 들어 있었지만, 그는 그 번호가 실제로 존재할 가능성은 낮다고 봤다. 반면 물고기에 관한 생성 문장은 원문의 문장을 그대로 반복하지 않으면서도 대체로 맞는 정보를 담고 있었다. 어느 부분이 기억된 내용이고 어느 부분이 잘못 만들어진 내용인지 출력만으로 확신하기 어렵다는 것이 그의 설명이다.

문서 생성기에서 대화형 조수로

사전학습을 마친 기본 모델은 질문을 받아도 답변 대신 질문이 이어지는 문서처럼 출력할 수 있다. 대화형 조수를 만들기 위해서는 학습 자료를 바꿔 다시 훈련하는 미세조정이 필요하다. 사람들은 지침에 따라 질문과 바람직한 답변을 작성하고, 모델은 이런 대화의 형식을 학습한다. 카파시는 방대한 인터넷 텍스트를 쓰는 첫 단계와 달리 이 단계에서는 자료의 양보다 품질이 중요하다고 설명했다.

운영 중 잘못된 답변이 발견되면 사람이 바람직한 답변을 작성해 다음 미세조정 자료에 넣을 수 있다. 답변을 처음부터 쓰기보다 여러 후보 중 나은 것을 고르기 쉬운 경우에는 사람의 비교 결과를 추가 학습에 활용한다. 카파시는 OpenAI에서 이 선택적 단계를 인간 피드백을 통한 강화학습이라고 부른다고 설명했다. 답변 초안을 만들거나 점검하는 데 모델을 사용하고 사람이 감독하는 방식도 소개했다.

카파시에 따르면 신경망의 수학적 연산과 매개변수 조정 방법은 알려져 있지만, 수많은 매개변수가 협력해 개별 답변을 만드는 방식은 충분히 이해되지 않았다. 따라서 다양한 입력에 대한 실제 출력을 살피는 평가가 중요하다.

규모의 효과와 도구 사용

카파시는 매개변수 수와 학습 텍스트의 양으로 다음 단어 예측 성능의 변화를 상당히 잘 예측할 수 있다고 설명했다. 강연 당시 관찰에서는 두 규모를 키울수록 이 지표가 개선되는 추세가 뚜렷했다. 그는 이 지표의 개선이 여러 실제 평가 결과와도 연관된다고 봤다. 다만 그가 직접 구분했듯 다음 단어 예측의 정확도 자체가 사용자가 원하는 최종 성능은 아니다.

모델의 능력은 내부에서 문장을 생성하는 데만 달려 있지 않다. 카파시는 Scale AI의 투자 라운드를 조사하는 예시를 통해 검색으로 자료를 찾고, 계산기로 누락된 기업가치를 추정하고, 파이썬 코드로 그래프를 그리는 과정을 보여줬다. 검색으로 찾은 금액과 계산으로 추정한 기업가치는 성격이 다르다. 그래프의 추세선을 먼 시점까지 연장해 얻은 값 역시 확인된 기업가치가 아니라 그 분석 방식의 결과다.

강연에는 손으로 그린 웹사이트 구상을 이미지로 입력해 작동하는 코드를 만드는 사례와 음성으로 대화하는 사례도 등장한다. 카파시는 텍스트 외에 이미지를 보고 만들거나 소리를 듣고 말하는 기능을 모델의 발전 방향으로 설명했다.

더 오래 생각하고 특정 작업에 맞추기

카파시는 강연 당시의 언어모델을 입력 뒤에 다음 단어를 차례로 생성하는 방식으로 설명하며, 답변에 더 많은 시간을 써서 정확도를 높이는 연구에 관심을 보였다. 문제의 여러 가능성을 검토하고 답을 고쳐 나가는 능력은 그가 제시한 연구 과제이지, 당시 모델이 이미 갖췄다고 주장한 기능은 아니다.

그는 자기 개선의 비교 대상으로 알파고를 들었다. 바둑은 승패라는 자동 평가 기준이 있어 수많은 대국의 결과로 학습할 수 있다. 반면 언어 작업은 종류가 다양하고 결과의 좋고 나쁨을 빠르고 일관되게 판정하기 어렵다. 카파시는 명확한 평가 기준을 마련할 수 있는 좁은 영역에서는 자기 개선이 가능할 수 있지만, 일반적인 언어 작업으로 넓히는 방법은 열린 문제라고 봤다.

특정 작업에 맞춘 조정도 또 다른 방향이다. 강연에서 소개한 방식은 맞춤 지침을 주거나 파일을 올려 답변할 때 그 내용을 참조하게 하는 것이다. 카파시는 향후 사용자 자료로 미세조정하는 방식도 가능성으로 언급했다.

세 가지 보안 문제

카파시는 탈옥을 모델의 거절 행동을 우회하도록 요청을 꾸미는 공격으로 소개했다. 역할극으로 유해한 요청을 감싸거나, 요청을 다른 방식으로 인코딩하거나, 최적화한 문자열·이미지 무늬를 덧붙이는 사례가 등장한다. 그는 이미지 입력 같은 새 기능도 공격 경로가 될 수 있다고 설명했다.

프롬프트 인젝션은 모델이 읽는 이미지, 웹페이지, 문서 속 지시를 원래 사용자의 지시처럼 따르게 만드는 공격이다. 강연에는 웹 검색 결과에 숨긴 문구로 사기 링크를 답변에 넣게 하는 사례가 나온다. 공유된 문서의 지시를 이용해 개인 정보를 빼내려는 시도도 소개했는데, 카파시는 임의의 이미지 주소를 통한 유출은 보안 정책에 막혔고 공격자가 다른 경로를 이용했다고 설명했다.

데이터 오염은 학습 자료에 공격자가 만든 예시를 넣어 특정 문구가 등장할 때 모델의 행동을 바꾸는 방식이다. 카파시가 소개한 연구는 미세조정 자료의 일부를 통제했을 때 특정 문구가 여러 작업의 예측을 망가뜨릴 수 있음을 보였다. 그는 같은 방식이 사전학습에서도 설득력 있게 입증된 사례는 알지 못한다고 선을 그었다. 소개된 공격에는 방어책이 적용돼 강연 당시의 사례가 더는 작동하지 않을 수도 있다고 덧붙였다.

결론

카파시의 강연은 언어모델을 대규모 텍스트 학습으로 얻은 예측 모델에서 출발해, 대화 학습과 도구 사용으로 작업 범위를 넓히는 체계로 설명한다. 동시에 생성 결과의 불확실성, 일반적인 자기 개선의 평가 문제, 외부 자료를 읽을 때 생기는 보안 문제를 그 능력과 함께 살펴야 한다고 제시한다.