핵심 요약
- AI 연구소들은 다양한 환경에서 검증 가능한 과제를 대규모로 학습시키면, 낯선 문제에도 오래 대응하는 범용 에이전트를 만들 수 있다고 기대한다.
- 파텔은 과제의 성패를 확인할 수 있어도 같은 출발점에서 수많은 시도를 반복할 수 없다면 학습이 어렵다고 지적한다.
- 실제 업무에서 얻은 경험을 긴 대화 맥락에만 보관하면 다른 세션이나 사용자에게 축적하기 어렵다. 이를 모델의 가중치에 반영하려면 적은 데이터로 배우는 능력이 필요하다.
- 파텔은 세션에서 배운 내용을 가중치에 압축하는 자기 증류와, 자체 시뮬레이션에서 연습하는 ‘꿈꾸기’를 가능한 연구 방향으로 제시한다. 후자는 특히 추측적인 구상이다.
검증 가능한 과제를 늘리면 충분한가
파텔이 설명하는 AI 연구소들의 큰 가설은 수천 가지 강화학습 환경에서 수백만 개의 검증 가능한 과제를 수행하도록 훈련하면 범용 문제 해결 능력이 생긴다는 것이다. 그렇게 만들어진 에이전트라면 오류와 모호함 속에서도 몇 주에 걸친 개방형 과제를 진전시킬 수 있다는 기대다. 강화학습은 수행 결과를 바탕으로 모델을 개선하는 방식이다.
이 접근을 지지하는 쪽은 훈련 중 데이터 효율이 낮더라도 그 비용을 이후 수십억 건의 사용 세션에 나눠 부담할 수 있다고 본다. 실제로 중요한 것은 사용 중 모델이 얼마나 적은 경험으로 새로운 문제에 적응하느냐는 주장이다. 파텔도 강화학습이 늘면서 코딩 에이전트가 더 긴 시간에 걸친 과제를 해결하게 됐다고 인정한다. 배포 후 배운 내용으로 모델 가중치를 갱신하는 지속 학습 역시 긴 맥락 안에서 배우는 능력이 충분히 좋아지면 필요 없을 수 있다는 반론을 소개한다.
컴퓨터 사용이 보여주는 반복 훈련의 조건
파텔은 컴퓨터 사용의 성패도 확인할 수 있는데 왜 코딩이나 수학보다 발전이 느린지 묻는다. 사전 학습에 쓰이는 양질의 멀티모달 데이터가 적다는 점과 함께, 훈련을 반복하기 어려운 환경을 이유로 든다. 그에 따르면 성패를 검증할 수 있다는 것만으로는 부족하다. 같은 시작 상태를 재현하는 시뮬레이터에서 많은 시도를 병렬로 실행할 수 있어야 한다.
코딩 과제라면 빠진 기능이 있는 저장소를 동일하게 복제해 여러 에이전트에 줄 수 있다. 반면 실제 쇼핑 사이트에서 같은 결제 과정을 수천 번 시도하기는 어렵다. 파텔은 여러 앱과 웹사이트의 복제 환경을 만드는 방법을 제시하지만, 현재로서는 손이 많이 들고 확장하기 어렵다고 본다. AI가 그런 환경을 높은 충실도로 직접 만들 수 있게 되면 컴퓨터 사용의 발전도 빨라질 수 있다는 전망이다.
사업을 처음부터 만들거나 소송에서 이기는 일은 더 까다롭다. 결과가 나오기까지 몇 달 또는 몇 년의 현실 세계 활동이 필요할 수 있고, 출발점을 되돌려 행동만 조금 바꾼 시도를 수천 번 반복할 수도 없다. 파텔의 논점은 이런 분야에서 드물고 모호한 경험으로부터 배우려면 훈련 단계에서도 높은 데이터 효율이 필요하다는 것이다.
긴 맥락과 현장 경험 사이의 간극
연구소들이 기대하는 또 다른 가능성은 재현 가능한 환경에서 배운 능력이 현실의 다른 문제로 넓게 일반화되는 것이다. 파텔은 이것을 아직 경험적으로 확인해야 할 문제로 둔다. 짧은 맥락에서 훈련한 모델을 긴 맥락에서 사용하면 성능이 떨어질 수 있다는 다리오의 설명을 근거로, 짧은 과제의 훈련이 긴 현실 과제로도 이어질지 의문을 제기한다. 다만 이는 그 발언에 대한 파텔 자신의 해석이다.
설령 모델이 한 세션에서 현장 지식을 익혀도 이를 가중치에 반영하지 못하면 배움은 세션과 함께 사라진다. 파텔은 한 연구소의 연산 자원 중 약 30~50%가 추론에 쓰이지만, 현재 그 연산이 모델 개선에 생산적으로 기여하지 않는다고 주장한다. 조직이 실제로 어떻게 일하고 모델이 어디서 실수하는지도 배포 중에 드러난다. 긴 맥락은 이런 정보를 세션 안에 담을 수 있지만, 사용자와 경험이 계속 늘어날 때 모든 내용을 그 방식으로 보관하는 것은 확장하기 어렵다는 판단이다.
가중치를 갱신하는 방법에도 문제가 있다. 파텔에 따르면 경사하강법을 통한 갱신은 많은 표본을 요구한다. 그가 든 온라인 학습 사례인 Cursor Tab은 하루 4억 건이 넘는 요청에서 사용자가 어떤 편집을 수락했는지라는 같은 목표를 학습한다. 반면 직무와 회사마다 다른 업무 지식을 한 사용자의 제한된 경험만으로 가중치에 새기는 능력은 아직 보지 못했다고 설명한다.
세션의 배움을 가중치로 압축하는 방법
파텔은 가능한 방법으로 온폴리시 자기 증류(OPSD)를 소개한다. 긴 세션을 거치며 맥락을 쌓은 모델을 교사로 삼고, 기본 모델이 실제 과제를 풀 때 교사와 비슷한 예측을 하도록 훈련하는 방식이다. 세션에서 얻은 경험을 가중치에 옮기는 것이 목적이다.
그가 제시한 장점은 두 가지다. 첫째, 과제 전체의 성패를 외부에서 검증하는 보상이 없어도, 맥락 안에서 적절한 것을 배운 교사 모델이 있다면 학습 신호를 만들 수 있다. 둘째, 과제 끝의 보상 하나에 의존하는 대신 교사와 학생의 토큰별 예측 차이를 활용할 수 있다. 파텔은 세션 기록의 모든 문장을 그대로 예측하도록 훈련하는 방식과도 구분한다. 업무 능력에 필요한 일부 지식만 압축해 기존 능력을 잊지 않도록 갱신하는 것이 목표라는 설명이다. 이 방법이 현실에서 지속 학습을 해결했다고 주장하는 것은 아니다.
자체 시뮬레이션에서 연습한다는 구상
파텔이 ‘꿈꾸기’라고 부르는 더 추측적인 구상은 모델이 현실의 시뮬레이션을 만들고 그 안에서 전략을 시험하는 것이다. 그는 EfficientZero가 실제 게임에서 한 단계 행동할 때 내부적으로 여러 시뮬레이션을 수행한 사례를 든다. 제한된 실제 경험으로도 더 많이 연습할 수 있다는 비유지만, 세계 전체를 시뮬레이션하는 일은 게임을 재현하는 것보다 훨씬 어렵다고 선을 긋는다.
파텔은 2027년이나 2028년의 한 시나리오로, 강화학습으로 낯선 과제에 착수할 능력을 얻은 에이전트가 현실에서 일주일 동안 일한 뒤 평가를 받고, 그 세션의 배움을 자기 증류나 시뮬레이션 등의 방법으로 가중치에 반영하는 과정을 그린다. 이는 이미 구현된 절차나 확정된 전망이 아니라 지속 학습이 가능해졌을 때의 가정이다.
검증 가능한 환경에서의 훈련은 에이전트를 현실 업무에 투입할 출발점이 될 수 있다. 파텔이 남긴 핵심 질문은 그다음에 얻는 드문 경험을 얼마나 효율적으로 배우고, 다음 세션에도 쓸 수 있는 지식으로 축적할 수 있느냐다.
댓글 0
첫 댓글을 남겨 주세요.