핵심 요약

  • 제리 트워렉은 모델 평가 점수가 높아져도 복잡한 실제 업무를 모두 해결하지 못한 경험을 바탕으로, 사용 중에도 학습하는 모델이 필요하다고 주장했다.
  • 그는 현재의 문맥 내 학습은 담을 수 있는 정보가 제한되고, 지속적인 미세조정은 이전에 배운 것을 잊거나 데이터를 비효율적으로 쓰는 문제가 있다고 봤다.
  • 로한 아닐은 한 번에 토큰 하나씩 생성해 추론을 이어가는 방식의 계산 비용을 지적하며, 모델 구조와 학습 방법, 하드웨어 실행을 함께 살펴야 한다고 말했다.
  • 두 사람이 구상하는 코어 오토메이션은 연구자의 실험 속도를 높이는 자동화된 연구실이다. 초기 과제 가운데 하나는 GPU에서 모델 연산을 실행하는 커널의 제작을 자동화하는 것이다.

높은 평가 점수와 실제 업무 사이의 간극

트워렉은 OpenAI에서 강화학습을 대규모로 확대할 당시 이를 범용 인공지능으로 가는 결정적인 단계로 여겼다고 회고했다. 2024년에는 2025년에 그 목표에 이를 것이라고 예상할 정도였다. 이후 모델의 평가 점수는 계속 올랐지만, 실제 업무가 모두 해결되지는 않았다고 말했다.

그가 짚은 문제는 학습 과제와 평가 과제가 서로 닮아 있는 반면, 현실의 업무는 훨씬 복잡하고 다양하다는 점이다. 연구실에서 준비한 어려운 과제를 충분히 학습시켜도 실제 사용자가 마주치는 일을 모두 포괄하지 못한다는 것이다. 그는 이를 해결하려면 배포된 모델이 사용자의 데이터와 업무를 접하며 학습해야 한다고 주장했다.

현재의 대안에도 한계가 있다고 봤다. 문맥 내 학습은 대화나 작업 기록을 입력에 넣어 모델이 참고하게 하는 방식이다. 이전 지식을 잊는 문제는 상대적으로 적지만 담을 수 있는 양이 제한된다. 트워렉은 자신이 Codex를 사용할 때 대략 20분이 지나면 문맥을 압축해야 하는 경험을 예로 들었다. 반대로 모델을 계속 미세조정하면 이전에 배운 것을 잊는 현상과 낮은 데이터 효율에 부딪힌다고 설명했다. 그의 목표는 더 긴 기간에 걸친 학습을 모델 구조 자체에서 가능하게 하는 방법을 찾는 것이다.

트랜스포머를 바꾸려는 이유

트워렉은 트랜스포머의 성과를 먼저 이해해야 다음 구조의 목표도 정할 수 있다고 말했다. 그의 설명에 따르면 트랜스포머는 대규모 학습에 적합했을 뿐 아니라, 학습 비용에 비해 제품으로 창출할 수 있는 가치가 커서 산업적 확장이 가능했다. 그는 다른 구조도 규모를 키울 수는 있지만 같은 경제성을 얻는다는 보장은 없다고 봤다.

그가 제시한 한계는 변화에 대한 적응이다. 학습에 포함된 지식과 업무는 모델에 반영할 수 있지만, 새로운 사건·도구·코드베이스가 등장하면 그 가치가 줄어들 수 있다. 실패 사례를 다시 학습 데이터에 넣는 방식도 가능하다. 다만 이 과정에서는 연구실이 모델을 재학습해야 한다.

아닐은 계산을 쓰는 방식에도 주목했다. 그에 따르면 학습된 트랜스포머의 층수에는 한계가 있고, 추론 과정을 토큰으로 길게 생성하면 계산의 깊이를 늘릴 수 있다. 그러나 토큰을 하나씩 생성해야 해 비용과 지연이 커진다. 그는 사전학습과 강화학습을 따로 최적화하는 관행까지 함께 검토해야 더 효율적인 구조를 찾을 수 있다고 말했다.

강화학습만으로는 부족하다는 판단

트워렉은 강화학습을 시도한 결과를 바탕으로 행동을 개선하는 한 가지 학습 방식으로 설명했다. 그는 경험에서 배우는 방법이 강화학습 하나로 끝나지는 않는다고 봤다. 공을 반복해서 차며 동작을 고치는 일과 어려운 수학 개념을 읽고 머릿속에서 연결하는 일은 모두 경험을 통한 학습이지만 과정은 다르다는 예를 들었다.

아닐은 학습 효율을 평가하는 기준부터 바꿔야 한다고 말했다. 사전학습에서 다음 토큰을 얼마나 잘 예측하는지만 보면, 이후 강화학습을 거친 모델이 실제 업무에서 내는 결과를 충분히 설명하지 못한다는 것이다. 그는 사전학습과 강화학습을 처음부터 끝까지 함께 고려할 때 개선 여지가 있다고 봤다. 다만 두 과정은 계산 방식이 달라 단순히 결합하기 어렵고, 신제품 출시 경쟁 속에서 장기 연구에 자원을 배정하기도 어렵다고 덧붙였다.

모델 구조와 최적화 방법도 서로 영향을 준다. 아닐은 더 강한 최적화 방법이라면 학습시키기 어려운 구조를 사용할 수 있고, 어떤 최적화 방법을 선택하느냐에 따라 발견할 수 있는 구조도 달라진다고 설명했다. 이론적으로 좋은 구조라도 실제 하드웨어에서 효율적으로 실행되지 않으면 쓸모가 제한된다는 판단이다.

연구 자동화의 첫 과제, 커널 제작

코어 오토메이션이 말하는 연구 자동화는 당장 연구자를 없애는 구상이 아니다. 트워렉은 한 사람이 주어진 시간에 더 많은 아이디어를 시험하고 결과를 확인할 수 있게 하는 데 초점을 맞췄다. 그는 하루에 구조 실험 하나만 실행해도 높은 반복 속도이며, 장기적으로 그 수를 더 늘리고 싶다고 말했다. 이는 현재 달성한 실적이 아니라 연구실이 추구하는 방향이다.

아닐이 제시한 가까운 과제는 커널 제작이다. 커널은 모델의 연산을 GPU에서 효율적으로 실행하는 코드다. 새로운 모델 구조나 최적화 방법을 시험하려면 아이디어를 실제 장비에서 빠르게 실행할 수 있어야 한다. 아닐은 앞으로 6개월의 계획을 설명하며, 아이디어에서 GPU의 높은 연산 성능을 활용하는 구현까지 걸리는 시간을 줄이고 싶다고 말했다.

그는 GPU 커뮤니티와 함께 진행한 QR 연산 커널 대회를 사례로 들었다. 그의 설명에 따르면 사람과 탐색 과정을 결합하면 기준 구현보다 약 7배 빠른 결과를 얻을 수 있었고, 약 4주 동안 코딩 에이전트에 약 10만 달러를 쓰며 최고 수준의 전문가가 참여한 결과는 약 60배 빠른 수준에 도달했다. 아닐은 현 모델만으로는 그 수준의 커널을 만들기 어렵다고 평가했다. 한 연산에서의 성능 차이가 새로운 학습 방법을 시험할 수 있는 범위까지 바꿀 수 있다는 것이 그의 주장이다.

성공을 판단할 기준

트워렉이 찾는 것은 단순히 평가 그래프가 개선된 구조가 아니다. 그는 모델이 실제 사용 중 장기간에 걸쳐 의미 있게 적응하는지, 코어 오토메이션 연구자들의 일을 날마다 더 잘 수행하는지를 보겠다고 말했다. 자신이 생각하는 범용 인공지능의 기준도 인간의 개입 없이 모델이 스스로 개선할 수 있는가에 가깝다. 그는 현재 사람과 언어 모델의 협업은 유용하지만, 사람을 완전히 빼고 돌아가는 업무는 찾기 어렵다고 평가했다.

두 사람의 구상은 아직 연구 목표다. 대담에서 제시한 성능 수치는 커널 대회의 특정 연산에 관한 사례이며, 지속적으로 학습하는 새 모델 구조를 이미 찾았다는 증거는 아니다. 이 연구실이 확인하려는 것은 더 빠른 실험을 통해 실제 업무에서 학습하고 적응하는 시스템에 도달할 수 있는가다.