# AI 모델은 왜 학습을 멈추는가: 리치 서튼과 쿠람 자베드의 지속 학습 구상

> 2026-08-18 · Sequoia Capital · 큐레이션 김태우
> https://challengekim.com/insights/ai-모델은-왜-학습을-멈추는가-리치-서튼과-쿠람-자베드의-지속-학습-구상
> 원문: https://www.youtube.com/watch?v=xH7U7w9Qzlo

## 핵심 요약

- 리치 서튼은 AI가 학습을 별도의 단계로 취급하는 관행을 문제 삼는다. 그의 관점에서 지능은 행동하고 경험하면서 계속 배우는 과정이다.
- 서튼과 쿠람 자베드는 대규모 언어 모델의 성과를 인정하면서도, 인터넷 자료와 사람이 설계한 합성 데이터만으로는 복잡한 현실을 충분히 다룰 수 없다고 주장한다.
- 두 사람은 모델이 자신의 경험으로 세상에 대한 모형을 만들고, 그 모형이 틀렸을 때 스스로 고치며 계획할 수 있어야 한다고 본다.
- 이들이 풀려는 핵심 과제는 새 경험을 학습하면서 기존 지식을 잃지 않는 **지속 심층학습**과, 경험에 맞는 **추상화**를 스스로 형성하는 능력이다.

## ‘쓴 교훈’과 언어 모델의 두 얼굴

서튼이 말하는 ‘쓴 교훈’은 사람이 가진 분야별 지식을 시스템에 많이 넣는 데 집중하기보다, 계산량이 늘어날수록 성능을 높일 수 있는 탐색과 학습 방법에 집중해야 한다는 주장이다. 정교한 알고리즘이 불필요하다는 뜻은 아니다. 서튼은 계산과 함께 확장되는 정교한 알고리즘이 필요하다고 설명한다.

그는 대규모 언어 모델을 이 교훈의 긍정적 사례이자 한계를 드러내는 사례로 본다. 언어 모델은 인터넷의 방대한 자료를 활용하며 계산 규모를 키워 큰 성과를 냈다. 그러나 인터넷에 저장된 정보는 유한하고, 서튼의 관점에서 현실 세계는 그보다 훨씬 크다. 그는 언어 모델의 언어 사용 능력을 중요한 과학적 돌파구로 평가하면서도, 언어를 능숙하게 다루는 능력이 지능 전체는 아니라고 선을 그었다.

## 합성 데이터가 풀지 못하는 문제

자베드는 합성 데이터의 양보다 **무엇을 생성할지 누가 결정하는가**에 주목한다. 프로그램으로 데이터를 대량 생산할 수 있어도, 과제에 적합한 데이터를 설계하려면 사람의 전문성이 필요하다는 것이다. 그는 박쥐처럼 반향을 이용해 이동하는 드론을 예로 들었다. 그 드론을 위한 합성 데이터를 만들려면 먼저 해당 문제를 이해하는 전문가가 필요할 수 있다.

서튼은 시뮬레이션이 실제 세계의 일부만 담는다고 지적한다. 로봇의 모터와 마찰, 다른 사람의 생각처럼 실제 상호작용에 영향을 주는 요소를 사람이 만든 작은 세계에 모두 담을 수는 없다는 주장이다. 그가 설명한 ‘큰 세계 가설’은 세계가 어느 한 에이전트의 모형보다 훨씬 복잡하므로, 에이전트가 자신이 처한 환경에 맞춰 불완전한 근사를 계속 수정해야 한다는 관점이다.

두 사람이 시뮬레이션의 가치를 부정하는 것은 아니다. 자베드는 에이전트가 자신의 경험으로 시뮬레이션에 쓸 모형을 학습하고, 실제 결과와 맞지 않으면 고치는 방식을 제안한다. 자율주행용 시뮬레이션을 사람이 반복해서 보정하는 사례에 대해서도, 그 보정 과정에서 사람의 개입이 계속 필요하다는 점을 문제로 짚었다.

## 배포 후 학습과 기존 지식의 손실

서튼과 자베드가 강조하는 차이는 모델을 배포한 뒤에도 학습할 수 있느냐에 있다. 대화 중 문맥이나 저장된 기억이 바뀌면 모델의 다음 응답은 달라질 수 있다. 자베드는 이를 모델의 가중치, 즉 학습된 내부 값 자체가 새로운 경험으로 갱신되는 것과 구분했다. 사전 학습과 사후 학습을 많이 하는 것 자체보다, 사용 중인 모델이 이후의 경험에서 배우지 못하는 상태가 핵심 문제라는 설명이다.

자베드는 Cursor의 일부 모델을 가중치가 갱신되는 사례로 들었다. 다만 그가 이해하기로는 여러 사용자의 데이터를 큰 묶음으로 모아 갱신하는 방식이다. 이는 한 사용자의 모델이 그 사람의 경험에서 바로 배우는 문제와 다르다. 데이터가 한 건씩 들어오는 환경에서 새 사례마다 모델 전체를 단순하게 갱신하면, 기존 지식이 손상되는 **파국적 망각**이 발생할 수 있다고 그는 설명했다.

## 지속 학습에 필요한 알고리즘

서튼은 해법의 한 요소로 가중치마다 갱신 폭을 달리하는 ‘단계 크기 최적화’를 제시한다. 새 사례를 배울 때 대부분의 가중치는 조금만 움직이고, 필요한 부분은 더 크게 바뀌도록 학습해야 한다는 구상이다.

또 다른 요소는 새로운 특징이나 신경망 단위를 만들어 시험하는 방식이다. 서튼이 설명한 ‘지속 역전파’는 기존 역전파 학습을 이어가면서 무작위로 초기화한 새 단위를 조금씩 투입한다. 그는 이처럼 새로운 후보를 만들고 평가하는 과정이 장기간 학습에 필요하다고 본다. 두 방법을 잘 결합하면 지속 심층학습을 크게 개선할 수 있다는 것이 그의 전망이며, 완성된 해법이라고 말한 것은 아니다.

자베드는 이 접근을 기존 모델에 곧바로 덧붙이기 어렵다고 봤다. 새 알고리즘은 지식을 배우는 동시에 앞으로 **어떻게 배울지도** 학습해야 하므로, 처음부터 그 방식으로 모델을 훈련해야 한다는 설명이다.

## 경험에서 추상화를 만들고 계획하기

두 사람의 목표는 새 정보를 잊지 않고 저장하는 데서 끝나지 않는다. 에이전트가 경험에서 중요한 개념을 스스로 만들고, 그것을 바탕으로 세계의 모형을 학습해 계획해야 한다는 것이다. 자베드는 운동선수가 특정 동작을 이해하고 다루기 위해 자신만의 세부 개념을 만드는 사례를 들었다. 어떤 개념이 유용한지는 에이전트가 놓인 세계와 과제에 따라 달라진다.

서튼은 알파고 같은 게임에서는 수가 어떻게 진행되는지 이미 알려져 있고, 수학 문제에서도 사용할 연산이 주어져 있다고 설명했다. 반면 스스로 발견한 추상화로 세계의 모형을 학습한 다음 그 모형으로 계획하는 능력은 아직 뚜렷하게 구현되지 않았다는 것이 그의 판단이다. 자베드 역시 기존 문화와 지식에서 배우는 일의 가치를 인정하면서, 새로운 관점을 찾아야 할 때는 에이전트 자신의 경험을 통해 더 나은 개념을 검증해야 한다고 말했다.

## 오크랩이 겨냥한 목표

서튼과 자베드가 세운 오크랩의 목표는 지속 학습과 추상화 형성을 함께 구현하는 것이다. 서튼은 작은 감각·운동 수준의 지식부터 큰 계획에 쓰이는 지식까지 일관되게 다루고, 계속 바뀌면서도 스스로 일관성을 유지하는 시스템을 가장 큰 포부로 설명했다.

이는 현재 달성한 성과가 아니라 연구 목표다. 두 사람은 배포 후 한 줄기 경험에서 배우는 일반적인 알고리즘과, 스스로 만든 모형으로 계획하는 능력에 아직 해결할 문제가 남아 있다고 밝혔다. 대담의 핵심은 학습을 끝낸 모델에 지식을 더 넣는 방법보다, 모델이 현실과 상호작용하며 배운 내용을 오래 유지하고 수정하는 방법에 있다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=xH7U7w9Qzlo)
