핵심 요약

  • 드웨시 파텔은 현재의 강화학습이 모델에 개별 기술을 미리 익히게 하는 방식이라며, 이를 인간처럼 일하면서 배우는 능력과 구분한다.
  • 브라우저나 엑셀 사용법을 학습시키는 일은 유용할 수 있다. 그러나 직장마다 다른 맥락과 매일 바뀌는 작은 과업까지 사전에 훈련시키기는 어렵다는 것이 그의 주장이다.
  • 파텔은 AI가 기업에 널리 도입되지 않은 이유를 보급 지연보다 능력의 한계에서 찾는다. 다만 AI의 발전 자체를 부정하지는 않는다.
  • 그는 경험을 통해 계속 학습하는 능력이 중요해질 것으로 보면서도, 그 능력이 처음 등장하자마자 완성되거나 한 기업에 압도적 우위를 줄 것이라고 예상하지 않는다.

기술을 미리 익히는 모델과 일하면서 배우는 모델

현재 AI 연구소들은 모델이 브라우저를 다루거나 엑셀로 재무 모델을 만드는 법을 익히도록 훈련하고 있다. 이때 쓰이는 방법 가운데 하나가 검증 가능한 결과에 따른 강화학습이다. 결과의 옳고 그름을 확인할 수 있는 과업으로 모델을 훈련하는 방식이다.

파텔은 인간처럼 학습하는 AI가 곧 나온다고 보면서 이런 훈련의 확대에도 낙관적인 입장을 취하는 데 의문을 제기한다. 모델이 가까운 시일 안에 스스로 일하며 기술을 배운다면 많은 기술을 미리 주입할 필요가 줄어든다. 반대로 그런 학습을 하지 못한다면 범용 인공지능(AGI)이 임박했다고 보기 어렵다는 논리다. 사람은 직장에서 쓸 수 있는 모든 소프트웨어를 입사 전에 하나씩 연습하지 않는다.

직장마다 다른 작은 과업

로봇을 예로 들면, 사람은 비교적 적은 연습으로 현재의 장비를 조작해 유용한 일을 할 수 있다. 파텔은 인간 같은 학습자가 있다면 로봇 활용의 상당 부분이 풀릴 것이라고 본다. 지금은 그런 학습자가 없기에 여러 집에서 접시를 집거나 빨래를 개는 동작을 거듭 연습시켜야 한다는 설명이다.

그가 들은 생물학 연구실의 사례도 같은 문제를 보여준다. 한 연구자는 실험용 슬라이드의 점이 실제로 대식세포인지 판단하는 일을 말했다. AI 연구자는 이를 영상 분류 문제로 보고 모델을 훈련할 수 있다고 답했다. 파텔은 해당 연구실의 슬라이드 제작 방식에 맞춘 판별기를 따로 만들고, 다음 연구실 고유의 작은 업무마다 또 훈련 절차를 만드는 방식이 전체적으로 생산적인지는 별개 문제라고 지적한다.

브라우저나 터미널처럼 널리 쓰이는 도구를 미리 익히는 데는 이점이 있다. 모델의 여러 복사본이 지식을 공유할 수도 있다. 그러나 파텔은 대부분의 업무에 회사와 상황에 고유한 기술이 필요하며, 현재 AI에는 이를 효율적이고 안정적으로 습득하는 방법이 부족하다고 주장한다. 필요한 것은 피드백과 직접 경험에서 배우고 새로운 상황에 적용하는 능력이다.

AI 연구자를 자동화하면 해결될까

반론도 있다. 지금의 강화학습을 통해 뛰어난 AI 연구자를 만들고, 그 복사본들이 경험 학습의 문제를 해결할 수 있다는 주장이다. 파텔은 어린이에게 있는 기본적인 학습 능력조차 갖추지 못한 연구자 모델이 오랫동안 풀리지 않은 학습 문제를 해결하리라는 전망을 설득력 없게 본다.

그는 연구소들이 연구 능력만이 아니라 발표 자료 제작 같은 경제적으로 유용한 개별 기술도 모델에 익히려 한다는 점을 든다. 이를 모델이 일터에서 충분히 일반화하고 학습하기 어려울 것으로 보는 접근의 단서로 해석한다. 이는 연구소의 의도를 확인한 사실이 아니라, 훈련 방향에 대한 파텔의 해석이다.

성능 향상과 경제적 가치 사이

파텔은 AI가 기업에서 더 널리 쓰이지 않는 이유가 단지 신기술의 보급에 시간이 걸리기 때문이라는 설명에 동의하지 않는다. 사람 수준으로 일할 수 있는 모델이라면 기존 회사 자료를 읽고 업무에 적응하거나 다른 AI 직원이 습득한 기술을 공유하기가 사람을 채용하는 것보다 쉬울 것이라는 주장이다. 그는 현재 모델의 경제적 활용 규모가 인간 지식 노동의 임금 규모와 크게 다른 점도 능력의 간극을 보여주는 근거로 제시한다.

그렇다고 지난 AI 발전을 낮게 평가하지는 않는다. 파텔은 과거에 오늘날의 모델을 보았다면 지식 노동의 절반을 자동화할 수 있으리라 확신했을 것이라고 말한다. 모델이 이해, 적은 사례로 배우기, 추론에서 발전했는데도 업무 전체를 대체하지 못한 경험은 노동에 필요한 능력을 이전보다 좁게 정의했음을 보여준다고 본다. 그는 2030년까지 계속 학습하는 능력이 크게 발전하고 모델 기업의 연매출이 수천억 달러에 이를 수 있다고 예상하면서도, 그때 모든 지식 노동이 자동화되지는 않을 것으로 전망한다. 이는 관측된 수치가 아니라 파텔의 예상이다.

계속 학습하는 AI의 발전 경로

파텔은 사전학습에서 계산량을 늘릴 때 성능이 개선되던 추세를, 검증 가능한 보상에 따른 강화학습의 미래에도 그대로 적용해서는 안 된다고 경계한다. 후자에는 그에 견줄 만한 공개 추세가 없다는 이유다. 그는 제한된 공개 자료를 분석해 한 차례의 큰 모델 발전에 해당하는 향상을 얻으려면 강화학습 계산량을 약 100만 배 늘려야 한다고 추정한 글도 언급한다. 이는 확정된 필요량이 아닌 해당 분석의 추정치다.

그가 더 주목하는 경로는 여러 AI가 서로 다른 일을 하며 얻은 경험을 공유 모델에 모으는 방식이다. 다만 계속 학습하는 기능이 처음 등장하는 시점과 사람이 일터에서 배우는 수준에 도달하는 시점은 다를 수 있다. 파텔은 초기 성과 이후에도 후자의 수준에 이르기까지 5~10년이 더 걸릴 수 있다고 예상한다. 첫 성과가 나오면 다른 연구소도 구현 방법을 파악해 재현하고 개선할 가능성이 있다고 본다.

결론

파텔의 핵심 주장은 현재 모델에 더 많은 기술을 미리 익히게 하는 일과, 낯선 업무를 경험하며 스스로 배우게 하는 일이 다르다는 것이다. 그는 후자가 경제 전반의 일을 맡는 AI에 필요하다고 보지만, 그 능력 역시 점진적으로 발전할 것으로 전망한다.