핵심 요약
- 얀 르쿤은 대규모 언어모델(LLM)이 유용한 응용 생태계를 만들 수 있지만, 세계를 이해하고 기억·추론·계획하는 능력은 제한적이라고 주장했다.
- 그가 제안한 JEPA는 영상의 모든 세부 장면을 재현하는 대신, 예측할 수 있는 부분의 추상적 표현을 학습한다.
- 르쿤은 오픈 모델이 다양한 언어와 용도에 맞춘 AI를 가능하게 한다고 봤다. 메타는 기반 모델을 공개하면서 광고나 기업 고객 대상 서비스로 수익을 얻을 수 있다는 설명이다.
- 그는 인간 수준의 AI가 한순간에 등장하기보다 여러 미해결 기술을 거쳐 점진적으로 발전할 것으로 전망했다.
언어로 배우는 것의 한계
르쿤은 지능에 물리 세계의 이해, 지속적인 기억, 추론, 계획이 필요하다고 말했다. 그의 평가로는 당시의 LLM이 이런 능력을 갖췄더라도 매우 초보적인 수준이다. 다만 LLM의 활용 가치를 부정하지는 않았다. 문제는 현재 방식의 언어모델만으로 인간 수준의 지능에 도달할 수 있느냐는 것이다.
그는 아이가 관찰과 상호작용으로 배우는 정보가 언어로 접하는 정보보다 훨씬 풍부하다고 설명했다. 체스나 수학 문제를 푸는 컴퓨터가 어린이가 익히는 식탁 정리나 식기세척기 채우기를 해내지 못하는 사례도 들었다. 렉스 프리드먼은 언어가 이미 압축된 지식을 담고 있으므로 언어만으로 세계 모델을 만들 가능성을 제기했다. 르쿤은 이를 논쟁적인 문제로 인정하면서도, 실제 또는 가상 환경에 기반한 경험이 필요하다는 입장을 밝혔다.
영상의 모든 픽셀을 예측하지 않는 방법
세계 모델은 현재 상태와 가능한 행동을 바탕으로 다음 상태를 예측하는 모델이다. 르쿤에 따르면 영상에서 이를 배우려 할 때 모든 픽셀을 정확히 예측하는 접근은 어렵다. 카메라가 움직인 뒤 드러날 벽의 그림이나 카펫의 질감처럼 알 수 없는 세부 사항까지 맞혀야 하기 때문이다. 그는 훼손된 이미지나 영상을 원래대로 복원하도록 학습시킨 방식도 일반적인 시각 표현을 얻는 데 성과가 좋지 않았다고 설명했다.
그가 소개한 JEPA(공동 임베딩 예측 구조)는 원본과 일부가 가려진 입력을 각각 추상적 표현으로 바꾼 뒤, 가려진 입력의 표현에서 원본의 표현을 예측한다. 예컨대 주행 영상에서 바람에 흔들리는 나뭇잎의 픽셀 하나하나보다 행동을 계획하는 데 필요한 정보를 남기려는 접근이다. 르쿤은 이를 지능 시스템의 한 구성 요소이자 첫 단계로 제시했다.
영상에 적용한 V-JEPA에 대해서는 학습한 표현을 이용해 영상 속 행동을 분류할 수 있다고 말했다. 물체가 갑자기 사라지는 등 물리적으로 불가능한 영상을 구별할 가능성은 예비 결과로 소개했다. 이 성과가 곧 자율주행에 필요한 세계 모델의 완성을 뜻하지는 않는다고도 선을 그었다.
행동을 계획하려면 남은 문제
르쿤의 구상에서는 세계 모델에 행동 정보를 더해 그 행동 뒤의 상태를 예측한다. 여러 행동의 예상 결과를 비교하면 목표에 맞는 순서를 고를 수 있다. 그러나 복잡한 일에는 큰 목표를 작은 목표로 나누는 계층적 계획도 필요하다. 그는 뉴욕에서 파리로 가려면 공항 이동과 항공편 탑승을 계획하고, 이동 중 달라지는 상황에 맞춰 다시 계획해야 한다는 예를 들었다.
르쿤은 LLM도 학습 과정에서 접한 것과 비슷한 상황이라면 말로 표현할 수 있는 수준의 계획을 제시할 수 있다고 인정했다. 다만 처음 겪는 상황이나 일어서기 같은 세밀한 신체 동작까지 다루는 능력은 별개라고 봤다. 그는 AI가 계획에 필요한 여러 추상화 수준을 스스로 학습하는 방법은 아직 알려지지 않았다고 말했다.
메타가 기반 모델을 공개하는 이유
르쿤은 AI가 정보를 전달하는 창구가 될수록 소수 기업이 기반 모델을 통제하는 일을 우려했다. 공개된 모델을 각 조직이 자체 데이터와 목적에 맞게 조정하면 언어·문화·전문 분야별로 다양한 시스템을 만들 수 있다는 주장이다. 그는 인도의 22개 공용어를 지원하도록 Llama 2를 조정하려는 프로젝트와 세네갈 현지 언어로 의료 정보를 제공하려는 스타트업 구상을 사례로 들었다. 두 사례는 그가 소개한 프로젝트와 의도로, 완성된 서비스의 성과를 뜻하지 않는다.
사업 측면에서 르쿤은 메타가 이용자나 기업에 제공하는 서비스로 수익을 얻을 수 있다고 설명했다. 왓츠앱에서 소규모 피자 가게의 주문 대화를 돕는 AI는 그가 든 기업 유료 서비스의 예시다. 그는 기반 모델을 공개하면 외부 개발자가 응용 서비스를 만들고 개선안을 제시할 수 있으며, 유용한 응용 서비스는 메타가 구매할 수도 있다고 말했다. 이는 오픈 모델과 서비스 수익이 양립할 수 있다는 그의 판단이다.
인간 수준 AI와 로봇의 시간표
르쿤은 대담 당시 Llama의 향후 버전이 더 크고 개선되며 여러 형태의 데이터를 다룰 수 있다고 내다봤다. 영상으로 세계를 배우고 계획하는 능력이 제품에 언제 들어갈지는 알 수 없으며, 그 전에 연구상의 돌파구가 필요하다고 말했다.
그는 인간 수준 AI 역시 단일한 발명으로 등장하지 않을 것으로 봤다. 세계 모델, 기억, 추론, 계획을 각각 발전시키고 하나의 시스템으로 결합해야 하며, 계층적 계획에도 미해결 문제가 남아 있다는 이유다. 로봇에 대해서도 냉장고를 열고 학습한 물체를 집는 시연과 식탁 정리를 해내는 범용 가정용 로봇 사이에는 거리가 있다고 설명했다.
르쿤의 주장은 현재 LLM의 쓰임을 인정하면서, 물리 세계를 이해하고 새로운 상황에서 행동하려면 추가 연구가 필요하다는 데 모인다. JEPA는 그가 제시한 연구 방향이며, 대담에서 소개한 성과와 남은 과제는 구분해야 한다.
댓글 0
첫 댓글을 남겨 주세요.