핵심 요약
- 드워케시 파텔은 AI가 세션마다 메모를 남기는 방식만으로는 인간처럼 업무 전체를 수행하기 어렵고, 경험을 모델에 축적해야 한다고 본다.
- 모델이 배포 후에도 계속 바뀐다면 출시 전 한 차례의 안전 평가와 고정된 모델을 전제로 한 정렬 연구를 재검토해야 한다는 주장이다.
- 실제 사용에서 배우는 모델은 사용자와 기업마다 달라질 수 있으며, 먼저 앞선 기업의 우위도 커질 수 있다.
- 경험이 쌓인 AI를 다른 제품으로 교체하기 어려워지면서 데이터 활용 조건과 추론 비용이 경쟁의 핵심이 될 수 있다.
메모를 넘어서 경험을 축적하는 AI
파텔은 처음 색소폰을 잡은 학생들이 연주에 실패할 때마다 다음 학생에게 메모만 남기는 상황을 예로 든다. 아무리 메모가 쌓여도 새 학생이 첫 시도부터 능숙하게 연주하기는 어렵다는 것이다. 그는 AI 역시 여러 일터에서 얻은 경험을 모델에 축적해야 인간처럼 업무 전체를 수행할 수 있다고 본다. 아래 전망은 그런 지속 학습이 실제로 가능해진다는 가정에서 출발한다.
안전 평가는 출시 이후에도 이어져야 한다
첫째, 학습을 마친 모델을 검사한 뒤 배포하는 방식의 안전 규제는 모델이 매일 업무 경험으로 개선된다면 충분하지 않을 수 있다. 파텔은 배포 직전의 한 시점에 집중하기보다 모델 제공업체를 매월 또는 분기마다 위험 평가하는 방식을 제안한다. 기술의 향방이 불확실한 지금 안전 규제를 고정하는 데 우려도 표했다.
둘째, 모델의 행동을 안전하게 유지하는 기술적 정렬도 달라져야 한다. 현재 연구는 주로 고정된 모델의 배포 중 행동에 초점을 맞추지만, 지속적인 가중치 업데이트 속에서 탈옥 시도나 기만적 행동을 어떻게 막을지는 별개의 문제다. 여러 사용자의 학습 결과를 합친다면 누군가가 악의적인 행동을 기본 모델에 심을 위험도 다뤄야 한다.
모델은 다양해지고 선두의 우위는 커질 수 있다
셋째, 기업과 모델의 개별 인스턴스가 서로 다른 경험에서 배우면 AI의 행동도 다양해질 수 있다. 파텔은 현재 널리 쓰이는 기반 모델들이 비슷한 데이터로 학습돼 서로 닮았다고 보고, 경험의 차이가 이를 바꿀 것으로 예상한다.
넷째, 배포가 학습의 일부가 되면 앞선 모델에 더 많은 사람이 복잡하고 유용한 일을 맡기고, 그 과정에서 얻은 피드백이 다시 모델을 개선하는 순환이 생길 수 있다. 다섯째, 실제 사용이 주요 학습 경로라면 연구소는 뛰어난 모델을 더 일찍 공개할 압박을 받는다. 파텔은 앤트로픽이 Mythos를 2월부터 내부에서 사용하다 6월에 공개한 것으로 알려졌다는 사례를 들며, 지속 학습 환경에서는 이런 내부·외부 배포 간격을 유지하기 어려울 것이라고 주장한다.
축적된 경험은 교체 비용이 된다
여섯째, 사용자와 함께 일하며 개선된 모델은 AI 연구소에 고객 유지상의 이점을 줄 수 있다. 지금은 소프트웨어 저장소 작업을 Codex에서 시작해 Cursor와 Claude Code로 이어갈 수 있지만, 모델이 조직의 맥락을 몇 달간 축적했다면 교체는 그 경험을 잃는 일이 된다. 파텔은 이 비용이 모델 제공업체의 수익성에도 영향을 줄 것으로 본다.
일곱째, 기업은 특정 제공업체에 묶이는 상황을 피하려 하겠지만, 세션 데이터를 학습에 쓰지 못하게 하면 개선 기능도 포기해야 할 수 있다. 파텔은 실제 사용이 모델 개선의 주된 경로가 된다면 연구소가 학습을 허용한 고객에게 보조금을 주거나, 거부한 기업에는 최상위 모델 접근을 제한할 가능성을 제시한다. 다만 한 사용자의 모델을 업데이트하는 일과 여러 사용자의 학습 결과를 기본 모델에 합치는 일은 다르며, 후자는 기술적으로 더 어려울 수 있다고 인정한다.
개인화된 모델의 비용은 규모에 좌우된다
여덟째, 기업별 정보가 간단한 추가 구성요소가 아니라 모델 가중치 전체의 업데이트를 요구한다면, 같은 모델로 여러 요청을 묶어 처리하는 배치 처리가 중요해진다. 파텔의 대략적인 계산에 따르면 DeepSeek v3 같은 희소 모델의 최적 추론 배치 규모는 동시에 생성되는 시퀀스 2,400개를 넘는다. 그는 많은 직원과 AI 에이전트가 같은 가중치를 쓰는 대기업은 효율적으로 운영할 수 있지만, 요청 하나만 처리하는 개인 사용자는 연산 효율이 100배 넘게 낮아질 수 있다고 추정한다.
결론
파텔의 여덟 가지 전망은 지속 학습이 작동하고 실제 업무 경험이 모델 개선으로 이어진다는 조건에 달려 있다. 그는 그 과정에서 더 중요한 변화가 나타날 수도 있다고 덧붙인다.
댓글 0
첫 댓글을 남겨 주세요.