핵심 요약

  • 다리오 아모데이는 모델 크기·데이터·훈련량을 함께 늘릴 때 성능이 개선돼 왔다고 설명했다. 다만 과거의 추세가 앞으로도 이어진다는 보장은 없다고 선을 그었다.
  • 앤트로픽은 속도와 비용, 성능이 다른 Haiku·Sonnet·Opus를 제공한다. 아모데이는 새 세대의 작은 모델이 이전 세대의 큰 모델에 가까워지는 것을 목표로 삼았다고 말했다.
  • 클로드의 컴퓨터 사용 기능은 화면을 보고 클릭과 키 입력을 선택한다. 당시 모델은 오작동할 수 있어 작업 범위와 안전장치가 필요하다고 했다.
  • 앤트로픽의 책임 있는 확장 정책은 모델의 위험 능력을 평가하고, 일정 수준에 도달하면 보안·배포 요건을 강화하는 구조다.

규모를 키우면 무엇이 달라지는가

아모데이는 2014년 음성 인식 모델을 다루면서 데이터, 모델 크기, 훈련량을 늘릴수록 성능이 나아지는 모습을 봤다고 회고했다. 이후 언어 모델에서도 비슷한 가능성을 확인했고, 이미지·영상·수학 등에서도 유사한 패턴을 관찰했다고 말했다. 그의 설명에 따르면 한 요소만 키우면 다른 요소가 부족해질 수 있어 여러 요소를 함께 늘려야 한다.

그는 이런 확장 법칙을 자연의 불변 법칙으로 취급하지 않았다. 지금까지 관찰된 경험적 규칙이며, 다음 몇 년이 지난 10년과 같을지는 불확실하다고 강조했다. 분야별 한계도 다를 수 있다. 생물학처럼 인간의 이해가 분산된 분야에는 개선 여지가 커 보이지만, 어떤 과제는 인간의 수준에 가까운 한계에 부딪힐 수도 있다는 것이 그의 견해다.

클로드의 모델 구성과 성능 평가

아모데이는 Haiku를 빠르고 저렴한 모델, Sonnet을 중간 모델, Opus를 당시 가장 크고 강력한 모델로 설명했다. Claude 3.5 Sonnet은 Claude 3 Sonnet과 비용·속도가 대체로 비슷하면서 원래의 Claude 3 Opus보다 성능이 높아졌다고 평가했다. 특히 코딩에서 개선이 두드러졌다는 설명이다. 다만 새 모델은 데이터와 성격도 달라지므로 성능만 바뀐 동일 모델처럼 비교할 수는 없다고 덧붙였다.

코딩 능력의 근거로는 실제 코드베이스에서 언어로 주어진 작업을 수행하는 평가를 들었다. 아모데이는 모델에 실행과 편집 권한을 주는 자사 내부 평가에서 작업 완료율이 약 3%에서 약 50%로 올랐다고 말했다. 이 수치는 그가 설명한 특정 평가의 결과다. 그는 평가에 과도하게 맞춘 결과가 아니라는 조건에서 완료율이 더 높아진다면 소프트웨어 작업 능력의 실질적 향상을 뜻할 것이라고 봤다.

모델 출시에는 사전 훈련뿐 아니라 인간 피드백 등을 활용한 사후 훈련, 초기 협력사의 사용 평가, 내부·외부 안전 평가, API 제공을 위한 작업이 뒤따른다. 아모데이는 성능 개선의 상당 부분이 단일한 비법보다 데이터 품질, 기반 시설, 소프트웨어 공학의 세부 작업에서 나온다고 설명했다.

화면을 조작하는 AI의 가능성과 한계

클로드의 컴퓨터 사용 기능은 화면 캡처를 입력받고 클릭할 위치나 누를 키를 고른다. 이 과정을 반복하면 웹사이트와 프로그램을 조작할 수 있다. 아모데이는 화면이 여러 프로그램에 공통으로 쓰이는 인터페이스여서 개별 API를 연결할 때보다 접근 장벽을 낮춘다고 봤다.

동시에 당시 모델은 클릭을 잘못하거나 작업 중 실수할 수 있다고 인정했다. 장시간 컴퓨터를 맡겨두기보다 작업 범위와 안전장치를 정해야 한다는 설명이다. 앤트로픽이 이 기능을 먼저 API 형태로 제공한 이유에도 이런 한계가 있었다. 아모데이는 컴퓨터 사용 자체가 새로운 위험 능력을 만들어낸다기보다, 모델의 기존 능력을 실제 작업에 적용할 통로를 넓힌다고 평가했다. 모델 능력이 커질수록 그 통로가 갖는 위험도 함께 평가해야 한다고 말했다.

능력에 따라 달라지는 안전 조치

아모데이가 크게 우려한 위험은 두 가지다. 하나는 사이버·생물학 등에서 모델이 심각한 위해를 돕는 악용 위험이고, 다른 하나는 더 긴 작업을 맡은 모델이 의도와 다르게 행동하는 자율성 위험이다. 그는 대담 당시 모델이 그런 재앙적 위험을 일으킬 만큼 강력하다고 보지는 않았지만, 새 모델이 나올 때마다 관련 능력을 시험해야 한다고 주장했다.

앤트로픽의 책임 있는 확장 정책은 평가 결과가 정해진 기준에 이르면 안전·보안 요건을 강화하는 방식이다. 아모데이는 당시 모델을 ASL-2로 분류했다. 그의 설명에서 ASL-3은 비국가 행위자의 위험한 능력을 실질적으로 높일 수 있는 수준이며, 그 단계에는 모델 탈취 방지와 배포 시의 강화된 차단 조치가 필요하다. ASL-4에서는 모델이 평가에서 능력을 숨길 가능성까지 고려해야 하므로, 모델의 답변 외에 내부 작동을 살피는 방법도 중요해진다고 봤다. 그는 이 기준과 조치가 완성된 체계는 아니며 계속 수정해야 한다고 말했다.

원칙에 따른 훈련과 연구 조직

아모데이는 헌법적 AI를 사람이 읽을 수 있는 원칙에 비춰 AI가 응답을 평가하고 개선하는 훈련 방식으로 설명했다. 앤트로픽은 이를 인간 피드백 기반 훈련과 함께 사용한다. 그는 인간이 잠깐 보고 선호하는 답변이 장기적으로 원하는 결과와 같지는 않을 수 있다며, 인간 피드백 방식의 한계도 짚었다.

연구 조직에서는 인원 수보다 구성원 간 역량과 목적에 대한 신뢰가 중요하다고 주장했다. 조직이 커질수록 그 신뢰가 약해지면 절차와 내부 조정에 더 많은 시간이 들 수 있다는 것이다. 그는 연구자에게 필요한 자질로 기존 가정을 의심하고 변수를 바꿔 결과를 확인하는 개방성을 꼽았다.

아모데이는 지금까지의 성능 향상 추세를 연장하면 강력한 AI가 2026~2027년에 등장할 가능성을 떠올릴 수 있다고 말했다. 그러나 이는 과학적 예측이 아니며 데이터 부족이나 컴퓨팅 확장의 제약 등으로 늦어질 수 있다고 거듭 강조했다. 대담에서 제시된 모델의 성능, 활용과 위험에 관한 전망은 모두 이런 조건 아래의 판단이다.