핵심 요약

  • 출연진은 최근 개방형 모델의 성능이 높아지고 가격 선택지가 늘면서, 기업이 비싼 폐쇄형 모델을 모든 작업에 쓸 이유를 다시 따져야 한다고 봤다.
  • 앤트로픽과 오픈AI의 상장 논의에서는 저렴한 모델로 옮겨갈 수 있는 고객 수요와 고가 모델의 지속적인 연구개발 비용이 위험 요인으로 제시됐다.
  • 메타의 Muse와 Grockbot은 개인 AI 에이전트의 사례로 거론됐다. 출연진의 사용 경험은 긍정적이었지만, 대중적 효과에 관한 전망은 아직 전망이다.
  • AI 안전을 둘러싼 논쟁은 제품을 출시하는 회사의 책임, 모델의 예측 가능성, 사용자의 뜻과 안전 기준을 어떻게 조화시킬지로 이어졌다.

비슷해지는 모델, 달라지는 사용 비용

데이비드 프리드버그는 짧은 기간에 공개된 여러 AI 모델을 열거하며 개방형 모델의 성능 향상과 비용 하락을 강조했다. 일부 모델은 가중치를 내려받아 자체 서버나 개인 컴퓨터에서 실행할 수 있다. 다만 자체 실행이 공짜라는 뜻은 아니다. 서버와 연산 자원 비용은 사용자가 부담한다.

차마스 팔리하피티야는 모델 성능이 서로 가까워지고 있다고 평가하면서도, 실제 작업 성과까지 같아진 것은 아니라고 말했다. 모델에 도구와 작업 절차를 연결하는 하네스에 따라 품질과 비용이 크게 달랐다는 것이 그가 운영하는 조직의 시험 결과다. 그의 설명대로라면 기업의 선택 기준은 모델 이름뿐 아니라 특정 작업을 얼마의 비용으로 얼마나 안정적으로 끝내는지가 된다.

방송에서는 최근 12주 사이 개방형 모델과 폐쇄형 모델의 토큰 사용 비중이 20 대 80에서 80 대 20으로 뒤집혔다는 차트도 거론됐다. 이는 출연진이 제시한 자료에 관한 주장이다. 전체 시장을 빠짐없이 측정한 확정 통계로 받아들이기에는 방송에서 집계 범위와 방법이 충분히 설명되지 않았다.

앤트로픽 상장에 걸린 두 가지 가격 문제

진행자는 앤트로픽과 오픈AI가 새 모델의 토큰 가격을 낮췄다고 언급하고, 앤트로픽 상장 시점이 늦춰질 수 있다는 보도를 소개했다. 상장 일정이나 기업가치는 이 대담에서 확정된 결과가 아니라 보도와 출연진의 예상으로 다뤄졌다.

첫 번째 가격 문제는 고객이 내는 모델 사용료다. 팔리하피티야는 비슷한 결과를 더 싼 모델에서 얻을 수 있다면 고가 모델을 많이 쓰는 고객이 비용을 줄이려 할 것이라고 봤다. 일반적인 작업에 개방형 모델을 자체 운영하는 선택지도 있다. 반면 데이비드 삭스는 최고 성능이 필요한 고객은 여전히 비용을 더 낼 수 있고, 대형 모델 제공업체의 사용 편의성과 연산 인프라도 경쟁력이라고 반박했다.

두 번째는 상장 가격이다. 팔리하피티야는 개방형 모델과 경쟁하는 매출이 어느 정도인지, 제품과 규제에 어떤 위험이 있는지 투자자가 따진 뒤 더 낮은 가격을 요구할 수 있다고 예상했다. 그는 앤트로픽의 최고경영자를 교체해야 한다는 진행자의 주장에는 동의하지 않았다. 회사가 구축한 조직과 사업 성장도 함께 평가해야 한다는 이유였다.

고가 모델의 시장은 남는가

프리드버그는 자신의 생명과학 연구 조직에서 앤트로픽 모델을 높이 평가해 사용하지만, 코드 작성과 내부 운영에는 다른 제품도 쓴다고 설명했다. 그는 복잡한 공학·수학·생명과학 문제처럼 높은 성능이 필요한 작업과 더 저렴한 모델로 처리할 수 있는 작업이 갈릴 것으로 예상했다. 이는 고가 모델의 수요가 사라진다는 주장과는 다르다.

삭스도 개방형 모델이 토큰 사용량의 큰 부분을 차지할 수 있다는 점을 인정하면서, 최고 성능을 원하는 고객에게는 별도의 시장이 남는다고 봤다. 다만 선두 업체가 기술 우위를 잃으면 그 높은 가격을 유지하기 어렵다는 위험을 지적했다. 팔리하피티야는 경쟁 때문에 비싼 토큰을 과도하게 쓰더라도 그 비용을 매출이나 고객 가격에 반영하지 못하면 이익률이 낮아질 수 있다고 덧붙였다.

Muse가 보여준 개인 에이전트의 쓰임새

출연진은 메타의 Muse와 Grockbot을 일반 사용자가 작업을 맡길 수 있는 개인 AI 에이전트로 논의했다. 팔리하피티야는 Muse로 개인 이메일을 분류하고 항공편과 호텔 예약을 시도한 경험을 소개하며 사용법이 단순하다고 평가했다. 진행자는 상품 가격을 비교해 더 저렴한 판매 경로를 찾은 사례를 들었다. 이런 사례는 각자의 사용 경험이며, 모든 사용자에게 같은 결과가 난다는 증거는 아니다.

팔리하피티야는 에이전트가 웹사이트에서 직접 탐색하고 결제할 수 있게 되면 앱스토어의 수익 배분 방식에도 압력이 생길 수 있다고 예상했다. 반대로 기존 서비스가 외부 에이전트의 접근을 제한할 가능성도 언급했다. 프리드버그는 개인 이메일 전체를 제삼자 서비스에 맡기고 싶지 않다며, 편의성만으로 서비스 연결을 결정할 수 없다는 한계를 짚었다.

안전 책임과 정렬을 둘러싼 이견

삭스와 팔리하피티야는 AI 제품이 불안정하거나 예상 밖으로 행동한다면 출시 회사가 시험과 출시 결정에 책임을 져야 한다고 주장했다. 두 사람은 기업을 ‘연구소’라고 부르는 관행이 그 책임을 흐릴 수 있다고 봤다. 이는 출연진의 규범적 견해이며, 대담에서 거론된 책임 면제 로비 의혹은 직접 확인된 사실로 제시되지 않았다.

정렬은 모델의 행동을 어떤 목표와 기준에 맞출지에 관한 문제다. 삭스는 앤트로픽의 Claude 지침에서 모델이 회사의 지시도 무조건 따르지 않도록 한 대목을 언급하며, 고객의 요청에 맞춰 예측 가능하게 작동하는 데 더 집중해야 한다고 주장했다. 다만 그가 제기한 우려만으로 현재 정렬 연구가 실패했다거나 해당 지침이 실제 위험을 만들었다고 결론 내릴 근거는 대담에 없다.

AI의 생물학적 예측은 실험으로 확인해야 한다

앤트로픽의 생물학 연구 시설에 관한 우려에는 프리드버그가 다른 맥락을 제시했다. 그의 설명에 따르면 앤트로픽은 DNA 데이터를 분석하는 Claude 에이전트로 아직 특성이 밝혀지지 않은 효소나 단백질 후보를 찾는 연구를 공개했다. 하지만 소프트웨어가 어떤 기능을 예측했다는 사실만으로 그 단백질의 기능이 입증되지는 않는다. 실제로 단백질을 만들어 측정하는 실험이 필요하다.

프리드버그는 해당 시설을 이런 예측을 검증하는 낮은 생물안전 수준의 연구실로 설명했다. 후보 물질이 치료에 쓰일 수 있다는 언급 역시 가능성에 관한 것이지, 치료 효과가 확인됐다는 발표는 아니다. 이 사례는 AI 모델의 유용성을 평가할 때 예측 결과와 실험으로 확인된 결과를 구분해야 함을 보여준다.

결국 대담의 쟁점은 한 모델의 성능 경쟁을 넘어섰다. 기업이 어떤 작업에 고가 모델을 쓸지, 개인 에이전트에 어떤 데이터를 맡길지, 출시 전 무엇을 검증할지가 함께 논의됐다.