핵심 요약

  • 진행자는 중국 Z.AI의 GLM 5.2가 코딩 평가에서 미국의 일부 상용 모델에 근접했다고 소개했다. 성능 격차가 앞으로도 유지될지는 출연자들 사이에서도 미지수로 남았다.
  • 출연자들은 기업이 자체 데이터에 맞춘 오픈 모델과 상용 최상위 모델을 작업에 따라 함께 쓰는 방식을 전망했다.
  • 마이크론 실적을 계기로 고대역폭 메모리(HBM)와 D램의 공급 부족이 논의됐다. 출연자들은 AI 서버용 메모리 생산 능력을 늘리는 데 시간이 걸린다고 봤다.
  • 모듈형 데이터센터와 분산 추론은 컴퓨팅 자원을 늘릴 방안으로 거론됐지만, 보안·냉각·연결 속도에 따른 제약도 함께 제시됐다.

중국 오픈 모델이 좁힌 성능 격차

진행자는 Z.AI가 공개한 GLM 5.2를 내려받아 자체 운영할 수 있는 모델로 소개했다. 방송에서 제시한 수치는 매개변수 7,440억 개, 문맥 처리 범위 100만 토큰, Artificial Analysis 지수 51점이다. 진행자는 코딩 평가에서 GPT 5.5를 앞서고 Claude Opus 4.8과의 차이는 1%포인트 미만이었다고 전했다. API 이용 비용은 비교 대상으로 든 GPT 5.5보다 85% 낮다고 설명했다. 이 수치들은 방송에서 인용한 평가와 가격 비교다.

개빈 베이커는 GLM 5.2의 성능이 자신의 기존 판단을 흔들었다고 말했다. 그는 다른 모델의 응답과 추론 과정을 학습에 활용하는 증류가 성능 추격에 기여했을 것으로 봤다. 다만 아직 공개되지 않은 후속 미국 모델의 성능은 알 수 없으므로, 현재의 격차가 다시 벌어질 가능성도 열어뒀다.

데이비드 색스는 중국 모델의 발전을 두고 미국 기업의 출시가 지연되는 상황을 우려했다. Z.AI 창업자가 더 높은 수준의 오픈 모델을 내놓겠다고 밝힌 것은 향후 계획이지 달성된 성능은 아니다. 색스는 사이버 보안 위험에 대응하려면 방어 측이 모델을 이용해 취약점을 먼저 찾아 수정할 수 있어야 한다고 주장했다.

기업은 모델을 어떻게 조합할까

베이커는 기업이 하나의 모델에 모든 요청을 보내기보다 작업별로 모델을 고르는 방식을 전망했다. 기업 데이터에 맞춘 오픈 모델이 먼저 처리하고, 어려운 작업에는 상용 최상위 모델이 답을 보완하거나 검토하는 식이다. 그는 이를 여러 모델을 조합하는 방식이라고 설명했다. 어떤 요청을 어느 모델에 보낼지는 작업을 분배하는 장치가 결정한다.

오픈 모델의 확산은 모델 제공사와 컴퓨팅 인프라 제공사 사이의 수익 배분에도 영향을 줄 수 있다는 것이 베이커의 견해다. 그는 오픈 모델이 더 많은 작업을 처리하면 인프라 수요가 커질 수 있다고 봤다. 다만 기업이 실제로 어느 비율의 작업을 각 모델에 맡길지는 예측으로 제시했다.

진행자는 Z.AI가 직접 제공하는 버전에서 대만과 톈안먼 광장에 관한 질문에 답을 받지 못했다고 말했다. 색스는 중국 모델의 정치적 제한을 인정하면서도, 기업이 공개된 모델을 수정해 자체 운영할 경우 응답을 바꿀 수 있다고 설명했다. 이는 공개 모델의 수정 가능성에 관한 주장으로, 진행자가 시험한 제공 버전의 응답과는 구분된다.

메모리 공급이 AI 서버의 병목으로 떠오르다

진행자는 마이크론, SK하이닉스, 삼성전자를 HBM 제조사 세 곳으로 소개했다. HBM은 여러 메모리 칩을 쌓아 높은 대역폭을 내는 부품으로, 방송에서는 AI 서버용 GPU와 함께 쓰인다고 설명했다. 진행자에 따르면 마이크론의 2026년 HBM 공급분은 이미 판매가 끝난 상태다.

베이커는 모델 성능에 필요한 메모리 용량과 데이터 전송 속도 때문에 D램이 중요한 병목이라고 봤다. 그는 마이크론이 일부 대형 고객과 가격의 하한과 상한을 정한 공급 계약을 맺었으며, 해당 계약이 매출의 약 절반에 해당한다고 설명했다. AI 서버용 메모리는 소비자 기기용 D램보다 만들기 어렵고, 생산 설비를 늘리는 데도 시간이 걸린다는 것이 출연자들의 공통된 설명이다.

출연자들은 AI 서버의 메모리 수요가 소비자 전자제품의 부품 가격에도 압력을 준다고 봤다. 베이커는 중국 CXMT의 소비자용 D램 공급 확대가 그 시장의 가격 부담을 덜 가능성을 제시했지만, 이를 AI 서버용 고성능 메모리의 공급 확대와 동일하게 보지는 않았다.

데이터센터를 작게 나누면 해결될까

대담에서는 서버와 전력·냉각 장치를 한 단위로 묶는 모듈형 데이터센터도 논의됐다. 차마스 팔리하피티야는 이런 장비를 미리 조립해 현장으로 운반하면 구축 기간을 줄일 수 있다고 설명했다. 그러나 부지와 전력 확보가 선행돼야 하며, 작업에 따라 보안과 액체 냉각 요건도 충족해야 한다고 덧붙였다. 슈퍼차저 부지에 설치한다는 이야기는 방송에서 소문과 해석으로 다뤄졌을 뿐 확정된 계획으로 제시되지 않았다.

트래비스 캘러닉은 멀리 떨어진 장비를 하나의 학습 작업에 연결하면 통신 지연으로 효율이 크게 떨어진다고 지적했다. 반면 베이커는 학습보다 모델이 답을 생성하는 추론에서 분산된 장비를 활용할 여지가 있다고 봤다. 그는 추론 과정도 입력과 앞선 답변을 처리하는 단계, 다음 토큰을 생성하는 단계로 나눠 서로 다른 장비에 맡길 수 있다고 설명했다. 분산 추론의 가능성과 분산 학습의 제약을 구분한 논의다.

비용 전망과 실제 공급 능력

베이커는 지상에 1기가와트 규모 데이터센터를 구축할 때 반도체에 약 350억 달러, 전력·냉각 설비에 약 250억 달러가 든다는 추산을 제시했다. 재사용 로켓으로 같은 규모의 장비를 궤도에 올리는 비용이 약 50억 달러까지 내려간다는 가정 아래 우주 컴퓨팅과 비교했지만, 이는 향후 발사 비용과 구축 규모가 실현돼야 성립하는 계산이다.

상장 기업을 논의할 때도 베이커는 수요만큼 설비 가동 능력을 중시했다. 그는 세레브라스가 계약을 맺어도 칩 제작, 서버 조립, 전력 확보를 거쳐야 매출에 반영된다고 설명했다. 월 50메가와트씩 설비를 늘리는 가정을 통한 매출 계산 역시 회사가 아직 달성하지 않은 속도를 전제로 한다고 명시했다.

이번 대담에서 반복된 쟁점은 모델 성능뿐 아니라 이를 운영할 메모리, 전력, 냉각과 생산 시간이었다. 출연자들의 비용·성능 전망은 각기 다른 가정에 기대고 있으며, 실제 공급과 가동 속도가 그 판단을 가를 변수로 남았다.