핵심 요약

  • 젠슨 황은 AI 작업을 여러 컴퓨터에 나누면 칩 성능뿐 아니라 네트워크, 메모리, 전력, 냉각까지 함께 설계해야 한다고 설명했다.
  • 엔비디아는 초기 비용 부담을 감수하고 소비자용 지포스에 CUDA를 넣어 개발자 기반을 넓혔다.
  • 황은 사전 학습, 후속 학습, 추론, 에이전트 활용이 각각 연산 수요를 늘린다고 본다.
  • 전력과 공급망은 확장의 제약이다. 황은 연산 효율 개선과 함께 데이터센터의 전력 사용 방식을 바꿀 필요가 있다고 주장했다.

칩 하나에서 전체 시스템으로

황에 따르면 AI 문제가 GPU 한 개로 처리할 수 있는 범위를 넘어서면서 공동 설계가 필요해졌다. 알고리즘과 데이터, 모델을 여러 컴퓨터에 나눠 배치하면 GPU 외에도 CPU, 네트워크, 스위치가 전체 속도를 좌우한다. 그는 계산이 전체 작업의 절반이라면 계산 부분을 아무리 빠르게 해도 전체 속도는 최대 두 배만 빨라지는 예를 들었다.

엔비디아가 설계 대상으로 보는 범위는 칩과 소프트웨어를 넘어 전력, 냉각, 랙까지 확장됐다. 황은 자사의 연산 단위를 GPU에서 컴퓨터, 클러스터를 거쳐 이제는 ‘AI 공장’이라 부르는 데이터센터 전체로 생각한다고 말했다. 이 구상은 개별 부품의 성능을 높이는 것만으로는 분산된 작업의 병목을 풀 수 없다는 판단에 따른다.

CUDA를 지포스에 넣은 이유

CUDA는 개발자가 엔비디아 GPU를 범용 연산에 활용하도록 하는 컴퓨팅 기반이다. 황은 플랫폼의 성패를 가르는 요소로 기술 자체와 함께 설치 기반을 꼽았다. 개발자는 자신이 만든 소프트웨어가 많은 사용자에게 닿을 수 있는 플랫폼을 선택한다는 설명이다.

엔비디아는 이미 매년 수백만 개씩 팔리던 지포스 GPU에 CUDA를 탑재했다. 대학에 가서 책을 쓰고 수업을 열며 개발자도 모았다. 하지만 소비자용 GPU의 비용이 크게 올라 당시 회사의 매출총이익을 압박했다고 황은 회고했다. 그는 비용을 감당할 수 있게 되기까지 10년이 걸렸다고 말했다. 연구자와 학생이 기존 PC에서 CUDA를 접할 수 있게 된 점은 그가 이 결정을 높이 평가하는 이유다.

황은 현재 엔비디아의 가장 중요한 경쟁 우위도 CUDA의 설치 기반이라고 봤다. 여기에 개발자가 쌓은 소프트웨어, 지속적인 개선에 대한 신뢰, 다양한 기업의 시스템에 같은 아키텍처가 들어가는 생태계가 더해진다는 주장이다.

추론과 에이전트가 바꾸는 연산 수요

황은 AI의 확장을 사전 학습, 후속 학습, 사용 시점의 추론, 에이전트 활용으로 나눴다. 그는 AI가 실제 자료를 바탕으로 합성 데이터를 만들어 학습에 사용할 수 있으며, 추론 단계에서는 검색·계획·문제 해결 때문에 많은 연산이 든다고 설명했다. 에이전트가 파일과 도구를 사용하고 여러 하위 에이전트를 실행하면 연산 수요는 더 늘어난다는 전망이다.

이 변화는 하드웨어 설계에도 영향을 준다. 황에 따르면 AI 모델 구조는 대략 6개월마다 새로 등장하지만 시스템과 하드웨어 구조의 주기는 약 3년이다. 엔비디아는 자체 모델 연구와 고객사의 문제를 통해 변화를 파악하고, 바뀌는 알고리즘에 적응할 수 있는 아키텍처를 유지하려 한다. 황은 대형 언어 모델 추론에 초점을 맞춘 그레이스 블랙웰 랙과 달리, 베라 루빈 시스템에는 에이전트의 도구 사용을 고려한 저장장치 가속기와 CPU 등이 들어간다고 설명했다.

에이전트가 민감한 정보에 접근하고 코드를 실행하며 외부와 통신할 때의 보안 문제도 언급됐다. 황은 엔비디아가 이 세 권한을 한꺼번에 주지 않는 방식과 기업의 접근 권한·정책을 연결하는 방식을 추진한다고 말했다.

전력과 공급망의 제약

황은 전력을 AI 확장의 우려 요소로 꼽으면서도 유일한 제약은 아니라고 했다. 그는 소비 전력 1와트당 초당 생성하는 토큰 수를 높이고 토큰 비용을 낮추는 데 공동 설계가 중요하다고 설명했다. 동시에 전력 공급 자체도 늘려야 한다고 덧붙였다.

전력망 활용에 관해서는 데이터센터가 언제나 최대 전력을 보장받는 계약을 다시 생각해 보자고 제안했다. 전력망에 여유가 있을 때 전기를 쓰다가 수요가 높아지면 작업을 다른 곳으로 옮기거나 연산 속도를 낮추는 방식이다. 이를 위해서는 고객의 가용성 요구, 데이터센터의 설계, 전력회사의 공급 조건이 함께 바뀌어야 한다는 것이 황의 설명이다. 이는 이미 널리 적용된 운영 방식이 아니라 그가 제시한 방안이다.

공급망에서는 설계 변화가 제조·시험 방식까지 바꾼다. 황에 따르면 고밀도 NVLink 72 시스템은 예전처럼 데이터센터에서 부품을 조립하기 어려워 공급망에서 랙 단위로 제작해 운송한다. 따라서 납품업체는 완성된 시스템을 출하하기 전에 시험할 전력도 확보해야 한다. 황은 이처럼 필요한 설비와 투자 규모를 협력사에 미리 설명하는 일을 자신의 역할로 제시했다.

개방형 모델과 성장 전망의 조건

황은 엔비디아가 모델을 직접 연구하는 이유로 향후 AI에 맞는 컴퓨팅 시스템을 설계할 수 있다는 점을 들었다. 또 모든 모델이 독점적이면 연구와 응용 개발이 어려워진다며 개방형 모델의 필요성을 주장했다. 그는 AI가 언어뿐 아니라 생물학, 날씨, 물리 영역으로 넓어질 수 있다는 점도 근거로 제시했다.

황은 기존의 파일 검색 중심 컴퓨팅보다 상황에 맞춰 정보를 생성하는 AI 컴퓨팅에 더 많은 연산이 필요하다고 본다. AI 데이터센터를 매출을 만들어 내는 ‘공장’에 비유하며 엔비디아의 성장 가능성도 강하게 전망했다. 다만 그가 제시한 미래 매출 규모와 토큰 가격은 달성된 실적이 아니라 연산 수요, 고객의 지불 의사, 에너지와 공급망의 확대를 전제로 한 전망이다.

황의 설명을 관통하는 변화는 AI 시스템을 설계하는 범위가 커졌다는 점이다. CUDA를 쓰는 개발자부터 랙을 만드는 협력사, 전력을 공급하는 사업자까지 같은 시스템의 일부로 보고 조율해야 한다는 것이 그의 판단이다.