# 구글 AI 인프라 책임자가 설명한 데이터센터의 물리학과 경제성

> 2026-10-06 · Sequoia Capital · 큐레이션 김태우
> https://challengekim.com/insights/구글-ai-인프라-책임자가-설명한-데이터센터의-물리학과-경제성
> 원문: https://www.youtube.com/watch?v=bGph8GwB3Sk

## 핵심 요약

- 구글의 아민 바닷은 AI 인프라의 성능을 칩의 이론적 연산량보다 실제 작업이 얼마나 완료되는지를 뜻하는 **굿풋(goodput**)으로 평가한다고 설명했다.
- AI 데이터센터는 가속기 랙의 높은 전력·냉각·네트워크 요구에 맞춰 건물과 하드웨어를 함께 설계한다.
- 추론용 칩을 따로 만들지는 예상 수요의 규모와 지속성에 달려 있다. 특화가 지나치면 수요 변화에 대응하기 어렵다.
- 바닷은 전력을 가장 근본적인 장기 제약으로 꼽았다. 구글은 전력회사와 수년에 걸쳐 공급을 계획하는 방식을 선호한다.

## AI 데이터센터는 건물부터 달라진다

일반 데이터센터와 AI 데이터센터 모두 전력 설비, 냉각, 네트워크, 저장장치가 필요하다. 차이는 설계의 특화 정도다. 바닷에 따르면 일반 데이터센터는 건물의 20\~30년 사용 기간에 걸쳐 여러 세대의 장비를 수용하도록 계획한다. 반면 AI 데이터센터는 들어갈 가속기와 건물을 함께 설계하는 경우가 많다.

그는 저장장치 랙의 전력 사용량을 10\~40킬로와트, 현재 TPU·GPU 랙은 수백 킬로와트에 이를 수 있는 수준으로 비교했다. 저장장치 랙 30개를 놓을 공간과 AI 랙 한두 개를 놓을 공간은 전력 분배와 냉각 설계가 다르다. 모든 장비를 수용하도록 건물을 만들면 규모와 설비가 필요 이상으로 커질 수 있다는 설명이다.

## 중요한 수치는 이론적 연산량보다 굿풋이다

칩의 최대 연산량은 특정 조건에서 가능한 이론적 수치다. 실제 작업 성능에는 메모리, CPU, 네트워크와 여러 가속기의 연결 방식이 함께 작용한다. 바닷은 구글이 실제 작업에서 얻는 굿풋을 본다고 말했다.

굿풋은 장애와 복구에 쓰인 시간까지 반영한다. 수많은 부품이 동시에 맞물려 돌아가는 학습·추론 작업에서 하나가 멈추면 작업 전체가 멈출 수 있다. 장애 원인을 찾고 이전 저장 시점으로 돌아가 계산을 다시 하는 동안에도 장비는 일을 하지만, 답을 완성하는 데 기여한 시간은 줄어든다. 바닷은 가속기 10만 개 규모라면 구성에 따라 하루에 여러 번, 때로는 한 시간에 여러 번 무언가가 고장 날 수 있다고 추정했다. 원인은 하드웨어와 네트워크뿐 아니라 컴파일러, 실행 환경, 운영체제, 모델에도 있을 수 있다.

그가 설명한 공급 능력 확대 목표 역시 칩의 연산량만 늘리는 뜻이 아니다. 약 6개월마다 두 배로 늘려야 한다고 언급한 것은 서비스에서 실제로 사용할 수 있는 토큰 생성 능력이다. 그는 모델과 소프트웨어의 여러 개선이 하드웨어 증설만큼, 또는 그보다 더 크게 기여할 수 있다고 봤다. 다만 개선 효과를 모델·소프트웨어·칩별로 정확히 나눈 수치는 제시하지 않았다.

## 칩 특화에는 수요와 유연성 계산이 따른다

구글의 TPU 프로그램은 2013년 소수의 용도에 맞춘 칩을 만들겠다는 판단에서 시작했다. 첫 칩은 주로 언어 번역과 음성 인식의 추론에 쓰였고, 다음 칩은 학습으로 범위를 넓혔다. 이후 트랜스포머와 추천 시스템 등으로 용도가 확대됐다는 것이 바닷의 설명이다.

최근 구글은 추론과 학습에 각각 더 특화한 두 칩을 내놓았다. 바닷은 특정 작업이 칩의 사용 기간 동안 얼마나 큰 비중을 차지할지에 따라 전용 칩의 경제성이 달라진다고 설명했다. 설령 한 작업에서 두 배 빠르더라도 그 작업의 예상 비중이 2\~5%라면 별도 칩을 만드는 판단이 달라질 수 있다. 몇 달 만에 사라질 수요에도 같은 문제가 있다. 두 칩 모두 상대 분야의 작업을 수행할 수 있어야 6년가량의 하드웨어 사용 기간에 걸친 수요 변화에 대응할 수 있다고 덧붙였다.

구글은 딥마인드와 모델·칩을 함께 설계한다. 바닷에 따르면 모델 연구진이 수학 연산의 변경을 제안하면, 칩 설계진은 제조를 위한 설계 확정 전에 이를 반영할 수 있는지 검토한다. 큰 이득이 예상되면 설계 확정을 늦추는 선택도 가능하다. 반대로 작은 개선을 위해 칩 일정을 멈추기는 어렵다. 그는 하드웨어를 2\~5년 앞서 계획한다고 말했다.

## 에이전트와 광 네트워크가 바꾸는 배치

바닷은 오래 실행되는 AI 에이전트가 데이터센터의 작업 형태를 바꾼다고 설명했다. 사람이 응답을 읽고 다음 요청을 입력할 때는 자연스러운 간격이 생긴다. 에이전트는 응답을 받은 뒤 훨씬 빠르게 다음 요청을 만들 수 있다. 그 사이 CPU가 응답을 처리하고 메모리나 저장장치에서 추가 정보를 가져와야 하므로, 가속기뿐 아니라 CPU·네트워크·저장장치 수요도 커진다는 것이다.

이 장비를 같은 건물에 섞으면 가속기 랙에 맞춘 특화 설계가 어려워진다. 건물을 나누면 건물 사이 연결의 비용과 복잡성이 늘어난다. 바닷은 네트워크 운영 사례로 빛의 경로를 바꾸는 광 회선 스위치를 들었다. 구글은 이를 이용해 광섬유를 옮기지 않고 랙 사이 연결을 재구성하거나, 장애가 난 TPU 랙의 연결을 예비 랙으로 돌릴 수 있다고 설명했다.

## 전력은 여러 해에 걸쳐 확보한다

바닷은 제약이 하나뿐인 것은 아니지만, 전력을 가장 근본적인 장기 제약으로 봤다. 구글이 선호하는 방식은 전력망에 연결된 데이터센터를 전력회사와 함께 계획하는 것이다. 기가와트 규모의 공급은 수년 전부터 조율해야 하며, 바닷은 송전선과 전력 설비의 증설 비용도 구글이 부담하도록 한다고 말했다.

그는 필요한 시점에 전력회사에서 전체 전력을 공급받지 못하는 가상의 경우를 들었다. 이때 일부를 현장 발전이나 배터리로 보완하고, 나중에는 필요에 따라 전력망에 전기를 돌려주는 방식도 검토할 수 있다는 설명이다. 독자적으로 필요한 전력을 모두 마련하면서 높은 안정성까지 확보하려면 예비 설비를 갖추는 비용이 커진다. 바닷이 전력망과의 협력을 선호하는 이유다.

## 학습과 추론에는 다른 장소와 장비가 필요하다

학습용 설비는 장비를 가깝게 모을수록 네트워크에 유리하다. 하지만 한곳에 집중하면 단일 장애 지점과 전력 확보 문제가 커진다. 반면 추론은 여러 지역의 사용자에게 서비스를 제공해야 한다. 바닷은 오래된 학습 설비를 추론에 활용할 수 있어도, 그것만으로 추론 수요와 지역별 공급을 충족할 수는 없다고 말했다. 별도의 추론 설비도 구축해야 한다는 것이다.

추론 설비가 반드시 전력량당 더 저렴한 것도 아니다. 연산 장비와 저장장치, 네트워크를 함께 배치해야 해 학습 설비만큼 균일하게 특화하기 어렵다. 오래된 장비의 가치도 단순히 나이로 결정되지 않는다. 바닷은 7\~8년 된 구글 TPU가 여전히 높은 사용률을 보인다고 말했다. 다만 약 6년의 감가상각 기간과 새 세대의 전력 효율을 고려해, 교체할 때는 칩 하나가 아니라 TPU 장비 묶음인 포드 단위로 바꾼다고 설명했다.

## 개방성과 미래 구상에도 조건이 있다

바닷은 하드웨어·소프트웨어·네트워크를 함께 최적화하면 성능을 높일 수 있지만, 어떤 인프라로든 옮겨 실행할 수 있는 유연성은 줄어들 수 있다고 설명했다. 구글이 TPU에서 자체 개발 도구인 JAX와 함께 PyTorch도 지원하고, GPU와 TPU를 모두 제공하는 배경으로 그는 고객의 선택권과 상호 운용성을 들었다.

우주 데이터센터는 구글이 추진 중인 구상이지만, 바닷은 냉각과 수리의 어려움도 함께 언급했다. 10년 뒤의 컴퓨터에 대해서는 예측의 불확실성이 크다고 전제한 뒤, 랙 내부가 더 촘촘하게 통합될 가능성을 자신의 추측으로 제시했다.

바닷의 설명에서 AI 인프라의 성능은 개별 칩의 최고 수치만으로 정해지지 않는다. 실제 작업의 완료량을 높이려면 장애 복구, 장비 배치, 전력 공급, 소프트웨어 개선을 함께 계산해야 한다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=bGph8GwB3Sk)
