핵심 요약
- 스피치파이는 엔지니어가 GPU 임대료를 의식해 실험을 줄이는 문제를 겪은 뒤 자체 GPU를 구매하기 시작했다.
- 창업자는 H100 한 장의 구매가를 약 3만 달러, 시간당 임대료를 약 3.5~5달러로 제시하며 꾸준히 쓰는 자원은 구매가 유리하다고 주장했다.
- 구매한 GPU로 기본 수요를 감당하고, 장기 임대 계약과 필요할 때 빌리는 스팟 인스턴스로 변동 수요를 처리한다.
- 진행자는 구매에 따른 운송·보험·냉각 부담을 지적했다. 창업자는 대규모 모델 훈련에 필요한 GPU와 메모리의 배치, 장비에 대한 통제를 구매 이유로 들었다.
GPU를 사기 시작한 이유
스피치파이 창업자는 회사가 처음 GPU를 구매한 계기를 연구 속도에서 찾았다. 임대 GPU를 쓰던 엔지니어들이 비용을 걱정해 사용을 아꼈다는 것이다. 그는 훈련 시설 이용료를 매번 내야 하는 운동선수에 빗대며, 연구자가 필요할 때 바로 실험할 수 있는 환경을 원했다고 설명했다. 회사는 2022년 모델 훈련을 위해 GPU 랙을 구매했고, 이후 투자를 늘렸다.
그가 제시한 또 다른 이유는 비용이다. 예시로 든 H100 한 장의 구매가는 약 3만 달러다. 시간당 임대료는 서비스와 계약 방식에 따라 약 3.5~5달러라고 설명했다. 그는 이를 연중 계속 빌릴 경우 구매가보다 많은 돈을 내게 된다고 계산했다. 다만 이 비교는 장비를 지속해서 사용한다는 전제에 따른다. 구매 후 필요한 데이터센터 공간과 운영 비용까지 포함한 총비용 비교로 제시되지는 않았다.
최신 칩과 오래된 칩의 역할
진행자는 새 칩이 빠르게 출시되면 구매한 GPU의 가치가 떨어질 수 있다고 지적했다. 창업자는 훈련과 추론을 구분했다. 훈련은 데이터를 이용해 모델을 만드는 과정이고, 추론은 완성된 모델이 입력을 받아 결과를 내는 과정이다. 경쟁 중인 모델 실험에서는 결과를 빨리 확인할 수 있는 최신 GPU가 중요하지만, 기존 GPU도 추론이나 속도 요구가 낮은 실험에 계속 쓸 수 있다는 설명이다. 스피치파이는 오래된 GPU를 일부 추론 작업에 사용한다고 했다.
자체 장비가 모든 수요를 맡는 것은 아니다. 창업자는 월평균 GPU 사용량을 100으로 놓고, 구매 장비로 약 20%, 대형 클라우드 사업자와의 장기 계약으로 약 25%를 감당하며 나머지는 스팟 인스턴스로 빌리는 구상을 설명했다. 스팟 인스턴스는 필요할 때 임시로 빌리는 자원이다. 그는 월별 사용량이 달라지고 9월에는 서비스 이용자가 늘어난다며, 확실히 필요한 용량과 변동하는 용량을 나눠 관리한다고 말했다.
데이터센터 운영에는 무엇이 따르나
스피치파이는 GPU 장비를 구매하지만 데이터센터 공간은 임대한다. 창업자에 따르면 데이터센터는 전력과 네트워크를 제공하고 장비 설치·수리를 맡는다. 회사에는 납품 지연 중에도 발생하는 공간 임대료, 고가 장비의 운송 보험, 냉각 방식 같은 문제가 남는다. 그는 현재 전력이 큰 제약이라고 설명했다. 액체 냉각이 필요한 장비를 들일 때는 데이터센터에 기존 설비가 없어 별도 냉각 장치를 조사하고 설치해야 했다고 했다.
진행자는 이런 운영 부담을 고려하면 임대가 더 낫다고 반박했다. 창업자는 임대만으로도 훈련할 수는 있지만, 자신들이 원하는 규모의 GPU 묶음과 가까운 곳에 놓인 메모리를 확보하려면 비용이 많이 들고 여러 해 앞서 계약해야 한다고 답했다. 장비를 소유하면 연결 구성에 대한 통제도 커지고, 새 GPU를 클라우드 사업자의 고객 대기열을 거치기 전에 확보할 수 있다는 것이 그의 주장이다. 이는 스피치파이의 훈련 수요와 구매 경험에 관한 설명이지, 모든 스타트업에 같은 계산이 적용된다는 증거는 아니다.
컴퓨팅 자원이 팀의 속도에 미치는 영향
창업자는 GPU를 비용 항목만이 아니라 연구팀의 작업 공간으로 본다. 회사에는 동시에 여러 모델 실험이 진행되고, 일부 엔지니어에게는 전용 GPU 랙도 배정돼 있다고 말했다. 충분한 컴퓨팅 자원이 없으면 아이디어가 있어도 훈련을 돌려 결과를 확인할 수 없다는 설명이다. 그는 모델 개발에 팀과 컴퓨팅 자원뿐 아니라 데이터가 필요하며, 원자료를 정리하고 합성 데이터를 만드는 작업에도 GPU를 쓴다고 덧붙였다.
자원 사용량만 늘리는 방식은 경계했다. 회사에서 AI 도구를 쓰는 엔지니어의 성과는 소비한 토큰 수보다 실제 이용자에게 배포한 기능과 그 피드백으로 평가한다고 했다. 작은 기능에 불필요하게 많은 토큰을 쓰는 일도 문제로 봤다. 창업자가 강조한 것은 목표와 측정 방법을 정하고 실험을 반복한 뒤, 결과가 제품에서 제대로 작동하는지 확인하는 과정이다.
결론
스피치파이의 GPU 구매는 높은 사용량, 모델 훈련에 필요한 장비 구성, 실험 속도를 함께 고려한 선택이다. 동시에 회사는 임대 자원도 계속 사용한다. 대담에서 드러난 쟁점은 구매와 임대 중 하나를 택하는 문제가 아니라, 꾸준한 수요에 대한 비용 이점이 데이터센터 운영 부담을 감당할 만큼 큰지에 있다.
댓글 0
첫 댓글을 남겨 주세요.