핵심 요약
- 베이스텐 CEO 투힌 스리바스타바는 자사에서 처리하는 토큰의 95%가량이 고객별 전용 추론에서 발생하며, 고객들이 대부분 모델을 용도에 맞게 조정한다고 말했다.
- 그는 기업이 맞춤형 모델에 투자하기 전에 우수한 기존 모델로 고객 가치를 입증하고, 개선에 쓸 사용자 신호를 확보해야 한다고 봤다.
- 베이스텐은 여러 클라우드에 걸친 실행 환경으로 GPU를 확보하지만, 스리바스타바는 공급량과 데이터센터 운영 능력이 모두 부족하다고 설명했다.
- 그는 추론 과정에서 얻은 데이터를 평가와 후속 학습에 연결하는 것을 베이스텐 제품의 중심 방향으로 제시했다.
애플리케이션의 자산은 사용자 신호다
스리바스타바는 AI 모델을 이용하는 독립 애플리케이션 기업이 성장할 여지가 있다고 봤다. 근거는 해당 기업만 수집할 수 있는 사용자 신호다. 이 신호가 실제 업무 흐름에 쌓이면 범용 모델을 만드는 기업이 같은 서비스를 제공하기 어려워진다는 주장이다.
그는 의료진의 진료 기록 작성을 돕는 서비스를 예로 들었다. 의료진이 기록을 어떻게 수정하고 이후 병원 시스템에서 어떤 작업을 하는지는 서비스가 업무에 깊이 연결될수록 파악하기 쉬워진다. 고객 지원도 문의 한 건에 여러 후속 조치가 필요한 경우가 있어, 그런 작업 흐름을 바탕으로 특화 모델을 만들 수 있다고 설명했다. 다만 경쟁력은 신호를 실제로 확보하고, 그 신호로 모델과 업무 흐름을 개선할 수 있을 때 생긴다는 전제가 붙는다.
맞춤형 모델은 고객 가치 입증 뒤에 온다
베이스텐은 고객 전용 환경의 추론, 여러 고객이 함께 쓰는 추론, 학습 사업을 운영한다고 설명했다. 스리바스타바에 따르면 현재 처리 토큰의 약 95%는 첫 번째 사업에서 나온다. 그는 그 고객들이 대부분 자체 데이터로 모델을 수정하며, 수정 목적에는 답변 품질뿐 아니라 실행 성능 개선도 포함된다고 말했다. 이 수치는 베이스텐의 처리량에 관한 설명이지 전체 AI 시장의 비율은 아니다.
그가 제시한 도입 순서는 먼저 성능이 좋은 기존 모델로 고객에게 제공할 가치가 있는지 확인하는 것이다. 이후 개선 목표가 분명하고 그 결과를 판단할 사용자 신호가 쌓이면, 특정 업무를 더 잘하거나 빠르고 저렴하게 처리하도록 모델을 조정할 수 있다. 고객 지원에 특화된 모델이라면 코딩 능력까지 같은 수준으로 갖출 필요는 없다는 예를 들었다.
스리바스타바는 모델을 특정 용도에 맞게 추가 학습시키는 후속 학습과 추론을 밀접한 문제로 봤다. 학습 방식은 추론 때 모델의 계산량을 줄이는 양자화 방식에도 영향을 준다. 추론에서 데이터를 얻고, 결과를 평가한 뒤, 그 평가 신호로 다시 학습하는 순환을 구축하겠다는 구상이다.
GPU 부족은 운영과 자금의 문제이기도 하다
스리바스타바에 따르면 베이스텐은 18개 클라우드에 걸쳐 전 세계 약 90개 클러스터를 운영한다. 자체 클러스터의 가동률은 대부분의 시간에 90%대 중반이라고 말했다. 여러 클라우드를 하나의 실행 환경처럼 연결한 기술은 지연 시간과 장애 대응을 위한 것이었지만, 공급자를 추가해 GPU를 확보하는 데도 도움이 됐다고 설명했다.
그는 GPU가 존재하는 것과 안정적인 추론 서비스를 운영할 수 있는 것은 다르다고 지적했다. 데이터센터 운영 경험과 서비스 수준을 갖춘 공급자가 제한적이라는 평가다. 용량을 미리 확보하는 계약도 길어졌다고 말했다. 그의 설명에 따르면 양질의 클라우드에서 B200 GPU를 대량 확보하려면 당시 3~5년 계약과 총계약금액의 약 20~30% 선납을 요구받을 수 있었다. 따라서 고객 수요를 확보하는 능력과 자금 조달 비용이 함께 중요해진다는 주장이다.
그는 GPU만 빌려주는 서비스는 고객이 범용 상품처럼 보는 반면, 추론 소프트웨어가 결합되면 고객 관계가 더 오래 유지된다고 말했다. 그 근거로 자사 상위 30개 고객 중 이탈 사례가 없고 연간 순매출유지율이 약 400%라고 밝혔다. 모두 인터뷰에서 제시한 베이스텐의 자체 수치다.
개방형 모델과 칩 선택에는 제약이 있다
스리바스타바는 고객들이 대체로 비용보다 모델의 성능을 먼저 살피고, 쓸 만한 성능을 확인한 뒤 비용을 최적화한다고 설명했다. 중국에서 나온 개방형 모델의 보안 우려에 대해서는 네트워크 접근을 제한한 모델이 그 경계를 임의로 넘기는 어렵다고 봤다. 다만 자신의 판단이 틀릴 수 있다고 덧붙였으며, 미국에서도 경쟁력 있는 개방형 모델을 개발하는 일이 중요하다고 말했다.
추론 전용 칩이 등장할 가능성도 인정했다. 동시에 당분간은 엔비디아의 공급망, CUDA, 개발자 생태계가 주는 이점이 크다고 평가했다. 다른 칩 공급자가 생산량 대부분을 한 고객에게 배정하면 여러 기업이 사용할 생태계를 만들기 어렵다는 조건도 짚었다.
추론 비용이 내려갈 때 늘어나는 작업
베이스텐은 코딩 에이전트용 격리 실행 환경, 추론 속도를 높이는 기법, 이전 계산 결과를 재사용하는 캐시 관리, 입력 처리와 출력 생성을 나눠 최적화하는 작업에 투자하고 있다고 스리바스타바는 설명했다. 여러 요청을 모아 처리하는 방식도 장비 가동률을 높일 수 있는 기능으로 꼽았다.
그는 추론 비용이 내려가면 개발자가 에이전트를 더 오래 실행하거나 더 많은 일을 맡기는 경향을 고객에게서 보고 있다고 말했다. 따라서 효율 개선이 곧바로 추론 수요 감소로 이어지지는 않는다는 견해다. 이는 베이스텐 고객 경험을 바탕으로 한 그의 해석이며, 모든 서비스에 적용된다고 입증한 수치는 제시하지 않았다.
스리바스타바가 그린 추론 클라우드는 GPU 확보, 안정적인 운영, 모델 실행, 평가와 후속 학습을 연결한 서비스다. 인터뷰에서 반복해 드러난 제약은 이를 뒷받침할 컴퓨팅 용량과 운영 역량을 충분히 확보하기 어렵다는 점이다.
댓글 0
첫 댓글을 남겨 주세요.