핵심 요약
- 포지트론 AI 공동창업자 토머스는 AI 학습이 주로 연산 성능에, 생성형 AI 추론은 모델을 읽는 메모리 대역폭에 크게 제약받는다고 설명했다.
- KV 캐시는 이미 처리한 내용을 재사용해 연산을 줄이지만, 이용자와 문맥이 늘수록 저장할 데이터도 커진다.
- 그는 주요 사업자의 데이터센터 건설 계획이 지역 반대로 다른 입지로 옮겨갈 수는 있어도, 전체 설비 확장을 막을 정도는 아니라고 예상했다. 완공 비율은 제시하지 않았다.
- 전력 효율 개선만으로 전력 수요가 줄지는 않으며, 에너지 생산 기술보다 건설 자금을 얼마나 조달할 수 있는지가 더 큰 제약일 수 있다는 것이 그의 견해다.
추론에서 커지는 메모리의 역할
포지트론 AI는 생성형 AI 추론에 쓰이는 칩부터 시스템과 관련 소프트웨어까지 개발하는 반도체 스타트업이다. 토머스는 학습과 추론의 하드웨어 요구가 다르다고 설명했다. 학습은 준비된 데이터를 병렬로 처리할 수 있어 초당 연산량의 이점이 크다. 반면 추론은 다음 토큰, 즉 모델이 차례로 만들어 내는 텍스트 조각을 미리 알 수 없다. 토큰을 생성할 때마다 모델의 매개변수를 읽어야 하므로 메모리에서 데이터를 가져오는 속도가 중요해진다.
그가 제시한 비교에 따르면 2014년부터 2024년까지 엔비디아 GPU 한 대의 연산 성능은 약 120배 높아졌지만 메모리 대역폭은 약 17배 늘었다. 연산 성능과 메모리 성능의 증가 속도가 벌어지면서, 메모리에 묶이는 작업은 추가 연산 능력을 온전히 활용하기 어려워졌다는 설명이다.
KV 캐시는 연산을 아끼지만 저장 공간을 쓴다
KV 캐시는 대화에서 이미 처리한 내용의 일부 계산 결과를 저장해 다음 토큰을 만들 때 재사용하는 방식이다. 같은 계산을 반복하지 않아도 되지만, 대화가 길어지고 이용자가 늘면 보관할 캐시도 커진다. 토머스는 한 코딩 에이전트 세션 분석에서 전체 토큰의 약 96%가 캐시된 것으로 나타났다고 소개했다. 이는 그가 인용한 특정 작업 자료의 수치이며, 모든 AI 서비스의 평균을 뜻하지는 않는다.
서비스 운영자는 자주 쓰는 캐시를 빠른 가속기 메모리에 두고, 이용자가 잠시 떠나 있으면 호스트 메모리나 더 느린 저장 장치로 옮길 수 있다. 어느 캐시를 언제 옮길지 결정하는 일은 이용자가 많아질수록 복잡해진다. 토머스는 긴 문맥의 개별 세션이 매우 커질 수 있어, 소수 이용자의 캐시만으로도 모델 자체를 저장하는 공간에 맞먹을 수 있다고 설명했다.
저장량을 줄이는 방법에도 대가가 있다. 수치를 더 적은 비트로 표현하는 양자화는 메모리를 절약하지만 모델 성능에 영향을 줄 수 있다. 토머스는 발전된 기법이 그 영향을 작게 억제할 수 있다고 설명하면서도, 압축을 비용 없는 절감으로 봐서는 안 된다고 강조했다.
데이터센터 반대와 입지 이동
진행자가 계획된 데이터센터 중 얼마나 완공될지 묻자, 토머스는 비율을 답하는 대신 주요 사업자가 계획한 용량을 다른 장소에서 구축할 수 있다고 전망했다. 일부 지역사회가 시설 건설을 막았지만, 사업자가 입지를 옮길 수 있다는 것이다. 그는 정치적 반대가 예상보다 컸다고 인정하면서도 이를 전체 용량 확장의 존립을 위협할 문제로 보지는 않았다.
그는 데이터센터의 물 사용량과 전력 가격을 둘러싼 비판 중 일부가 잘못된 정보에 기대고 있다고 주장했다. 또 신규 시설이 자체 수요를 감당할 발전 용량을 함께 마련하고 있으며, 계통 연결이 허용되면 소비자 가격을 낮추는 데 도움이 될 수 있다고 주장했다. 이 대담에는 해당 주장들을 검증할 시설별 자료나 전력 요금 분석이 제시되지 않았다.
대안적 입지로는 포지트론 AI가 협력하는 판탈라사의 해양 데이터센터 사업을 언급했다. 우주 데이터센터에 대해서는 장기적 가능성에 관심을 보였지만, 가까운 시기에는 지상 건설이 더 저렴하고 쉽다는 견해를 밝혔다.
전력 효율과 투자 규모는 다른 문제
토머스는 포지트론 AI가 소비 전력당 더 많은 연산 능력을 제공하려 한다고 설명했다. 엔비디아 장비로 500메가와트가 필요한 작업을 100메가와트로 처리할 수 있다고 가정하더라도, 사업자가 시설을 100메가와트 규모로만 지을 것이라고 보지는 않았다. 같은 전력에서 더 많은 토큰을 생산하려 할 수 있다는 뜻이다. 이 수치는 달성된 성능이 아니라 그가 든 가정이다.
그는 장기적으로 에너지가 성장의 조건이 된다고 보면서도, 당장의 더 큰 제약으로 경제성을 꼽았다. 발전과 데이터센터를 건설할 기술이 있더라도 앞으로 몇 년간 필요한 투자와 부채를 얼마나 감당할 수 있는지가 실제 추진 속도를 좌우할 수 있다는 견해다. 국가 부채가 금융시장 전반에 미칠 영향은 우려했지만, AI 기업들이 매출 목표를 달성하지 못할 가능성은 상대적으로 낮게 봤다. 모두 그의 판단이며 대담에서 입증된 전망은 아니다.
긴 문맥과 작은 모델이 바꾸는 수요
토머스는 더 긴 문맥이 코딩 에이전트에 유용하다고 봤다. 다만 모델이 최대 몇 개의 토큰을 받을 수 있는지와 그 내용을 실제로 정확히 활용할 수 있는지는 별개라고 지적했다. 기존 방식에서 문맥을 100만 토큰에서 1,000만 토큰 이상으로 늘리기는 메모리 비용 때문에 어렵다는 설명이다. 메모리 사용량을 낮추는 새로운 주의 메커니즘에도 모델 능력과의 절충이 있을 수 있다고 덧붙였다.
그는 휴대전화나 기업 내부에서 돌아가는 작은 모델이 대형 클라우드 모델의 사용량을 오히려 늘릴 수 있다고 예상했다. 작은 모델이 계속 데이터를 살피다가 더 어려운 작업을 대형 모델에 맡기면, 사람이 직접 요청할 때보다 처리할 일이 많아질 수 있다는 논리다. 이는 현재 확인된 수요 변화가 아니라 향후 사용 방식에 대한 그의 전망이다.
대담이 제시한 병목은 하나가 아니다. 추론에는 메모리와 캐시 관리가, 데이터센터 건설에는 입지와 자금이 걸려 있다. 전력 효율을 높이는 기술도 이 조건들과 함께 봐야 한다는 것이 토머스의 설명이다.
댓글 0
첫 댓글을 남겨 주세요.