핵심 요약
- 딜런 파텔은 AI 추론의 큰 효율 개선이 모델, 중간 소프트웨어, 하드웨어를 함께 설계하는 과정에서 나온다고 주장한다.
- 추론 성능은 응답 속도와 한 번에 처리하는 사용자 수 사이에서 달라진다. 세미애널리시스는 이 관계를 최신 모델과 장비로 매일 측정하는 InferenceX를 운영한다.
- 파텔에 따르면 GPU와 TPU의 우열은 칩만 떼어 비교하기 어렵다. 모델의 구조와 네트워크 설계가 어떤 장비에 맞춰졌는지가 결과를 바꾼다.
- 연산 수요가 계속 공급을 앞설지는 모델이 수행할 수 있는 경제적 가치가 있는 작업이 얼마나 빨리 늘어나는지에 달려 있다.
반도체 연구에서 추론 측정까지
파텔은 어린 시절 고장 난 게임기를 직접 열어 고친 일을 계기로 하드웨어에 관심을 갖게 됐다고 말했다. 이후 온라인 포럼에서 반도체와 스마트폰, GPU를 꾸준히 살폈다. 직장을 떠난 뒤에는 자신의 이름으로 세미애널리시스 블로그를 시작했고, 반도체 공급망의 여러 분야를 배우기 위해 각종 학회와 산업 행사에 다녔다.
그가 강조한 것은 연구 발표만으로는 현재 산업 현장을 알기 어렵다는 점이다. 특정 기술이 기존 공정과 어떻게 다른지, 어떤 기업이 부품이나 소재를 공급하는지는 현장 관계자에게 묻고 확인해야 한다는 설명이다. 그는 한 행사에서 과거 유일한 화학 소재 공장의 화재가 메모리 가격 급등으로 이어졌다는 이야기를 들었다고 소개했다. 이 사례는 공급망의 작은 연결 고리가 전체 산업에 영향을 줄 수 있다는 그의 관심을 보여준다.
추론 성능에는 하나의 순위가 없다
추론은 학습된 AI 모델이 입력을 받아 답을 만들어 내는 과정이다. 파텔은 모델과 추론 소프트웨어가 계속 바뀌기 때문에 한 시점의 성능 시험 결과가 빠르게 낡는다고 봤다. 세미애널리시스가 만든 InferenceX는 여러 종류의 칩에서 최신 모델과 설정을 반복 측정하고, 결과와 설정을 공개하는 방식으로 이 문제에 대응한다.
그가 가장 중시하는 지표는 처리량과 응답 속도의 관계다. 한 장비에서 많은 사용자의 요청을 묶으면 전체 처리량을 높일 수 있지만 개인이 받는 답은 느려질 수 있다. 반대로 한 사용자에게 자원을 집중하면 응답은 빨라져도 같은 장비의 전체 처리량은 줄어든다. 파텔의 예시에서는 사용자 100명에게 초당 10토큰씩 제공하면 전체 처리량은 초당 1,000토큰이다. 사용자 한 명에게 초당 250토큰을 제공하는 설정은 더 빠른 응답을 주지만 전체 처리량은 낮다. 따라서 밤새 문서를 처리하는 작업과 빠른 피드백이 필요한 작업의 적절한 설정은 다르다.
‘100배’ 주장의 중심은 공동 설계
파텔은 최근 효율 개선을 하드웨어의 발전만으로 설명하는 견해에 반대했다. 그의 판단으로는 모델 자체의 개선도 컸고, 가장 큰 효과는 모델 구조와 소프트웨어, 칩을 함께 조정할 때 나타난다. 그는 각 층을 따로 개선하면 2배씩의 향상에 그칠 수 있는 경우에도 층 사이의 설계를 맞추면 100배에 이르는 개선이 가능하다고 설명했다. 이는 모든 공동 설계가 100배 성능을 낸다는 측정 결과가 아니라, 층별 최적화만 합산해서는 효과를 설명하기 어렵다는 그의 주장이다.
사례로 든 것은 딥시크다. 파텔에 따르면 모델 안에서 작업을 나눠 맡는 구성 요소인 ‘전문가’의 크기와 연산 형태가 특정 엔비디아 칩에 맞춰 설계됐다. 칩 간 데이터 교환 방식과 모델의 연산 구조까지 연결되므로, 같은 모델이 다른 칩에서는 같은 효율로 작동하지 않을 수 있다. 그는 구글 TPU가 다른 유형의 모델에는 강점을 보이더라도 딥시크를 실행하는 데는 불리할 수 있다고 말했다.
GPU와 TPU를 가르는 모델 구조
파텔은 엔비디아 GPU와 구글 TPU 가운데 하나가 보편적으로 우수하다고 결론 내리기 어렵다고 봤다. 행렬 연산 장치의 크기, 칩 사이의 연결 방식, 모델이 사용하는 연산 형태가 서로 영향을 주기 때문이다. 특정 장비에 맞게 모델을 설계할수록 다른 장비로 옮겼을 때의 성능은 떨어질 수 있다.
그는 공개된 모델 생태계도 장비 선택에 영향을 준다고 설명했다. 한 장비에 맞춰 설계된 모델이 널리 쓰이면, 이를 가져다 서비스를 만드는 기업도 그 장비를 선택할 이유가 생긴다. 동시에 모델 연구 방향은 바뀔 수 있어 한 구조에만 맞춘 전용 칩에는 위험이 있다. 파텔은 이런 이유로 범용 AI 연산 장비에도 시장이 남을 것으로 예상했다.
병목은 메모리에서 전력과 데이터센터까지 이어진다
파텔이 기술적 병목으로 꼽은 분야 중 하나는 메모리 대역폭이다. 그는 메모리를 칩과 별도로 쌓는 현재 방식에서, 칩 위에 직접 쌓는 방식으로 바뀌면 대역폭을 크게 높일 가능성이 있다고 봤다. 다만 이를 앞으로 등장할 기술로 설명했다. 칩에 더 많은 전력을 공급해 필요한 실리콘 면적을 줄이려는 시도도 언급했지만, 발열과 전기적 간섭이라는 공학적 문제가 따른다고 덧붙였다.
데이터센터에서는 같은 전력 규모라도 실제 가치를 똑같이 볼 수 없다고 했다. 장비의 성능뿐 아니라 전력망과 네트워크의 안정성, 완공 지연 가능성, 작업량에 맞춰 전력을 배분하는 능력이 다르기 때문이다. 파텔은 기존 대형 클라우드 기업이 전통적인 CPU 서비스에서 쌓은 강점이 AI용 GPU 임대 시장에 그대로 이어지지는 않았다고 분석했다. GPU는 서버 전체나 여러 랙 단위로 장기간 빌리는 경우가 많아, 기존의 자원 분할 방식이 주는 이점도 달라진다는 설명이다. 이 틈에서 AI 연산 자원에 특화된 신생 클라우드 기업들이 기회를 얻었다고 봤다.
수요 전망을 결정하는 조건
파텔은 모델이 더 많은 가치 있는 일을 수행할수록 연산 수요가 늘어날 것으로 예상했다. 최근에는 모델이 할 수 있는 작업의 범위가 연산 공급보다 빠르게 커졌다는 것이 그의 판단이다. 그러나 이를 계속될 사실로 단정하지는 않았다. 모델이 수행할 수 있는 경제적 가치가 있는 작업이 연산 용량보다 빠르게 늘지 못하면 현재의 수급 관계도 바뀔 수 있다고 명시했다.
그의 논지는 특정 칩이나 데이터센터의 승자를 고르는 데서 끝나지 않는다. 추론의 속도와 비용은 모델 구조, 소프트웨어 설정, 칩, 전력과 운영 방식을 함께 놓고 봐야 한다는 것이다.
댓글 0
첫 댓글을 남겨 주세요.