# AI 모델의 속도와 가격을 가르는 것은 무엇인가

> 2026-04-29 · Dwarkesh Patel · 큐레이션 김태우
> https://challengekim.com/insights/ai-모델의-속도와-가격을-가르는-것은-무엇인가
> 원문: https://www.youtube.com/watch?v=xmkSf5IS-zw

## 핵심 요약

- MatX CEO 라이너 포프는 AI 추론의 속도와 토큰당 비용을 **연산량과 메모리에서 데이터를 읽는 시간**으로 근사했다.
- 여러 이용자의 요청을 묶는 배치는 모델 가중치를 읽는 비용을 나눠 부담하게 한다. 배치를 키워도 연산과 각 요청의 KV 캐시 비용은 사라지지 않는다.
- 문맥이 길어질수록 이전 토큰의 정보를 담은 KV 캐시를 읽는 부담이 커진다. 포프는 이를 긴 문맥의 주요 비용 제약으로 봤다.
- 전문가 혼합 모델은 전문가를 여러 GPU에 나눠 배치한다. 이때 GPU 간 통신 속도와 한 번에 빠르게 연결할 수 있는 칩의 범위가 중요해진다.
- 공개되지 않은 모델의 학습량이나 내부 구조를 가격에서 역산하는 대목은 가정에 따른 추정이다.

## 빠른 응답과 저렴한 응답 사이

포프는 추론 비용을 이해하기 위해 모델의 활성 매개변수를 계산하는 시간과, 전체 가중치 및 **KV 캐시**를 메모리에서 읽는 시간을 비교했다. KV 캐시는 새 토큰이 이전 토큰을 참고할 때 쓰는 내부 표현이다. 그의 계산은 실제 실행 시간을 정확히 예측하는 식이 아니라, 그보다 빨라질 수 없는 하한을 구하는 근사다. 주의 연산 비용은 상대적으로 작다고 보고 계산에서 제외했다.

배치 크기는 한 번의 실행에서 다음 토큰을 생성하는 서로 다른 시퀀스의 수다. 배치가 작으면 많은 모델 가중치를 소수의 출력 토큰을 위해 읽어야 한다. 배치를 키우면 이 읽기 비용을 여러 요청에 나눌 수 있어 토큰당 비용이 낮아진다. 대신 한 번의 실행에 필요한 연산량이 늘어 지연 시간도 길어진다.

배치를 무한히 키운다고 비용이 계속 떨어지지는 않는다. 각 시퀀스의 계산과 KV 캐시는 다른 시퀀스와 공유할 수 없기 때문이다. 따라서 느린 응답을 허용하더라도 가격을 낮출 수 있는 폭에는 한계가 있다는 설명이다. 반대로 배치를 줄여 속도를 높여도 가중치를 메모리에서 읽는 시간 이하로 내려갈 수는 없다.

## 배치의 규모와 기다리는 시간

포프는 설명을 단순하게 하려고 KV 캐시 읽기를 잠시 제외하고, 가중치를 읽는 시간과 계산 시간이 같아지는 배치를 구했다. 그가 제시한 GPU의 연산 성능 대 메모리 대역폭 비율은 대략 300이다. 여기에 전체 매개변수 대비 활성 매개변수의 비율을 반영하면 필요한 배치 크기를 어림할 수 있다. DeepSeek 모델을 예로 든 계산에서는 실무상 여유를 더해 약 2,000개의 시퀀스를 한 번에 처리하는 규모를 말했다. 이는 하나의 긴 시퀀스에 담긴 토큰 수가 아니다.

요청을 모두 모을 때까지 매번 기다려야 한다는 뜻도 아니다. 포프가 든 운영 예시에서는 새 배치가 약 20밀리초마다 시작된다. 자리가 비어도 실행하고, 가득 차면 뒤에 도착한 요청은 다음 배치를 기다린다. 막 배치가 출발한 뒤 도착했다면 대기와 실행에 각각 최대 20밀리초가 걸리는 예시다. 포프는 메모리 용량을 대역폭으로 나눈 시간이 여러 HBM 세대에서 이 정도 규모라고 설명했다. 이 수치들은 특정 서비스의 보장된 응답 시간이 아니다.

## 긴 문맥을 비싸게 만드는 KV 캐시

새 토큰 하나를 생성할 때는 이전 문맥의 KV 캐시를 읽어야 한다. 포프가 사용한 밀집 어텐션 근사에서는 이 읽기량이 문맥 길이에 따라 선형으로 늘어난다. 문맥이 길어져 메모리 읽기 시간이 계산 시간을 넘으면, GPU의 연산 능력을 더 갖춰도 그만큼 속도가 오르지 않는다.

희소 어텐션은 이전 토큰 전부가 아닌 일부를 살펴 읽기 부담을 줄일 수 있다. 포프는 DeepSeek가 발표한 방식처럼 문맥 길이에 따른 비용 증가를 완화하는 사례를 언급했다. 다만 너무 적은 토큰만 참고하면 품질이 떨어질 수 있다고 덧붙였다. 그가 긴 문맥의 주된 제약으로 꼽은 것은 어텐션 계산 자체보다 메모리 대역폭과 용량이다.

KV 캐시를 계속 보관하는 것도 무료는 아니다. 지우면 다음에 토큰에서 다시 계산해야 하고, 보관하면 저장 공간을 차지한다. 포프는 HBM, 호스트의 DDR, 플래시처럼 저장 위치에 따라 보관 비용과 다시 가져오는 비용이 달라진다고 설명했다. 대화 중 API의 캐시 보관 시간을 특정 저장 장치와 연결한 부분은 공개된 내부 구현의 확인이 아니라 비용을 바탕으로 한 추측이다.

## 전문가를 GPU에 나눠 담을 때

**전문가 혼합 모델(MoE**)은 입력마다 여러 전문가 중 일부만 활성화한다. 이 방식은 계산할 매개변수를 줄일 수 있지만, 전체 전문가의 가중치를 저장해야 하고 입력을 담당 전문가에게 보내야 한다. 포프는 DeepSeek의 256개 전문가를 64개 GPU에 나눠 담는 예시로 GPU 간 통신을 설명했다.

어느 GPU의 토큰이든 다른 GPU의 전문가로 갈 수 있어, 같은 랙 안에서는 폭넓고 빠른 상호 연결이 유리하다. 포프가 설명한 엔비디아 구성에서 랙 밖으로 나가는 연결은 랙 안 연결보다 대역폭이 대체로 약 8배 낮다. 전문가 계층을 여러 랙에 걸치면 랙 사이 이동이 병목이 될 수 있다는 분석이다. 랙을 크게 만드는 데에는 케이블 밀도뿐 아니라 전력, 냉각, 무게 같은 물리적 제약도 따른다.

여러 랙을 쓰는 다른 방법은 모델의 계층을 나눠 순서대로 처리하는 **파이프라인 병렬화**다. 이는 각 랙에 놓이는 가중치를 줄인다. 그러나 추론 중 모든 단계를 계속 바쁘게 돌리려면 동시에 진행하는 시퀀스도 늘어야 한다. 포프의 단순화한 계산에서는 그에 따른 KV 캐시 증가가 계층 분할로 얻는 KV 저장 공간 절감을 상쇄한다. 그는 추론에서 전문가 병렬화는 적극적으로 쓰되, 파이프라인은 가중치 저장에 필요한 만큼만 쓰는 편이 낫다고 봤다. 여러 랙 사이를 순서대로 오가는 지연도 고려해야 한다.

## 학습량과 API 가격에서 읽을 수 있는 것

포프는 모델을 얼마나 오래 사전학습할지 판단할 때 학습 비용만 볼 수는 없다고 말했다. 작은 모델에 학습 계산을 더 쓰면 이후의 강화학습 생성과 이용자 추론이 저렴해질 수 있다. 그는 사전학습, 강화학습, 추론 비용이 비슷한 규모에서 균형을 이룰 수 있다는 휴리스틱을 제시했다. 다만 각 비용의 실제 수치와 모델별 트래픽이 공개되지 않아, 대화 중 나온 학습 토큰 수와 ‘친칠라 최적치의 약 100배’라는 값은 거친 가정에 의존한다고 거듭 밝혔다.

API 가격도 내부 비용을 짐작하는 단서로 다뤘다. 긴 문맥에 가격이 더 붙는 구조는 KV 캐시 읽기 비용과 부합할 수 있다. 입력을 한꺼번에 처리하는 프리필보다 출력 토큰을 하나씩 생성하는 디코드가 비싼 구조 역시, 디코드에서 메모리 읽기 부담이 크다는 설명과 맞는다. 포프가 가격을 바탕으로 추정한 모델의 토큰당 KV 캐시 크기나 내부 어텐션 방식은 실제 설계가 확인된 결과가 아니다.

## 결론

포프의 설명에서 추론 속도와 가격은 연산 성능 하나로 결정되지 않는다. 가중치를 몇 개의 요청에 나눠 읽는지, 긴 문맥의 KV 캐시를 얼마나 옮기는지, 전문가 사이의 데이터를 어떤 연결로 보내는지가 함께 작용한다. 대담의 수치 계산은 이 제약을 이해하기 위한 근사이며, 개별 AI 서비스의 내부 구조를 확정해 보여주지는 않는다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=xmkSf5IS-zw)
