# AI 추론 시장 세분화: 모델 선택의 다양성

> 2026-08-30 · Tom Tunguz · 큐레이션 김태우
> https://challengekim.com/insights/ai-inference-market-segmentation-model-selection-diversity-ko
> 원문: https://tomtunguz.com/yeltsin-in-the-ai-aisle/

## 핵심 요약

- **토큰 시장의 세분화**: OpenRouter 데이터에 따르면, 1년 된 GPT-OSS-120b가 Claude Opus 4.8 일일 토큰 볼륨의 36%를 처리하고 있으며, GLM 5.2는 4950억 토큰으로 선두를 차지
- **크기·출처·아키텍처의 다양성**: AI 모델은 용도에 따라 소형·중형·대형으로 구분되고, 밀집형 또는 희소형(MoE) 아키텍처로 나뉨
- **MoE 아키텍처의 혁신**: 1180억 매개변수를 가진 Laguna S 2.1이 260억 매개변수 모델과 동일한 디코딩 비용으로 작동하며, 도구 호출 실패율 7%포인트 감소 달성
- **경쟁으로 인한 다양화**: Anthropic이 Opus 5를 출시하고, Poolside가 Laguna S 2.1을 선보이는 등 중간 모델 시장이 확대 중

## 토큰 시장이 세분화된 배경

AI 추론 시장은 단순히 "더 크고 더 좋은" 모델을 추구하던 시대에서 벗어났습니다. **비용, 속도, 정확도** 라는 세 가지 축에 따라 세분화되고 있습니다.

OpenRouter의 일일 토큰 처리량을 보면 이를 분명히 알 수 있습니다. GLM 5.2가 4950억 토큰으로 선두를 달리고 있으며, Claude Opus 4.8은 1996억 토큰을 처리합니다. 놀랍게도 **2025년 8월에 출시된 1년 된 GPT-OSS-120b는 여전히 713억 토큰으로 Opus의 약 36%를 차지** 하고 있습니다. 이는 최신 모델이 모든 용도에 필요하지 않다는 뜻입니다.

## 다양한 선택지가 생기는 이유

**모델의 차이는 크기뿐만 아니라 여러 차원에서 나타납니다:**

- **크기**: 소형(26B), 중형(118B), 대형(200B+)
- **출처**: OpenAI, Anthropic 등 미국 모델과 GLM 등 중국 모델
- **아키텍처**: 모든 매개변수가 활성화되는 밀집형과 필요한 매개변수만 활성화하는 MoE(Mixture-of-Experts) 희소형
- **정확도**: 코딩 특화 또는 일반 목적
- **속도**: 초당 토큰 생성 속도
- **모달리티**: 텍스트 전용 또는 비전 포함

이러한 다양성 때문에 사용자들이 자신의 필요에 맞는 모델을 선택할 수 있게 되었습니다.

## MoE 아키텍처가 바꾼 로컬 세그먼트

**가장 주목할 만한 변화는 MoE(Mixture-of-Experts) 아키텍처의 등장** 입니다. 필자는 주말에 에이전트를 구동하는 모델을 Gemma 4 26B에서 **Laguna S 2.1(118억 매개변수)로 교체했습니다.**

예상상으로는 더 큰 모델이 더 느려야 하지만, 실제로는 M5 Max에서 **두 모델 모두 동일한 속도로 생성됩니다.** 이는 Laguna가 MoE 아키텍처를 사용하기 때문입니다. 118억 개의 매개변수가 메모리에 있지만, **토큰당 80억 개만 활성화되므로**, 결과적으로 **118억 매개변수 모델이 260억 매개변수 모델과 동일한 디코딩 비용으로 작동** 합니다.

실제 성능에서도 차이가 나타났습니다. 필자의 로컬 코딩 및 이메일 에이전트에서 도구 호출 실패율을 측정한 결과, **Laguna S 2.1은 Gemma 4 26B (27.1%)보다 20.1%의 실패율을 기록해 약 7%포인트 개선** 되었습니다.

## 경쟁이 세분화를 가속화하는 중

최근 경쟁이 모델 다양성을 더욱 가속화하고 있습니다. Anthropic은 **Opus 5를 반값의 저가형 모델로 출시** 했으며, Poolside는 **Laguna S 2.1이라는 중간 모델을 선보였습니다.** 이는 각 가격대와 성능대별로 경쟁이 치열해지고 있음을 의미합니다.

## 결론

AI 추론 시장의 세분화는 건강한 경쟁 시장의 신호입니다. 더 이상 모든 토큰을 최고 사양의 모델로 처리할 필요가 없으며, **로컬 노트북 세그먼트는 훨씬 더 높은 수준의 품질을 제공** 할 수 있게 되었습니다. 이는 경쟁이 필연적으로 이끌어갈 미래의 방향입니다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://tomtunguz.com/yeltsin-in-the-ai-aisle/)
