# AI 추론 비용을 낮추는 법: 빠른 응답 대신 처리량을 택한 이유

> 2026-08-25 · Invest Like the Best · 큐레이션 김태우
> https://challengekim.com/insights/ai-추론-비용을-낮추는-법-빠른-응답-대신-처리량을-택한-이유
> 원문: https://www.youtube.com/watch?v=uyzqxIoiobU

## 핵심 요약

- 인터뷰이는 오픈소스 언어모델의 토큰을 낮은 비용으로 공급하고, 장시간 실행되는 에이전트를 위한 클라우드 환경을 제공한다고 설명했다.
- 사용자가 응답을 기다리는 작업과 백그라운드 작업은 요구 조건이 다르다. 후자는 초당 토큰 생성 속도보다 전체 처리량과 비용을 중시할 수 있다는 주장이다.
- 전략의 핵심은 소프트웨어로 칩 활용도를 높이고, 여러 종류의 칩과 소규모 데이터센터, 간헐적인 전력을 조합하는 데 있다.
- 낮은 가동률을 받아들이려면 작업을 다른 시설로 옮길 수 있어야 한다. 그 과정에서 개별 작업의 지연은 길어질 수 있다.

## 토큰 가격에서 작업 비용으로

인터뷰이가 운영하는 회사는 오픈소스 대규모 언어모델을 사용할 수 있는 API와 장시간 실행되는 에이전트용 클라우드 가상 머신을 제공한다. 현재 목표는 토큰당 비용을 낮추는 것이다. 다만 그는 토큰이 지능적 작업의 최종 단위는 아니라고 본다. 에이전트가 도구를 여러 번 호출하며 과제를 끝내는 경우, 사용자가 원하는 것은 토큰 수보다 결과이고 실제 토큰 사용량은 작업에 따라 달라진다.

그가 주목하는 수요는 사람이 화면 앞에서 답을 기다리는 대화보다 백그라운드에서 오래 진행되는 작업이다. 인터뷰이는 현재 에이전트가 한 시간 정도 실행되는 작업에는 적합하다고 평가했지만, 며칠 동안 안정적으로 일하는 단계에 이르렀다고 말하지는 않았다. 올해 말에는 백그라운드 작업과 실시간 작업의 비중이 비슷해지고, 장기적으로는 백그라운드가 90%에 이를 수 있다고 전망했다. 이는 그의 예상이지 확인된 시장 비중은 아니다.

사례로는 많은 자료를 살피는 심층 조사와 보안 점검을 들었다. 한 고객사는 인터넷 전반의 정보를 색인하고 변화를 감시하려 한다고 설명했다. 보안 분야에서는 에이전트를 여러 방식으로 실행해 코드의 메모리 오류, 업무 로직 오류, 네트워크 취약점을 찾고 수정하는 접근을 소개했다. 큰 모델 하나가 모든 결함을 찾는 것은 아니어서 서로 다른 모델과 점검 방법을 함께 쓰는 것이 중요하다는 설명이다.

## 빠른 한 건과 저렴한 여러 건의 차이

인터뷰이에 따르면 GPU는 많은 연산을 한꺼번에 처리할 때 효율적이다. 여러 사용자의 요청을 묶는 **배치 처리**는 칩의 연산 장치를 더 많이 활용하지만, 배치에 들어간 개별 요청은 다른 요청과 함께 처리되므로 응답이 늦어질 수 있다. 실시간 챗봇에서 중요한 짧은 대기 시간과 대량 작업에서 중요한 처리량 사이에 선택이 생기는 이유다.

그는 엔비디아 GPU 여러 대를 빠르게 연결하는 기술이 짧은 응답 시간에 유리하다고 설명했다. 예컨대 연산을 GPU 8대에 나누면 장비는 8배 쓰지만 통신 비용 등으로 속도는 8배가 되지 않으며, 그의 예시에서는 약 4\~5배 빨라질 수 있다. 밤새 수행하는 에이전트 작업이라면 이런 구성만을 고집할 필요가 없다는 판단이다.

소프트웨어 측면에서는 GPU에서 실행되는 작은 프로그램인 **커널**을 조정하고, 연속된 연산을 합쳐 메모리에 데이터를 쓰고 다시 읽는 일을 줄인다. 다만 인터뷰이는 큰 행렬 연산 자체는 이미 GPU의 최대 성능에 상당히 가까우며, 실제 과제는 칩에 그런 작업을 지속적으로 공급하는 것이라고 짚었다. 팀은 사람이 연산 방식을 설계하고 모델이 커널 구현을 돕는 방식도 사용한다고 설명했다.

## 한 종류의 칩에 의존하지 않는 구성

인터뷰이는 칩의 가치가 성능만으로 결정되지 않으며 구입·운영 비용과 맡길 작업을 함께 봐야 한다고 말한다. 다른 업체의 칩은 GPU 간 연결 성능이 낮더라도 가격 대비 연산 능력이 좋을 수 있다. 그 경우 응답 시간을 최소화하는 작업 대신 다른 병렬 처리 방식이나 백그라운드 작업에 배치하겠다는 구상이다. AMD 칩을 비롯해 여러 아키텍처의 성능을 소프트웨어로 끌어올리는 능력을 회사의 강점으로 제시했다.

메모리도 제약이다. **KV 캐시**는 모델이 대화의 앞선 내용을 처리하며 보관하는 정보로, 사용량과 문맥 길이에 따라 커진다. 인터뷰이는 칩 안의 빠른 메모리에 모델을 올려 응답 속도를 높이는 방식이 이 동적인 캐시의 저장 공간에서는 어려움을 겪을 수 있다고 설명했다. 빠른 칩과 용량이 큰 외부 메모리를 가진 장치를 함께 쓰는 방안을 제시한 이유다. 동시에 현재 KV 캐시가 충분히 압축되지 않았다고 평가했지만, 개선 폭은 확정하지 않았다.

## 작은 데이터센터와 낮은 가동률의 조건

그의 구상은 대형 시설 한 곳에 연산 장비를 모으기보다 여러 소규모 시설의 용량을 합치는 것이다. 인터뷰이는 학습용 시설에는 칩 사이의 높은 통신 대역폭과 대규모 집적이 중요하지만, 일부 추론 작업은 분산된 시설에서도 처리할 수 있다고 봤다. 미국에서는 대규모 전력을 한곳에 확보하기가 어렵고, 상대적으로 작은 전력 공급원을 찾기는 쉽다는 것이 그의 설명이다.

이 방식에는 신뢰성의 대가가 따른다. 그는 일부 시설에 예비 발전기나 중복 네트워크를 두지 않고, 가동률이 95%인 시설도 가격이 맞으면 사용하겠다고 말했다. 개별 시설의 장애가 서로 연동되지 않고 제어 시스템이 작업을 다른 곳으로 옮길 수 있다는 조건에서다. GPU가 중단된 에이전트 작업은 새 장비를 찾는 동안 수분, 경우에 따라 약 10분 더 지연될 수 있다. 따라서 평균 처리량은 경쟁력을 갖추더라도 느린 쪽에 속하는 요청의 지연 시간은 일정하게 보장하기 어렵다고 설명했다.

태양광·풍력처럼 공급이 끊길 수 있는 전력도 같은 논리로 검토한다. 인터뷰이는 날씨에 따른 장기간 중단까지 감수하고 다른 지역의 연산 용량으로 작업을 옮길 수 있다고 주장했다. 다만 이는 이전할 용량이 확보되고 칩 가격이 충분히 낮아 일부 장비가 쉬는 비용을 감당할 수 있을 때 성립한다.

## 비용 전망과 남은 한계

인터뷰이는 토큰 가격을 크게 낮추고 싶다고 말했지만, 그 수치를 현재 달성한 가격으로 제시하지 않았다. 하루 1조 토큰 사용을 가정한 대목에서도 현행 가격으로는 1인당 하루 최소 수백만 달러가 든다는 대담 속 계산을 바탕으로, 토큰당 비용이 여러 자릿수 낮아져야 한다고 말했다. 모델 크기에 따라 이미 1조 토큰 비용이 수만 달러에 가까워지는 경우가 있다는 주장도 덧붙였다. 이를 모든 모델과 작업에 적용되는 가격으로 볼 수는 없다.

그는 낮은 비용이 검증 가능한 과제를 더 오래 탐색하게 할 수 있다고 기대한다. 반면 글의 품질이나 예술의 아름다움 같은 인간의 취향은 같은 방식으로 해결됐다고 보지 않는다. 결국 이 구상은 모든 AI 작업을 동일하게 싸게 만드는 계획이 아니라, 지연을 감수할 수 있는 작업에 남는 칩·분산된 전력·높은 처리량을 맞춰 쓰려는 시도다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=uyzqxIoiobU)
