# AI 코딩 에이전트의 토큰 낭비를 줄이는 방법

> 2026-09-10 · 큐레이션 김태우
> https://challengekim.com/insights/reduce-ai-coding-agent-token-waste-model-routing-strategy-ko
> 원문: https://engineering.atspotify.com/2026/9/portal-by-spotify-cut-my-claude-code-token-usage-by-90

## 핵심 요약

- **AI 코딩 비용 위기**: 2028년까지 AI 코딩 비용이 평균 개발자 급여를 초과할 것으로 예상되며, 이미 많은 엔지니어링 리더가 개발자당 월 200\~500달러를 토큰에 소비 중
- **I/O 작업의 역할**: AI 모델이 실제 사고가 아닌 입출력(I/O) 작업에 프론티어 모델을 과도하게 사용하면서 토큰 낭비 심화
- **모델 라우팅 솔루션**: 두 가지 모드(bulk-reader, code-writer)로 I/O 작업을 저가 모델에 위임하면 평균 90% 토큰 절약 가능
- **재사용 가능 구조**: Spotify Portal의 AiKA 모드 기반 시스템으로 플러그인 하나로 모든 프로젝트에 적용 가능

## AI 코딩 비용, 이미 손에서 벗어났다

AI 코딩 에이전트가 개발자를 위해 하는 일의 대부분은 고차원적 사고가 아닙니다. 그것은 **입출력(I/O) 작업** 입니다.

하나의 메서드에 대한 질문에 답하기 위해 다섯 개의 파일을 읽습니다. 기존 테스트 파일 20개와 정확히 동일한 패턴을 따르는 새로운 테스트를 생성합니다. 회의 후 문서를 업데이트합니다. 이 모든 과정에서 수천 개의 토큰이 소모되지만 실제 추론은 거의 없습니다.

문제는 이러한 I/O 작업을 **프론티어(최고급) 모델** 에 공급하고 있다는 점입니다. 비용 대비 효율을 생각해보면, 이는 심각한 낭비입니다.

이미 산업 전체가 이 문제를 직면하고 있습니다. **2028년까지 AI 코딩 비용은 평균 개발자 급여를 초과할 것으로 예상** 되며, 현재 엔지니어링 리더의 4분의 1은 개발자당 월 200\~500달러를 토큰에 소비하고 있습니다. 일부는 2,000달러를 훨씬 넘습니다.

## 해결책: 두 가지 모드의 모델 라우팅

새로운 플랫폼이나 구독이 필요하지 않습니다. **단지 두 가지 모드만 있으면 됩니다.**

### Spotify Portal의 AiKA 모드란?

AiKA 모드는 임시 런타임에서 실행되는 선언적 에이전트입니다. 지침을 정의하고 모델을 선택하고 매개변수를 설정한 뒤 도구를 연결하면, Portal이 나머지를 처리합니다. 관리할 인프라나 장기 실행 서버가 없습니다.

### 모드 1: bulk-reader (대량 파일 읽기)

Claude가 여러 개의 큰 파일을 읽어야 할 때 사용합니다. 워커 모델이 파일을 분석한 후 요약을 반환하므로, Claude는 원본 파일을 절대 보지 않습니다.

**실제 효과**: 파일 크기가 350줄(구성 가능)을 초과하면 자동으로 위임되어 **90%의 토큰을 절약** 합니다.

### 모드 2: code-writer (코드 생성)

테스트, 설정 스캐폴딩, 기존 패턴을 따르는 모든 코드 생성 작업에 사용합니다. 사양과 참조 파일만 전달하면, 워커가 코드를 생성하고 디스크에 직접 씁니다. Claude는 생성된 코드를 절대 봅니다.

**효율성**: 기존 패턴을 일치시키기만 하면 되므로 저가 모델도 충분히 처리 가능합니다.

## 계층화된 위임: 자동화된 라우팅 체계

### 레이어 1: 훅(Hooks)

Claude Code 훅이 모든 도구 호출 전에 실행됩니다.

- **check-file-size**: 파일이 줄 임계값(기본 350줄)을 초과하면 읽기를 차단하고 bulk-reader로 리디렉션
- **check-bash-read**: 큰 파일에 대한 cat, head, tail 등 명령어를 포착하여 위임

임계값은 환경변수 `SHUNT_MIN_LINES`로 구성 가능합니다.

### 레이어 2: 스크립트

Portal CLI 호출을 래핑하는 bash 스크립트가 요청 빌드, 액션 호출, 토큰 사용량 보고를 처리합니다.

**bulk-read 예시**:
```
bulk-read --question "What does this service do?" --paths src/Service.java src/Handler.java
```

**code-write 예시**:
```
code-write --spec "Write tests for UserService" --reference tests/OrderTest.java --target tests/UserTest.java
```

### 레이어 3: 스킬(Skills)

Claude에게 스크립트를 언제 어떻게 호출할지 알려주는 마크다운 파일입니다. 훅이 읽기를 차단하면, 차단 메시지는 Claude를 올바른 스킬로 안내합니다.

## 벤치마크: 실제 토큰 절약 효과

Java 모노레포를 대상으로 테스트한 결과, **bulk-read 절감률은 평균 90%에 달했습니다.**

code-write 시나리오에서는 코드가 디스크로 직접 이동하므로 Claude가 본 적 없는 출력 토큰을 완전히 절약할 수 있습니다.

## 이 방식의 한계

**편집은 위임할 수 없습니다**: 워커 모델의 요약에는 신뢰할 수 있는 줄 번호가 포함되지 않으므로, 분석 기반 편집이 필요하면 여전히 특정 섹션을 직접 읽어야 합니다.

**추론은 위임할 수 없습니다**: 워커 모델이 표면적 패턴을 발견하지만, 미묘한 스레드 안전성 버그 같은 심층 분석은 Claude의 역할입니다.

**지연 시간 누적**: 각 위임은 네트워크 왕복입니다. 응답 시간은 일반적으로 10\~30초이며, Portal은 단일 호출을 30초로 제한합니다.

## 모드의 진정한 가치: 재사용성과 조합성

AiKA 모드의 핵심 강점:

- **재사용 가능**: 동일한 bulk-reader와 code-writer 모드가 모든 프로젝트에서 작동
- **공유 가능**: 공개 모드는 누구든 즉시 사용 가능
- **조합 가능**: doc-writer, reviewer, translator 등 새로운 모드를 쉽게 추가 가능
- **분리된 설계**: 플러그인(언제 위임할지)과 모드(어떻게 응답할지)가 분리되어 있어, 워커 모델만 바꿔도 플러그인 수정 불필요

이를 통해 모델 라우팅이 **시스템 엔지니어링 문제에서 단순한 구성 문제로 전환** 됩니다.

## 직접 사용해보기

1. spotify/portal-ai-plugins 마켓플레이스에서 플러그인 설치
2. Claude Code에서 `/portal:setup` 실행하여 Portal 인스턴스 인증
3. 여러 파일에 걸친 질문 시 자동으로 위임 시작

대량 읽기와 코드 작성 모드는 이미 공개되어 있으므로 별도로 만들 필요가 없습니다.

## 결론

AI 코딩 비용 위기는 더 비싼 모델이 아니라 **더 똑똑한 라우팅** 으로 해결됩니다. I/O 작업을 저가 모델에 위임하면 토큰 낭비 없이 프론티어 모델의 진정한 가치를 살릴 수 있습니다. 두 가지 모드와 자동화된 훅만으로도 평균 90%의 토큰을 절약하세요.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://engineering.atspotify.com/2026/9/portal-by-spotify-cut-my-claude-code-token-usage-by-90)
