# AI 제품 PM이 말하는 토큰 극대화와 미래 준비법

> 2026-07-26 · Lenny Rachitsky · 큐레이션 김태우
> https://challengekim.com/insights/ai-product-pm-token-optimization-model-development-evals-replacing-prd-ko
> 원문: https://www.youtube.com/watch?v=tivaWTTVRhY

## 핵심 요약

- **토큰 사고가 필수**: 픽셀 최적화처럼 토큰(AI 모델의 입출력 단위)을 꼼꼼하게 분석하고 최대화해야 함
- **평가(Evals)가 새로운 PRD**: 사용자 피드백을 기반으로 한 평가가 전통적 제품 요구사항 문서를 대체하고 있음
- **근본 원칙 사고가 핵심**: 패턴 매칭이 아닌 첫 번째 원칙에서 사용자 가치를 파악하는 능력이 가장 중요
- **모델 발전의 불연속적 도약**: 스케일링 법칙으로는 예측 불가능한 새로운 능력이 갑자기 나타남
- **직접 구축이 필수**: PM과 리더십도 실제로 AI 도구를 만들고 사용해봐야 함

## 앤트로픽의 초기 전환점들

2023년 초만 해도 Anthropic은 OpenAI의 경쟁 상대로 간주되지 않았습니다. 당시 제품 팀은 5명의 엔지니어로 구성되어 있었고, API 비즈니스 전체를 담당하는 인원은 단 한 명이었습니다. 하지만 회사의 강력한 문화와 미션이 이 작은 팀을 움직였습니다.

**'골든 게이트 클로드' 실험** 이 변곡점이 되었습니다. 2024년 초, 해석 가능성 연구에서 발견한 모델 특징을 활용해 Claude가 금문교에 집착하도록 만드는 경험을 24시간 만에 Claude.ai에 출시했습니다. 2,000명 정도만 경험했지만, 이를 통해 팀은 깨달았습니다: 우리는 경쟁사와 다른 방식으로 독창적인 경험을 만들 수 있다는 것.

**Opus 3의 성공** 도 중요했습니다. 모델이 코딩에 탁월하도록 훈련하기로 결정했을 때, 이는 작은 훈련 조정이었지만 초기 사용자들에게 엄청난 가치를 제공했습니다. 당시만 해도 사람들은 AI가 긴 형식의 코드를 작성할 수 있다고 생각하지 않았습니다.

## "평가가 새로운 PRD다"

AI 제품 관리의 가장 큰 변화는 평가(Evals)가 전통적 PRD(제품 요구사항 문서)를 대체한다는 것입니다.

초기 사례로 Claude 2 시절, 사용자들이 "지시를 잘 따르지 못한다"고 피드백했습니다. 팀이 깊이 파고들자, **약 80%의 실패가 Claude가 올바른 JSON 형식을 생성하지 못하는 데서 비롯** 되었습니다. 이를 바탕으로 30\~40가지 실패 사례를 수집해 평가 세트를 만들었고, 이제 새 모델 출시 때마다 이 평가를 실행합니다. 현재 이 평가는 99.9% 정확도를 보여주며, 더 이상 주요 문제가 아니라는 뜻입니다.

**평가 작성의 3단계**:

1. 사용자 피드백 수집 및 세부 분석
2. 고충의 패턴과 원인 파악 (환각? 도구 사용 실패? 지식 부족?)
3. 표준화된 테스트 케이스로 변환하여 연구팀에 전달

이 과정 없이는 연구팀이 어디를 개선해야 할지 알기 어렵습니다.

## PM이 해야 할 일의 변화

AI 시대에 PM의 역할은 근본적으로 달라졌습니다.

**픽셀에서 토큰으로의 전환**: 과거 제품 관리자는 UI/UX 픽셀을 최적화했습니다. 이제는 토큰을 최적화합니다. 제품 담당자들은 사용자 피드백에서 나오는 실패 궤적을 읽고, 모델이 과신했는지, 환각을 일으켰는지, 도구를 호출해야 했는지를 판단해야 합니다.

**직접 사용이 필수**: Anthropic의 창의적인 사상가들과 최고의 프로토타입 제작자들은 매 버전의 Claude와 직접 상호작용하는 데 많은 시간을 씁니다. 기술을 직접 다뤄보지 않고 완벽한 전략을 고안하기는 불가능합니다.

## 스케일링 법칙을 넘어선 '새로운 능력'

AI 개발을 이해하는 데 필수적인 개념이 있습니다: **새로운 능력의 불연속적 도약**.

일반적으로 알려진 스케일링 법칙은 부드러운 선형 곡선을 보여줍니다. 더 많은 컴퓨팅과 데이터를 투입할수록 손실이 점진적으로 감소한다는 것입니다. 하지만 실제로는 특정 지점에서 새로운 능력이 갑자기 나타납니다.

예를 들어, 어떤 모델은 "1+1"을 계산하지 못하다가 갑자기 안정적으로 계산할 수 있게 됩니다. 이 도약이 언제 일어날지는 예측하기 어렵고, 이를 발견하려면 적절한 평가 시스템이 필수입니다.

## Labs 팀: "불연속적인 베팅"의 장

Anthropic은 핵심 제품 팀 외에 별도의 Labs 팀을 두고 있습니다. 이 팀의 역할은 **10배, 100배, 심지어 1000배의 개선** 으로 이어질 수 있는 아이디어를 탐색하는 것입니다.

**성공 조건**:

- 소규모 팀 구성 (때로는 개인부터 시작)
- 강한 테마/방향성은 유지하되, 정확한 프로토타입은 유연하게
- 실패를 학습의 기회로 봄
- 공개적인 실험과 아이디어 공유 문화

초기에는 Slack 채널에서 여러 팀원들이 Claude를 테스트하고 다양한 사용 사례를 시도했습니다. 이러한 공동 발견이 이후 Claude Code, Skills, MCP 같은 혁신 제품으로 발전했습니다.

## AI 시대의 제품 관리자 채용

성공적인 AI 제품 팀을 만드는 데 필수적인 특성은:

1. **근본 원칙 사고**: 패턴 매칭이 아닌 첫 번째 원칙에서 사용자 가치를 파악하는 능력
2. **세부 사항에 대한 몰입**: 모든 것을 높은 수준에서만 다루지 않고 깊이 파고드는 태도
3. **동료와의 신뢰**: 자기중심적이 아닌 팀 지향적인 사람
4. **기술에 대한 진정한 사랑**: AI를 단순히 업무 도구가 아닌 탐색 대상으로 보는 열정

특히 Anthropic에서는 이러한 특성을 가진 사람들이 빠른 결정과 신뢰 기반의 협업을 가능하게 합니다.

## Claude를 "생각의 파트너"로 활용하기

PM들이 Claude를 활용하는 방식도 변화하고 있습니다. 단순한 업무 자동화를 넘어, **사고의 보강** 이 중요해집니다.

효과적인 활용법:

- **먼저 관점 개발**: 처음부터 Claude에만 의존하지 않기
- **스파링 파트너로 삼기**: 아이디어를 다듬고 가정에 도전하도록 하기
- **표준화 작업 위임**: 월간 사업 검토 같은 정형화된 작업은 Claude에게 전적으로 맡기기
- **반박을 환영하기**: Claude가 당신의 아이디어에 이의를 제기할 때가 가장 가치 있음

Claude의 명확한 헌법(Constitutional AI)은 모델이 언제 반박할지 알게 해주며, 이것이 오히려 더 유용한 대화 파트너를 만듭니다.

## 토큰 극대화의 철학

가리 탄의 말처럼, "지금 당장 토큰에 연간 10만 달러를 기꺼이 지출한다면, 당신은 2028년의 누군가가 살게 될 방식으로 살고 있는 것입니다."

이는 단순한 비유가 아닙니다. **제품 관리자는 토큰 사용을 픽셀 수준으로 최적화해야 합니다**. 모든 입출력이 의미 있는지, 사용자 가치를 제공하는지를 끊임없이 질문해야 합니다.

## 빠른 발전 속에서 적응력이 핵심

Anthropic은 지난 1년간 4가지 모델 시리즈를 출시했지만, 올해 2분기에만 그보다 더 많은 양을 출시했습니다. 이 속도 속에서 살아남는 방법은:

1. **오래된 계획에 집착하지 않기**: 새로운 정보가 나타나면 즉시 적응
2. **팀과의 신뢰 구축**: 혼자가 아니라 함께 움직이기
3. **미션과 가치에 정렬**: 이를 통해 빠른 의사결정 가능
4. **"집단 지성"의 힘**: 팀이 서로를 돕고 보완하는 문화

## 결론

AI 제품 관리의 미래는 **토큰으로 생각하고, 평가로 정의하고, 첫 번째 원칙으로 추론** 하는 PM에게 달려 있습니다. 기술이 빠르게 진화할수록, 사용자를 깊이 있게 이해하고 그 피드백을 실행 가능한 방식으로 전환할 수 있는 인재가 더욱 귀중해집니다.

지금이 AI 시대 제품 관리자의 황금기입니다. 당신의 판단력, 호기심, 그리고 근본 원칙적 사고가 세상을 바꾸는 제품을 만들 수 있습니다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=tivaWTTVRhY)
