핵심 요약

  • How I AI의 진행자 클레어는 오픈 웨이트 모델 GLM-5.2를 실제 ChatPRD 코드베이스에서 시험했다.
  • 45분간 진행한 오류 분석 작업에서 모델은 수정 계획을 만들었지만, 도중에 React와 TypeScript 코드 처리에 어려움을 겪었다.
  • 해당 실험에서 600만 토큰 사용 비용은 3.36달러였으며, 캐시 적용률은 72%였다.
  • Gusto 공동창업자 겸 CTO 에디 김은 5인 팀이 Claude Code를 활용해 10주 만에 Gusto Cofounder를 출시한 과정을 설명했다.

실제 코드베이스에서 시험한 GLM-5.2

클레어는 중국 베이징의 Z.ai가 만든 오픈 웨이트 모델 GLM-5.2를 ChatPRD 코드베이스에 적용했다. 오픈 웨이트는 학습된 모델의 가중치가 공개돼 자체 장비에서 모델을 실행하거나 별도의 추론 제공업체를 선택할 수 있다는 뜻이다.

시험 범위에는 코드베이스 점검, 화면 재설계, 장시간 오류 탐색이 포함됐다. 원문은 GLM-5.2가 SWE Bench Pro에서 Claude Opus 4.8에 근접하고 GPT-5.5를 웃도는 성적을 보인다고 소개한다. 다만 실제 사용에 관한 클레어의 결론은 작업별로 달랐다.

오류 분석에서 확인한 성과와 한계

클레어는 Claude Code 안에서 GLM-5.2에 최근 72시간의 Sentry 오류와 Vercel 로그를 살펴보고, 우선순위가 있는 수정 계획을 만들도록 요청했다. 모델은 약 45분 동안 외부 서비스에 접속해 도구를 사용했고, Sentry 오류 20개와 Vercel 로그 신호 5개를 정리했다. 결과에는 수정 계획 14개가 담겼으며, 클레어가 평소 모니터링에서 발견하지 못했다고 밝힌 최우선 항목 2개도 포함됐다.

작업은 순탄하지만은 않았다. 모델은 진행 중 TypeScript 컴파일 오류를 해결하는 데 어려움을 겪었고, 이후 정상적으로 컴파일되는 React 코드를 만들었다. 클레어는 HTML·CSS 생성은 안정적이라고 평가하면서도 여러 단계를 거치는 React 작업의 일관성은 더 살펴봐야 한다고 봤다. 자신의 작업 중 약 98%가 React와 관련돼 있다는 점에서 이 한계는 모델 선택에 직접 영향을 준다.

비용과 도구 설정

이번 실험에서 긴 오류 분석 작업을 포함한 600만 토큰의 비용은 3.36달러였다. 사용량의 72%에 캐시가 적용된 결과이므로, 이 수치를 모든 작업에 그대로 적용할 수는 없다.

클레어는 Cursor에서 Open Router를 통해 GLM-5.2를 연결하는 데 30분이 걸렸다고 설명했다. Claude Code에도 환경 변수와 설정 파일 수정이 필요했다. 그는 GLM-5.2를 기존 모델의 전면적인 대체재로 확정하지 않고, Cursor의 화면 작업과 Claude Code의 장시간 작업에 함께 사용하기로 했다.

Gusto의 5인 팀이 제품을 만든 방식

별도의 에피소드에서 에디 김은 5인 팀이 기존 코드 없이 시작해 10주 만에 Gusto Cofounder를 Gusto의 정식 출시 수준으로 내놓았다고 말했다. 팀에는 전담 제품 관리자가 없었고 Figma, Jira, 긴 기획 문서도 사용하지 않았다. 대신 상시 열어 둔 Zoom 공간에서 소통하고 Claude Code를 주요 개발 도구로 활용했다.

에이전트의 실행 구조에는 Cloudflare Workers와 Vercel AI SDK를 썼고, 나머지 부분은 팀이 직접 만들었다고 김은 설명했다. 이 사례는 해당 팀의 규모와 협업 방식에서 나온 결과다. 모든 제품팀에서 기존 절차를 없애도 같은 속도를 낼 수 있다는 근거로 확대할 수는 없다.

결론

두 사례는 AI를 개발 과정에 깊이 넣었을 때 얻은 구체적인 성과를 보여준다. 동시에 GLM-5.2의 React 작업에서 나타난 어려움과 Gusto 팀의 특수한 협업 조건도 함께 남긴다.