핵심 요약
- 특정 업무를 반복하는 에이전트에는 도구, 권한, 결과물 형식을 코드로 정한 전용 실행 환경(하네스)이 유용하다고 클레어는 설명했다.
- 알렉스 핀은 로컬 모델에 상시 검사와 신호 수집을 맡기고, Claude Code에는 결과를 판단하는 일을 맡긴다고 밝혔다.
- 클레어의 자체 제품 업무 평가에서는 GPT-5.6 Sol이 가장 높은 선호 점수를 받았지만, 문서 작성과 에이전트의 대화 방식에서는 다른 모델을 선호했다.
- 세 사례 모두 모델 하나의 성능보다 업무에 맞춘 절차와 역할 배분을 보여준다. 평가와 비용에 관한 수치는 각 출연자의 경험과 추정에 따른 것이다.
반복 업무를 위한 에이전트 실행 환경
클레어가 설명한 하네스는 AI 에이전트가 특정 일을 효과적으로 수행하도록 감싸는 코드다. 범용 코딩 도구도 복잡한 하네스에 해당하지만, 직접 만든 것은 파일 몇 개와 터미널 화면으로 구성할 수도 있다. 그는 매번 같은 준비 과정을 거쳐 같은 형태의 결과를 내야 하는 업무가 전용 하네스에 적합하다고 봤다.
ChatPRD의 Sentry 버그 조사가 사례다. 조사에 필요한 증거를 모으는 순서와 최종 결과물은 정해져 있지만, 원인을 파악하고 보고서를 작성하는 일은 에이전트의 판단에 맡긴다. 클레어는 에이전트에 Sentry의 광범위한 접근 권한을 주는 대신, 버그 보고서에 필요한 정보만 가져오는 전용 연결 코드를 만들었다. 그에 따르면 이 방식은 불필요한 탐색을 줄여 속도와 비용, 결과의 일관성에 도움이 된다.
권한과 결과물을 절차에 담다
범용 도구에서는 매번 ‘조사만 하고 코드는 수정하지 말라’고 지시해야 할 수 있다. 클레어의 하네스에서는 조사 모드를 선택하고 Sentry 링크를 넣으면 그 제약이 적용된다. 실행할 때마다 작업 기록, Sentry 이슈 요약, 관련 로그, 작업 보고서, HTML 요약도 같은 묶음으로 나온다. 개별 조사가 팀이 훑어볼 수 있는 기록으로 남는 구조다.
클레어는 전용 하네스가 단계별 모델 선택과 도구 사용 정책도 정할 수 있다고 설명했다. 다만 이 사례의 핵심은 모든 업무를 자동화한다는 주장이 아니라, 증거 수집과 산출물 형식이 반복되는 버그 조사에 맞춰 제약을 미리 정했다는 점이다.
알렉스 핀의 상시 가동 로컬 AI
알렉스 핀은 Mac Studio, DGX Spark, RTX 5090과 자체 대시보드를 이용해 로컬 AI를 계속 가동한다고 소개했다. 그는 1만 달러짜리 Mac Studio를 월 20달러 구독과 단순 비교하면 비경제적으로 보이지만, 에이전트를 하루 종일 돌리는 경우에는 추론을 반복해 사용할 수 있다는 점이 중요하다고 주장했다. 보안 검사, 코드 리뷰, 소셜 신호 관찰을 클라우드 API로 계속 수행하면 월 수천 달러의 크레딧이 들 것이라는 추정도 제시했다.
장비마다 맡기는 일은 다르다. 알렉스에 따르면 Mac Studio는 큰 모델을 느리게 실행하는 데, DGX Spark는 속도와 메모리가 모두 필요한 작업에, RTX 5090은 빠른 실행에 적합하다. 여러 기기는 Tailscale 네트워크로 연결해 에이전트가 필요한 장비와 모델을 선택하도록 했다. 이는 알렉스가 운영하는 구성에 대한 설명이며, 장비 성능이나 비용의 일반적인 비교 실험은 아니다.
값싼 반복 작업과 최종 판단의 분리
알렉스의 보안 검사에서는 로컬 모델 GLM 5.2가 20분마다 코드를 살펴보고 발견 사항을 마크다운 파일에 기록한다. Claude Code는 하루 한 번 그 보고서를 검토해 실제 문제와 수정할 만한 항목을 가린다. 알렉스는 Claude Code로 20분마다 같은 검사를 실행하면 월 수천 달러가 들 것이라고 추정했다.
개발 절차도 계획, 구현, 검토로 나뉜다. 아침에 Claude와 계획을 세워 SaaS 작업 목록을 만들면 구현 절차가 이를 처리하고 검토 절차가 결과를 확인한다. 검토를 통과하면 Slack 알림이 오고, 알렉스가 로켓 이모지를 남기면 자동 병합이 시작된다. 사람의 승인 신호가 병합 과정에 남아 있는 셈이다.
GPT-5.6 Sol을 평가한 기준과 예외
클레어는 제품 요구사항 문서(PRD), 시제품, 와이어프레임, 디버깅, 에이전트의 대화 방식이라는 다섯 범주에서 GPT-5.6 Sol을 다른 모델과 비교했다. 본인 평가 70%, 기계 평가 30%를 반영한 선호 점수에서 Sol이 가장 높아 일상적으로 쓰는 모델로 선택했다고 밝혔다. 문서 일정 관리 도구, 개발 도구의 장애 분류 사이트, 습관 추적 앱 시제품에서는 화면의 정보 배치와 색상 사용, 실제 작동하는 상호작용을 높게 평가했다.
선호가 모든 업무에서 같지는 않았다. 클레어는 간결한 PRD 작성에는 GPT-5.6 Terra가 더 적합할 수 있고, OpenClaw에서 에이전트가 말하는 방식은 Sonnet 5를 가장 선호한다고 했다. Sol에는 녹색 계열 디자인으로 기우는 경향도 관찰해, 다른 방향을 원할 때는 요청에 명시한다고 설명했다. 이는 클레어의 자체 평가와 사용 경험에 따른 판단이다.
세 에피소드의 공통점은 반복 가능한 절차를 먼저 정하고, 모델에는 그 안에서 필요한 판단을 맡긴다는 데 있다. 버그 조사 결과물, 로컬 보안 검사 보고서, 제품 업무 평가 모두 어떤 일을 어떤 조건에서 시켰는지가 결과를 이해하는 데 중요하다.
댓글 0
첫 댓글을 남겨 주세요.