핵심 요약

  • Claire는 정해진 범주·점수·확률을 반환하는 결정 모델 Jev로 대량 분류 작업을 시험했다. 1,700개 풀 리퀘스트를 분석하는 데 9센트가 들었다.
  • Jev는 데이터를 분류하고 추리는 데 쓰고, 깊은 판단이 필요한 결과만 상위 모델에 넘겼다. Claire는 이 조합을 제품 인사이트 분석에도 적용했다.
  • 몇 달간 Claude를 일상 작업에서 제외했던 Claire는 Opus 5.5의 응답 방식, 프런트엔드 시안, SVG 그림을 높이 평가했다. 컴퓨터 조작과 영상 편집은 자신의 환경에서 여전히 Codex를 선호했다.
  • 블라인드 비교에서는 Claire와 AI 평가자의 선호가 달랐다. 한 모델의 종합 순위보다 작업 종류, 사용 경험, 비용에 따라 결과를 읽어야 한다는 점이 드러났다.

Jev는 문장 대신 결정을 반환한다

Jev는 글을 생성하는 언어 모델과 달리 미리 정한 선택지, 점수, 확률을 반환한다. Claire는 분류·정렬·경로 지정처럼 긴 답변이 필요 없는 작업에 이를 적용했다. 원문에 따르면 입력 토큰 100만 개당 가격은 4센트이며 출력 토큰 요금은 없다. Claire는 많은 소프트웨어 작업에 이런 형태의 결정만으로 충분하다고 보지만, 문서 작성이나 인터페이스 설계까지 Jev가 맡을 수 있다고 주장하지는 않는다.

대량 데이터에서 찾은 작업의 분포

Claire는 ChatPRD의 풀 리퀘스트 1,700개를 1만7,000쌍으로 비교하고, 만들어진 묶음에는 Gemini Flash Lite로 이름을 붙였다. 약 2분 동안 Jev에 쓴 비용은 9센트였다. 분석 결과, 지난 2년간 회사 엔지니어링 작업의 약 30%가 플랫폼·보안·인프라에 투입된 것으로 파악했다.

로컬에 저장된 Claude Code와 Codex의 과거 세션도 분류했다. 그 결과 Claire의 AI 사용에서 엔지니어링이 차지한 비중은 1월 거의 100%에서 9월 40% 미만으로 내려갔고, 에이전트 작업과 미디어 발행의 비중이 커진 것으로 나타났다. 이는 Claire 자신의 사용 기록을 분석한 결과다.

ChatPRD의 제품 인사이트 분석에서는 Jev로 1,100개 신호를 분류·군집화·선별한 뒤 중요한 묶음만 GPT-6 Astra에 보내 더 깊이 검토했다. 원문에서 Jev 측 처리량은 20만 건, 비용은 약 4달러로 제시된다. Claire가 그 주 Jev에 지출한 금액은 10달러 미만이었다.

댓글 검색과 실시간 앱에도 적용했다

Claire는 How I AI의 유튜브 댓글 4,500개를 감정별로 분류하고, 그중 에피소드 아이디어가 담긴 댓글 58개를 찾았다. 전체 댓글을 1초 이내에 훑는 키워드 검색도 만들었다. 분석에서는 Grok과 Muse 비교를 원하는 반응과 ‘제품 관리자를 위한 Claude Code’ 에피소드에 대한 80%의 긍정 반응이 확인됐다.

말한 문구를 색으로 바꾸고 감정에 맞는 인용문을 표시하는 음성 앱도 시험했다. 이 과정에서는 Jev의 결정 처리보다 인용문 API가 더 느렸다. Claire에게 Jev의 역할은 전체 응답을 만드는 것이 아니라, 흐름 속에서 빠르게 판단해야 하는 부분을 맡는 것이었다.

Opus 5.5가 Claude를 다시 쓰게 만든 이유

Claire는 이전 Claude의 장황하고 훈계하는 듯한 응답 때문에 몇 달간 이를 일상 작업에서 제외했다. Opus 5.5에서는 응답이 더 간결하고 명확해졌다고 평가했다. 원문은 Opus 5.5의 가격이 Opus 5보다 40% 낮다고 설명하며, Claire는 작업 속도도 빨라졌다고 느꼈다.

Opus 5.5는 받은편지함 분류, 백엔드 개발, 조사, 컴퓨터 조작을 포함한 복잡한 작업 네 건을 마쳤다. 한 번의 지시로 최대 82단계까지 진행한 사례도 있었다. 다만 작업 중 8~9분 동안 아무 소식이 없는 경우가 있어, 실제 처리 속도와 별개로 진행 상태를 알기 어려웠다.

Claire는 ChatPRD 홈페이지 시안을 출시할 계획일 만큼 높이 평가했다. 여러 표정에서도 스타일이 유지되는 캐릭터 SVG 역시 강점으로 봤다. 반면 소비자 앱의 미감은 여전히 어려워했고, 별도 지시가 없으면 특정 주황색 계열로 기우는 경향이 있다고 지적했다. 테스트를 건너뛰고 곧바로 운영 환경에 반영하라는 요청은 거절했다. Claire의 영상 편집 시험에서는 색 보정, 화면 전환, 오버레이가 기대에 못 미쳤고, 컴퓨터 조작도 현재 자신의 환경에서는 Codex가 더 낫다고 판단했다.

블라인드 비교가 바꾼 평가

Claire는 기존의 제품 요구사항 문서와 프런트엔드 시안 중심 비교를 개인 생산성, 백엔드 개발, 장시간 에이전트 작업, 컴퓨터 조작, SVG, 영상 편집 등으로 넓혔다. 글쓰기·프런트엔드 시안·에이전트의 응답 방식·SVG는 블라인드로 점수를 매겼고, 일부 작업에는 AI 평가자의 도움을 받았다.

AI 평가자는 Fable을 높이고 GPT-6 Sol을 낮게 평가했지만, Claire는 Astra를 선호했다. 원문은 평가자가 정확성과 구조를, Claire는 실제로 계속 쓰고 싶은 경험을 중시한 차이로 이를 설명한다. 캐릭터 SVG에서도 앞선 개별 리뷰에서는 Opus 5.5를 선호했지만, 이번 블라인드 비교에서는 Astra와 Sol이 앞섰다.

Sol은 Claire의 시험에서 결과가 고르지는 않았으나, 장시간 작업의 진행 상황을 지나치게 조용하지 않게 전했다. Claire는 Sol의 가격이 Opus 5.5의 약 절반이라는 점을 알고 작업 배분을 다시 생각했다. 동시에 ChatPRD에서 캐시 설정으로 상당한 비용을 절약한 경험을 들어, 모델 선택만으로 비용을 판단해서는 안 된다고 봤다.

결론

Claire의 작업에서는 Jev가 대량의 작은 판단을, 상위 모델이 선별된 결과의 검토를 맡았다. Opus 5.5는 리뷰·설계 검토·프런트엔드 작업에 다시 쓰이기 시작했지만, Claire의 주된 작업 도구는 여전히 Codex다. 이 평가는 Claire가 수행한 작업과 사용 환경에 따른 결과다.