핵심 요약

  • 클레어는 고정된 과제와 평가 기준으로 5개 모델의 출력 64개를 블라인드 평가했다. 자동 평가와 본인의 선호 순위는 거의 반대였다.
  • 클레어의 평가에서는 업무 종류에 따라 선호 모델이 달랐다. Sonnet 5의 가격만으로 기존 모델을 대체할 이유가 생기지는 않았다.
  • 알레시오 파넬리는 클라우드 VPS에서 OpenAI Symphony와 Linear를 사용해 코딩 에이전트의 작업을 비동기로 관리하는 방식을 소개했다.
  • 파넬리는 작업별 토큰 사용량을 기록하고, 지시 파일을 간결하게 유지하며, 에이전트가 화면을 확인할 수 있게 하는 일을 강조했다.

64개 출력을 같은 기준으로 비교하다

클레어는 Sonnet 5를 살펴보면서 Sonnet 4.6, Opus 4.8, GPT-5.5, Gemini 3 Pro를 함께 비교했다. PRD(제품 요구사항 문서), 프로토타입, 에이전트 작업, 응답의 말투를 평가 과제로 삼았다. 이전에도 새 모델을 한 번씩 써보고 인상을 확인했지만, 그 방식으로는 시점이 다른 결과를 비교하기 어려웠다. 이번에는 입력과 평가 기준을 고정해 새 모델이 나올 때 같은 과제를 다시 실행할 수 있도록 했다.

클레어는 Claude Code에 과거 함께 작업한 세션을 바탕으로 평가 과제를 제안하게 했다. 이어 출력에 1~5점과 간단한 메모를 남기고 JSON으로 내보내는 HTML 채점 페이지를 만들었다. 페이지를 만드는 데 약 45분이 걸렸다는 설명이다. 그는 5개 모델에서 나온 64개 결과를 직접 평가했고, 이때 남긴 사람의 판단이 전체 평가에서 특히 유용했다고 봤다.

자동 채점과 실제 선호가 엇갈리다

GPT-5.5와 Opus 4.8을 평가자로 사용한 자동 채점은 점수가 중간에 몰리는 경향을 보였다. 클레어가 화면을 보고 곧바로 발견한 고장 난 프로토타입이나 무시된 와이어프레임 제약도 놓쳤다. 자동 평가자는 Gemini 3 Pro를 가장 높게, Sonnet 4.6을 가장 낮게 평가했다. 클레어의 선호 순위는 거의 반대였다.

클레어의 점수에 70%, AI 평가 점수에 30%의 가중치를 둔 지표에서는 Sonnet 4.6이 1위로 올라갔다. 그는 이 차이를 자동 평가 기준에 자신이 중시하는 품질이 충분히 담기지 않았다는 신호로 해석했다. 모든 모델이 통과한 버그 찾기 과제 역시 성능 차이를 가려내지 못해 교체할 계획이라고 밝혔다. 이 벤치마크는 아직 첫 버전이다.

모델 선택은 과업에 따라 달랐다

클레어의 선호를 반영한 결과에서는 PRD에 GPT-5.5, 프로토타입과 일상 대화에 Sonnet 4.6, 코드베이스 탐색에 Opus 4.8 또는 Sonnet 5가 적합했다. 복잡하고 밀도 높은 UI 작업에는 Opus 4.8의 높은 가격을 지불할 만하다고 봤지만, 더 단순한 작업에서는 Sonnet 4.6도 경쟁력이 있었다.

클레어는 자신의 OpenClaw에 Sonnet 4.6을 쓰기 위해 API 비용을 지불한다고 설명했다. 배포 실패 같은 상황에 어떻게 반응하는지 살핀 말투 평가에서 다른 모델보다 마음에 들었기 때문이다. Sonnet 5의 가격은 여름이 끝날 때까지 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러로 소개됐다. 다만 클레어의 개인 선호 순위에서는 하위권에 가까웠다. 이 가격의 가치도 실제 사용 과제에서 원하는 품질이 나오는지에 달려 있다는 결론이었다.

휴대전화에서 비동기 코딩 작업을 관리하다

Kernel Labs 창업자 알레시오 파넬리는 OpenAI Symphony, Linear, 클라우드 VPS를 이용해 코딩 에이전트를 관리하는 과정을 소개했다. 로컬 환경에서 작업할 때는 두세 차례 개입하고 나면 실행 환경과 인터페이스의 마찰이 커졌다고 했다. 클라우드로 옮긴 뒤에는 Linear, 셸, 휴대전화 등 여러 경로에서 진행 중인 작업을 확인하고 관리할 수 있게 됐다.

에피소드에서 Symphony는 모델의 행동 방식을 정하는 의견이 분명한 마크다운 명세로 설명됐다. Linear는 비동기 작업의 상태를 관리하는 데 쓰였다. 파넬리가 보여준 작업별 토큰 사용량은 1,500만 개에서 2억 2,100만 개까지 벌어졌다. 가장 많이 사용한 작업은 앱을 Vercel에 배포할 수 있게 만드는 일이었다. 그는 이런 기록이 있어야 작업 지시와 도구를 어떻게 개선할지 판단할 수 있다고 봤다.

파넬리는 스킬 파일도 몇 달마다 정리하라고 권했다. 모델이 기존 지시를 교체하기보다 새 지시를 덧붙이면서 파일 안에 모순이 쌓일 수 있어서다. Kernel Labs는 에이전트가 UI의 모호한 상태를 만나 도움을 요청하는 문제에 대응해 Playwright 확장 도구 Glimpse를 만들었다. 스크린샷, 시각적 차이, 영상처럼 화면을 파악할 수 있는 정보가 자율 작업을 더 오래 이어가게 한다는 설명이다.

비정형 데이터를 다루는 사업 사례

파넬리는 데이터의 형태가 일정하지 않고 시각적·맥락적 판단이 필요한 분야를 AI 활용 사례로 들었다. 트레이딩 카드, 빈티지 의류, 생선 재고가 그 예다. 에피소드에서는 브라우저에 접근할 수 있는 Codex와 맞춤 가격 평가 스킬로 이베이의 저평가된 포켓몬 카드를 찾는 시연도 소개됐다. 대상에는 가격이 1만 달러 이상인 PSA 등급 카드가 포함됐다. 이는 탐색 시연이며, 실제 구매나 수익이 발생했다는 근거는 제시되지 않았다.

그는 이메일 모니터링으로 중요한 정보를 놓칠지 모른다는 부담을 덜었다는 개인 사례도 전했다. 일본에서 관찰한 2~3인 소규모 사업체를 언급하며 작은 조직의 AI 활용에 관심을 보였지만, 이 사례만으로 일반적인 수익 효과가 입증된 것은 아니다.

두 에피소드가 보여주는 공통점은 결과를 직접 확인할 수 있어야 AI 활용 방식을 개선할 수 있다는 것이다. 클레어는 같은 과제를 반복하고 사람의 평가를 남겼다. 파넬리는 작업 상태와 비용을 기록하고 에이전트가 화면을 파악할 수 있게 했다.