핵심 요약

  • 클레어는 Codex로 온보딩 화면을 시험하다 몇 달간 남아 있던 진행 차단 오류를 발견했다. 사용자를 특정 역할로 설정한 시험에서는 ChatPRD의 대화 간 참조 과정이 불편하다는 점도 더 분명해졌다.
  • 브라우저 작업의 난도에 맞춰 모델의 추론 수준을 낮춰도 링크드인 메시지 분류와 답장 초안 작성은 가능했다. 웹사이트의 본인 확인 단계에서는 사람이 잠시 개입했다.
  • 코딩 경험이 없던 매디 리스는 Cursor와 대화하며 요구사항을 정리한 뒤 부품을 구매해 호출기, 영수증 출력기, 개인용 API를 만들었다.
  • 클레어의 7개 모델 평가에서 Claude Opus 5는 종합 지수 78점으로 1위였다. 클레어는 결과물의 품질을 높이 평가하면서도 잦은 승인 요청과 장황한 설명에 불편을 느꼈다.

브라우저로 제품을 시험하자 드러난 문제

클레어는 자신이 만든 온보딩 절차를 직접 시험할 때 필수 항목을 모두 채우고 다음 단계로 넘어갔다. Codex에는 팀 사용자와 개인 사용자로 각각 절차를 시험하게 했다. 필수 항목을 둘러싼 예외 상황까지 확인한 결과, 클레어가 정상적인 순서로만 사용하면서 몇 달간 발견하지 못한 진행 차단 오류가 드러났다.

처음에는 시험할 항목 25개를 지정했지만, 이후에는 온보딩 절차의 품질을 점검하라는 넓은 요청을 주고 모델이 방법을 정하게 했다. 클레어의 경험상 이 방식은 자신이 미리 떠올린 항목에 시험 범위가 갇히는 일을 줄였다.

클레어의 남편 EJ는 특정 사용자 역할을 맡겨 제품을 사용하게 하자고 제안했다. 회의에서 막 나온 PM, 제품 요구사항 문서를 넘겨받은 엔지니어, 사용 현황을 확인하는 팀장처럼 상황을 설정하는 방식이다. ChatPRD에서는 이 시험을 통해 서로 다른 대화의 내용을 참조하는 과정에 구조적인 불편이 드러났다. 클레어는 이미 문제를 알고 있었지만 사용자 관점에서 그 영향을 더 뚜렷하게 경험했다고 설명했다.

메시지 처리와 원격 조작에 쓴 Codex

클레어는 Codex의 브라우저 기능으로 읽지 않은 링크드인 메시지를 살피고, 맥락에 맞는 답장 초안을 만들며, 본인이 직접 답해야 할 메시지를 표시했다. 처음에는 GPT-5.6을 높은 추론 수준으로 사용했으나, 중간 수준으로 낮춘 뒤에도 이 작업을 수행할 수 있었다. 클레어는 메시지 분류와 코드 작성, 철저한 품질 점검에 같은 수준의 연산을 쓸 필요는 없다고 봤다.

컴퓨터 조작 기능을 이용한 원격 작업 사례도 소개했다. 클레어는 다른 주로 여행 중이었고, 집의 와이파이를 관리하는 소프트웨어는 캘리포니아에 남겨 둔 아이폰에 설치돼 있었다. Mac Mini에 원격으로 접속하려면 방화벽 포트를 열어야 했다. 클레어의 설명에 따르면 Codex는 아이폰 미러링을 열어 라우터 설정과 SSH 접속 설정을 마친 뒤 포트를 다시 닫았다.

쇼핑 중에는 Free People 사이트가 Codex를 봇으로 판단해 CAPTCHA를 띄웠다. 이때 클레어가 직접 확인 절차를 마친 뒤 브라우저 작업을 다시 맡겼다. 브라우저 자동화가 이어지려면 사람이 처리해야 하는 단계도 있다는 사례다.

Cursor와 라즈베리 파이로 만든 물리적 프로젝트

매디 리스는 코드를 처음부터 작성할 수준은 아니지만 일부를 읽고 잘못된 배선 사양을 알아볼 수 있다고 설명했다. 그는 Cursor와 라즈베리 파이를 활용해 트위터 알림을 받는 호출기, AI 기반 영수증 출력기, 개인용 API를 만들었다.

작업은 아이디어를 자연어로 설명하는 데서 시작한다. 매디는 Cursor에 자신을 인터뷰해 달라고 요청하고 주요 의문이 풀릴 때까지 대화한 다음 부품 목록을 받는다. 한 프로젝트에서는 Cursor가 잘못된 전선을 추천했지만, 구매 전 최종 검토에서 이를 발견해 불필요한 구매와 문제 해결 시간을 피했다. 아이디어를 정리하고, 부품을 고르고, 구매한 뒤 제작하는 순서를 세 프로젝트에 적용했다.

초기 구상 단계에는 터미널과 브라우저, 파일 목록을 닫고 대화에 집중한다. 구현에 필요한 창은 설계가 정리된 뒤 연다. 매디와 클레어는 트윗 하나를 호출기로 보내기 위해 여러 서비스를 거치는 구성이 특별히 실용적이지는 않다고 인정했다. 이 프로젝트에서는 작동하는 물건을 만드는 즐거움이 목적이었다.

개인용 API에서 떠올린 활용 가능성

매디의 개인용 API에는 커피 주문 방식, 반려동물 이름, 시간대, 좋아하는 간식, 샌프란시스코에서 선호하는 식당 등이 담겨 있다. 처음에는 친구가 매디에게 여러 질문을 하지 않고도 배려할 수 있게 하려는 아이디어였다.

클레어는 에이전트가 이 정보에 접근한다면 매디가 다음에 샌프란시스코에 오는 시점을 확인하고 선호하는 식당을 예약할 수도 있다고 제안했다. 이는 대화에서 제시된 가능성으로, 실제 예약 기능을 구현했다는 설명은 아니다.

Opus 5의 평가 점수와 사용 경험

클레어가 7개 모델을 평가한 결과, Claude Opus 5의 종합 지수는 78점이었다. Claude Sonnet 5는 77점, GPT-5.6 Sol은 76점이었다. Opus 5는 프런트엔드 디자인 부문에서 모든 항목에 5점을 받은 유일한 모델이었다. 클레어는 77점, LLM 심사 모델은 88점을 줬으며, 두 평가자의 점수 차이는 7개 모델 가운데 가장 작았다. 반면 Gemini 3.1 Pro에는 클레어가 32점, LLM 심사 모델이 66점을 줬다.

높은 평가와 별개로 클레어는 Opus 5와 직접 대화하며 작업할 때 불편을 느꼈다. 자신의 설명에 따르면, 이 모델은 한 줄짜리 병합 충돌도 다른 사람의 브랜치에 속한 코드라는 이유로 해결하지 않았고, 하위 에이전트에게 작업을 사람의 검토 대상으로 표시하도록 요청했다. 글도 지나치게 길고 조심스러워 웹사이트 시제품을 다시 만들라고 지시한 적이 있었다. 클레어는 비동기 코딩 도구로 실행했을 때 나온 결과물은 높이 평가하며, 프런트엔드 디자인과 앱 시제품 제작에 활용할 계획이라고 밝혔다.

결론

세 에피소드에서 소개된 작업은 AI가 맡을 범위와 사람의 판단이 필요한 지점을 구체적으로 보여준다. 클레어의 시험에서는 예상하지 못한 제품 오류가 발견됐고, 매디의 제작 과정에서는 구매 전 검토가 잘못된 부품 선택을 막았다. Opus 5 평가에서는 높은 결과물 점수와 불편한 대화 경험이 함께 나타났다.