핵심 요약
- 클레어의 실사용 평가에서 Claude Fable 5는 시각 작업과 복잡한 기술 문제에 강점을 보였지만, 기획 문서와 일회성 디자인 작업에서는 한계가 드러났다.
- Fable 5의 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다. 클레어는 작업의 난도에 따라 더 저렴한 모델과 구분해 써야 한다고 봤다.
- Braintrust의 창업자 겸 CEO 안쿠르 고얄은 AI 에이전트의 강점을 여러 대안을 꾸준히 실험하고 벤치마크하는 능력에서 찾았다.
- 고얄은 실제 사용 데이터를 평가 사례로 바꾸고, 자동화된 검증 체계인 CI를 갖추는 일이 AI 제품 개선의 토대라고 설명했다.
Fable 5의 성능과 비용
Claude Fable 5는 앤트로픽이 일반에 제공한 첫 ‘Mythos급’ 모델이다. 원문에 따르면 소프트웨어 작업 평가인 SWBench Pro에서 80%를 기록해 Opus 4.8, GPT-4.5, Gemini 3.1 Pro보다 높은 성적을 냈다. 다만 클레어의 실사용 평가는 높은 벤치마크 점수가 모든 제품 작업의 좋은 결과로 이어지지는 않음을 보여준다.
Fable 5는 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러로 Opus보다 높은 가격대에 있다. 클레어는 다른 모델보다 토큰도 대략 두 배 속도로 소비한다고 설명했다. 복잡하고 세부 검토가 중요한 작업에는 이 성향이 유용하지만, 빠르게 결과를 내야 할 때는 과도한 조사로 이어질 수 있다는 평가다.
문서와 시각 작업에서 갈린 평가
클레어는 일곱 살 자녀를 위한 손글씨 연습지를 만들며 Fable 5와 Opus 4.8을 비교했다. Fable 5가 만든 결과물은 글자 간격, 배치, 여백에서 더 좋았다고 평가했다. 복잡한 문서를 읽거나 PDF를 처리하는 시각 작업도 강점으로 꼽았다.
반면 제품 사양서와 PRD(제품 요구사항 문서)는 기술적으로 상세하지만 읽기 어려웠다고 했다. 빽빽한 문단과 문서 내부 참조가 많아 핵심을 파악하기 힘들었다는 것이다. 스킬 등록 화면을 한 번의 요청으로 디자인하는 작업에서는 회색·검정·빨강과 단순한 윤곽선에 치우친 결과가 나왔다고 평가했다. 고객에게 가치를 줄 최소 기능 제품을 요청했을 때도 결과가 지나치게 좁아 실용성이 떨어졌다고 봤다.
안전장치와 다중 에이전트의 한계
원문은 Fable 5를 제한 없이 제공되는 Mythos와 같은 기반 모델에 안전 조정을 더한 버전으로 설명한다. 사이버보안, 생물학, 화학, 모델 증류 관련 작업에서는 요청을 전면 차단하는 대신 Opus 4.8로 전환하는 ‘폴백’이 적용될 수 있다. 앤트로픽에 따르면 세션의 95%는 폴백을 겪지 않으며, 오용 탐지를 위한 30일 보존 정책을 운영한다.
클레어는 여러 에이전트가 나눠 일하는 흐름에서 성공 사례도 봤지만, 중단과 오류도 자주 겪었다. 약 세 시간 뒤 돌아왔을 때 하위 에이전트가 멈춰 있던 사례도 있었다. 그의 평가는 Fable 5가 긴 호흡의 어려운 기술 작업과 시각 작업에는 유망하지만, 프런트엔드·전략·사양서·디자인에서는 비용과 결과를 함께 따져야 한다는 것이다.
Braintrust가 에이전트에 맡기는 일
고얄은 AI 에이전트가 복잡한 인프라 문제를 다루지 못한다는 견해에 반박했다. 동시성이 높은 코드를 완벽하게 작성하지는 못할 수 있어도, 열 기반 저장 형식이나 실행 엔진, 최적화 방식을 차례로 시험하고 벤치마크하는 데 강하다는 설명이다. 사람이 시간과 집중력을 무한히 쓸 수 있다면 더 나은 코드를 만들 수도 있지만, 실제 업무에서는 긴 작업의 맥락을 잃거나 번거로운 실험을 생략하기 쉽다고 봤다.
그는 정보와 도구를 주면 에이전트가 처리할 수 있는 업무의 경계를 ‘에이전트 라인’이라고 불렀다. 한 사람이 동시에 관리할 수 있는 전면 작업 에이전트는 대체로 4~6개라고 보고, 각 에이전트의 환경·포트·서비스를 분리해 운영한다. 일부는 로컬에서, 일부는 실제 운영 규모의 데이터를 쓸 수 있는 원격 환경에서 작업한다.
평가 기준과 CI를 개선하는 방식
고얄에게 평가는 AI가 어떻게 구현할지보다 무엇이 성공인지를 정하는 기준이다. 좋은 제품 요구사항 문서가 사용자 사례를 담듯, 좋은 평가 체계는 구체적인 시험 사례와 점수 산정 방식을 갖춘다는 설명이다. 그는 실제 사용 데이터를 평가 사례로 바꾸는 흐름을 AI 제품팀의 우선 과제로 꼽았다. 이 흐름이 없으면 개별 오류를 그때그때 고치는 데 머물기 쉽다고 봤다.
Braintrust에서는 수백 개의 평가를 돌린 뒤 디자이너 데이비드에게 며칠마다 결과를 검토받는다. 고얄은 데이비드의 지적을 평가 기준에 반영해 그 판단을 더 많은 작업에 적용한다고 설명했다. 고객이 제품의 혼란을 지적할 때는 원인이 된 요소를 제거하는 경우가 90%라고도 말했다.
에이전트가 실패하면 고얄은 같은 세션에서 지시를 반복하기보다 세션을 닫고 평가 기준을 고친 뒤 다시 시작한다. AI로 작성한 평가 코드의 품질이 떨어져 주말 동안 약 3,000줄을 직접 다시 쓴 사례도 들었다. 그에게 CI는 코드 변경을 자동으로 검증해 더 빠르게 작업할 수 있게 하는 기반이다.
Fable 5의 실사용 평가와 Braintrust의 사례는 공통으로 결과를 검증하는 기준을 강조한다. 모델의 높은 성능이나 코드 생성량만으로는 제품의 유용성과 품질을 판단하기 어렵다는 것이 두 편의 핵심이다.
댓글 0
첫 댓글을 남겨 주세요.