# AI 하네스가 모델보다 중요한 이유: 2026 벤치마크

> 2026-07-28 · Tom Tunguz · 큐레이션 김태우
> https://challengekim.com/insights/ai-harness-more-important-than-model-2026-benchmark-ko
> 원문: https://www.tomtunguz.com/aftermarket-harnesses/

## 핵심 요약

- **하네스가 성능을 결정한다**: 동일한 모델을 다른 하네스로 실행했을 때 GPT-5.5는 61.5%에서 87.2%로, Opus 4.7은 87.2%에서 91.1%로 성능이 달라짐
- **입력 토큰이 대부분의 비용을 차지**: OpenRouter 전체 LLM 트래픽의 86-98%가 입력 토큰으로, 비용 최적화의 핵심 포인트
- **캐싱으로 40-80% 비용 절감 가능**: 안정적인 접두사를 캐싱하고 동적 콘텐츠를 분리하면 첫 토큰 생성 시간도 13-31% 단축
- **경쟁사 하네스도 성능 격차를 좁힐 수 있다**: Claude Code와 Cursor 하네스의 기술을 분석하면 타사 모델도 동일한 최적화 기법 적용 가능

## 하네스: 모델보다 강한 성능 차이를 만드는 요소

Endor Labs의 Agent Security League 연구는 같은 모델을 다른 하네스로 실행했을 때의 성능 차이를 측정했습니다. OpenAI의 GPT-5.5는 자체 Codex 하네스에서 61.5%의 기능적 정확도를 기록했으나, Cursor 하네스에서는 87.2%를 달성했습니다. 이는 **런타임만으로 25.7% 포인트의 성능 향상** 을 의미합니다.

Anthropic의 Claude Opus 4.7도 유사한 패턴을 보였습니다. Claude Code에서 87.2%의 정확도를 기록한 반면, Cursor에서는 91.1%에 달했습니다. 흥미롭게도 **두 선도 모델 모두 개발사 자신의 하네스보다 경쟁사의 하네스에서 더 높은 성능** 을 발휘했습니다.

## 입력 토큰: 비용 최적화의 핵심 전략

OpenRouter의 데이터에 따르면, LLM 트래픽의 **86-98%가 입력 토큰으로 구성** 됩니다. 출력 토큰의 비용이 입력 토큰의 5배에 달하지만, 입력 토큰의 양이 압도적으로 많기 때문에 전체 비용의 대부분을 차지하는 것입니다.

이는 **모델 성능이 아닌 하네스의 입력 관리가 비용 효율을 좌우** 한다는 의미입니다. 하네스는 각 쿼리에서 어떤 컨텍스트를 모델로 전송할지 결정하며, 반복되는 프롬프트 부분을 지능적으로 캐싱하면 상당한 절감 효과를 얻을 수 있습니다.

## 프롬프트 캐싱으로 40-80% 비용 절감하기

500개의 장기 에이전트 세션을 분석한 연구에서, **프롬프트 캐싱을 통해 41-80%의 비용을 절감** 할 수 있음이 확인되었습니다. 동시에 첫 토큰 생성 시간(time-to-first-token)도 13-31% 더 빨라졌습니다. 비용 절감 효과는 500 토큰에서 50,000 토큰 프롬프트까지 선형적으로 증가했습니다.

가장 효과적인 방법은 **안정적인 접두사만 캐싱하고 동적 콘텐츠를 캐시 중단점 뒤에 배치** 하는 것이었습니다. Claude Code의 경우 실제 세션에서 약 96%의 캐시 적중률을 달성했으며, 동일 버전 사용자 간 시스템 프롬프트를 공유함으로써 추가 비용 절감을 얻었습니다.

## 하네스 설계의 기술적 우위: 동적 도구 가져오기와 계층형 캐싱

Cursor의 하네스가 GPT-5.5와 Opus 4.7의 성능을 개선한 이유는 **동적 도구 가져오기(dynamic tool fetching), 우선순위 기반 접두사 조립(priority-based prefix assembly), 2단계 캐싱(two-tier caching)** 같은 고급 기법을 적용했기 때문입니다. 이러한 기술들은 Claude Code의 아키텍처에서 검증된 방식입니다.

하네스와 캐시 API, 모델을 공동 설계하면 **진정한 캐시 규율** 을 확보할 수 있습니다. 다만 이러한 규율의 핵심은 모델이 아닌 **하네스에 있으며, Cursor의 벤치마크 결과가 보여주듯이 타사 하네스도 이를 따라잡을 수 있습니다.**

## 결론

AI 성능은 모델 자체만으로 결정되지 않습니다. 하네스는 단순한 모델 래퍼를 넘어 **AI 스택의 핵심 지렛대** 로 작동하며, 비용, 품질, 정확도에 직접적인 영향을 미칩니다. 입력 토큰이 전체 비용의 86-98%를 차지하는 만큼, 프롬프트 캐싱과 지능적인 컨텍스트 관리를 통해 상당한 성능 개선과 비용 절감을 동시에 달성할 수 있습니다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.tomtunguz.com/aftermarket-harnesses/)
