# 머코르 창업자가 말한 ‘에이전트 데이터’: AI의 실무 능력을 어떻게 측정하고 훈련하나

> 2026-04-15 · Stanford eCorner · 큐레이션 김태우
> https://challengekim.com/insights/머코르-창업자가-말한-에이전트-데이터-ai의-실무-능력을-어떻게-측정하고-훈련하나
> 원문: https://www.youtube.com/watch?v=NUNyK6P6q8s

## 핵심 요약

- 머코르는 이력서 검토와 면접 자동화로 출발했지만, AI 모델의 실무 능력을 평가하고 훈련하는 데이터를 만드는 사업으로 중심을 옮겼다.
- 창업자 브렌던 푸디는 **에이전트 데이터**의 핵심을 전문가가 과제의 맥락과 성공 기준을 설계하는 일로 설명했다.
- 머코르의 APEX는 투자은행, 법률, 의료, 소프트웨어 개발 등 실제 직무에서 모델이 얼마나 잘 수행하는지 측정하려는 평가 체계다.
- 푸디는 AI가 많은 업무를 대신할 수 있다고 보면서도, 검증이 어렵고 오랜 시간이 걸리는 과제와 물리적 세계의 일은 자동화에 더 오래 걸릴 것으로 전망했다.

## 채용 자동화에서 AI 데이터로

푸디와 공동 창업자 아다르시 히레마스, 수리야 미다는 해외의 숙련된 인력을 프로젝트와 연결하는 방법에 관심을 두고 사업을 시작했다. 푸디의 설명에 따르면 2023년 초 머코르의 구상은 대규모 언어 모델로 이력서 검토, 면접, 채용 결정을 자동화하는 것이었다. 초기에는 대학생 고객에게 인도 학생 개발자를 연결했고, 8개월 안에 연간 환산 매출 속도 100만 달러에 도달했다.

이후 푸디는 AI 연구소가 필요로 하는 인력과 데이터의 성격이 바뀌는 것을 봤다고 말했다. 초기 모델에 쓰이던 비교적 단순한 작업 중심의 데이터에서, 은행가·변호사·의사·소프트웨어 엔지니어 같은 전문가가 팀으로 과제를 설계하는 데이터로 수요가 이동했다는 것이다. 푸디에 따르면 머코르는 연간 환산 매출 속도 100만 달러에서 10억 달러 이상으로 커지는 데 20개월이 걸렸다. 이는 특정 기간의 실제 매출이 아니라 당시 매출을 연간으로 환산한 수치다.

방향을 바꾸는 과정에는 기존 사업자와의 경험도 있었다. 푸디는 머코르가 처음에는 Scale AI와 협력하려 했고, 자사 플랫폼으로 그곳에 소프트웨어 엔지니어 1,000명 이상을 연결했다고 설명했다. 이후 연결된 인력의 보수가 지급되지 않았다는 지원 요청이 쏟아졌다고 했다. 그는 이 경험과 시장 변화를 계기로 AI 연구소에 직접 접근해 전문가 중심 데이터 제작 체계를 구축하기로 했다고 말했다.

## 답을 보여주는 데이터에서 성공 기준을 만드는 데이터로

푸디는 초기 AI 학습 데이터를 사람이 입력과 모범 출력을 제시하거나, 모델이 만든 여러 답 가운데 선호하는 답을 고르는 방식으로 설명했다. 그가 말한 에이전트 데이터는 한 단계 더 나아간다. 전문가가 과제의 맥락과 도구를 마련하고, 어떤 결과가 성공인지 채점 기준이나 단위 테스트로 정의한다.

이 기준은 두 가지 용도로 쓰인다. 먼저 새 모델과 이전 모델이 과제를 얼마나 잘 수행하는지 비교하는 **벤치마크**가 된다. 또 모델이 같은 문제를 여러 번 시도했을 때 각 결과에 점수를 매기는 **강화학습**의 보상 기준이 될 수 있다. 머코르는 이런 기준과 과제 환경을 만든다고 푸디는 설명했다.

## APEX가 겨냥한 실제 직무

푸디에 따르면 AI 모델 평가의 초기 목표에는 수학 올림피아드나 학술 지식, 코딩 대회 성적처럼 학문적 능력이 많았다. 머코르가 만든 APEX는 투자은행, 법률, 의료, 소프트웨어 개발 등 전문직이 실제 업무에서 다루는 과제로 평가 범위를 옮기려는 시도다. 해당 업무의 요청, 필요한 맥락, 성공 기준을 함께 구성해야 모델의 실무 수행 능력을 측정할 수 있다는 설명이다.

전문가를 모을 때도 이름난 경력만으로는 충분하지 않다고 푸디는 말했다. 고객이 관심을 두는 업무의 범위를 대표해야 한다. 예를 들어 컨설팅을 평가한다면 경영 컨설팅과 운영 컨설팅 등 세부 분야를 나누고, 각 분야가 평가에서 차지할 비중을 정해야 한다. 그는 APEX가 여러 주요 AI 연구소에서 모델 평가에 쓰이고 있다고 주장했다.

## 기업 도입과 채용 평가의 과제

푸디는 머코르가 AI 연구소에서 만든 평가 방식과 기술을 일반 기업에도 적용하려 한다고 말했다. 기업마다 업무에서 중요한 성과를 정의하고 그에 맞는 평가 체계를 만들어야 에이전트를 실제 업무에 도입할 수 있다는 구상이다. 다만 그는 실리콘밸리에서 체감하는 AI 도입 수준과 다른 지역 기업의 상황 사이에 차이가 있다고도 지적했다.

채용에 AI를 쓰는 데 따른 편향 우려에 대해서는 이력서의 간접적인 신호보다 실제 업무 수행 능력을 평가하는 편이 낫다는 견해를 밝혔다. 수작업으로 이력서와 면접을 처리하는 기업에는 모든 지원자를 살필 여력이 없으며, 자동화가 더 많은 사람에게 평가 기회를 줄 수 있다는 주장이다. 이는 푸디가 제시한 방향이지, 편향 문제가 해결됐다는 검증 결과는 아니다.

## 생산성의 가능성과 일자리 충격

푸디는 소프트웨어 엔지니어의 생산성이 크게 높아져도 기업이 설계, 제품 판단, 에이전트의 목표 설정을 맡을 사람을 더 고용할 수 있다고 봤다. 동시에 몇 년 안에 에이전트가 지식 노동의 상당 부분을 수행할 수 있다는 전망도 내놓았다. 모든 인간의 일을 자동화하는 데는 검증하기 어렵고 수행 기간이 긴 과제 때문에 훨씬 오랜 시간이 걸릴 것이라는 견해다. 전기·기계 등 물리적 세계의 일을 위한 데이터를 구축하는 데도 긴 시간이 필요하다고 말했다.

그는 데이터센터 건설, 기업의 에이전트 도입을 돕는 인력, 에이전트 훈련을 새 일자리의 사례로 들었다. 그러나 낙관적인 전망과 별개로 대규모 일자리 대체가 일어날 수 있다는 점도 인정했다. 어떤 일은 AI가 할 수 있고 어떤 일은 오래 걸릴지를 평가하며, 기업과 정책 담당자가 전환에 대비하도록 돕는 것이 중요한 과제라고 설명했다.

푸디의 발표에서 반복된 기준은 실제 수요를 확인하는 일이었다. 그는 초기 제품을 고객과 함께 검토했고, 빠르게 변하는 시장에서는 말로 표현한 관심보다 실제 지출을 더 강한 선행 신호로 본다고 말했다. 머코르의 전환 역시 AI 연구소가 필요로 하는 데이터가 달라지는 현장을 가까이에서 본 데서 출발했다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=NUNyK6P6q8s)
