# AI 에이전트는 실제 업무를 어떻게 배우는가: 강화학습 환경의 구성과 한계

> 2026-08-12 · Sequoia Capital · 큐레이션 김태우
> https://challengekim.com/insights/ai-에이전트는-실제-업무를-어떻게-배우는가-강화학습-환경의-구성과-한계
> 원문: https://www.youtube.com/watch?v=a00xIn5kwhM

## 핵심 요약

- **강화학습 환경**은 업무 자료가 담긴 세계, 에이전트가 조작할 앱, 수행할 과제와 평가 기준으로 구성된다.
- 머코르의 브렌던 푸디는 데이터 품질을 실제 업무와의 유사성, 평가 기준의 정확성으로 나눠 설명했다.
- 모델은 자료와 과제를 만드는 전문가의 작업을 도울 수 있지만, 모델의 능력 밖에 있는 오류를 안정적으로 판별하는 데는 전문가가 여전히 필요하다는 주장이다.
- 푸디는 앞으로 더 오래 걸리는 과제와 동료와의 상호작용을 평가하는 환경이 중요해질 것으로 봤다.

## 정답 선택에서 업무 환경 구축으로

푸디에 따르면 2020년 무렵의 데이터 작업은 입력에 대한 답을 작성하거나 여러 모델 응답 중 선호하는 것을 고르는 방식이 중심이었다. 이후에는 소프트웨어 엔지니어, 변호사, 의사, 은행원 같은 전문가가 팀으로 평가 과제와 강화학습 환경을 만드는 방향으로 수요가 옮겨갔다. 모델이 답을 생성하는 데서 더 나아가 도구를 써서 업무를 수행하게 되면서, 학습 데이터에도 그 과정이 필요해졌다는 설명이다.

그가 제시한 강화학습 환경에는 세 요소가 있다. **세계**는 실제 프로젝트에 있을 법한 메시지, 문서, 발표 자료, 스프레드시트 등을 담는다. **앱**은 에이전트가 도구를 통해 조작할 수 있도록 만든 업무용 애플리케이션의 복제 환경이다. **과제**에는 지시문과 결과를 확인하는 평가 기준이 포함된다. 평가 기준은 채점표나 단위 테스트 형태가 될 수 있으며, 모델 평가와 훈련에 쓰인다.

푸디는 경제 전반의 업무를 다루려면 직무마다 다른 자료, 앱, 상황, 과제를 폭넓게 구축해야 한다고 말했다. 머코르의 전문가 작업량은 그가 제시한 자료에서 한 분기에 250만 시간에 달했다.

## 법률 업무를 재현한 사례

푸디는 공개한 법률 환경을 예로 들었다. 로펌 경력이 있는 변호사들이 자신이 수행했던 프로젝트를 바탕으로 상황을 설계하고, 관련 메시지와 파일이 들어갈 자료실의 개요를 작성한다. 모델의 도움을 받아 자료실을 채운 뒤 이를 업무용 앱의 복제 환경에 배치한다. 에이전트에는 자료를 살펴보고 특정 법률상 최대 책임액을 평가하는 과제가 주어진다.

평가자는 정확한 답에 필요한 항목을 채점표로 만든다. 어려운 점은 좋은 답이 하나의 경로로만 나오지 않는다는 것이다. 푸디는 가능한 해법과 오류를 충분히 포착하고, 모델이 겉으로만 채점 기준을 만족시키는 일을 막아야 한다고 설명했다. 여러 수행 경로에 매긴 점수가 타당한지도 확인해야 한다.

그가 소개한 한 추가 훈련 사례에서는 1,800개 과제를 사용한 뒤 기업법 영역의 평가 점수가 4.7%에서 26.6%로 올랐다. 푸디는 해당 자료실이 없는 다른 평가에서도 성능 향상이 나타났다고 말했다. 이는 그가 제시한 특정 훈련 결과이며, 모든 법률 업무에 같은 개선 폭이 적용된다는 뜻은 아니다.

## 품질은 현실성과 채점 정확성에 달렸다

푸디는 데이터 품질의 첫 기준을 **현실성**으로 설명했다. 환경의 자료와 앱, 과제가 실제 변호사의 업무를 닮아야 한다는 것이다. 전문가가 자료실의 개요를 잡고 제작 과정을 이끄는 이유도 여기에 있다.

둘째는 **평가 기준의 정확성**이다. 모델이 과제를 여러 번 수행하면 경로와 결과가 달라진다. 자동 채점 결과가 사람이 그 결과들을 비교해 판단한 순서와 맞는지 확인해야 한다. 머코르는 이를 위해 모델의 수행 경로를 분석하고, 자동 품질 관리와 사람의 검토를 함께 사용한다고 푸디는 설명했다. 사람의 선호도 평가를 자동 채점기의 점검 수단으로 쓸 수도 있다.

모든 분야에 같은 수준의 사람 검토가 필요한 것은 아니다. 수학처럼 정답을 명확히 확인할 수 있는 분야가 있고, 푸디는 사이버 보안에서도 공격자와 방어자 역할의 에이전트를 통해 일부 결과를 검증할 수 있다고 봤다. 다만 현실적인 환경을 설계하고 다양한 상황을 마련하는 데는 여전히 사람이 관여한다.

## 합성 데이터와 전문가의 역할

푸디는 합성 데이터를 모델이 생성한 수행 경로와 업무 자료 제작이라는 두 맥락에서 설명했다. 모델이 여러 방식으로 과제를 수행하게 한 뒤 각각을 평가하면, 사람이 모든 모범 답안을 직접 작성하지 않아도 훈련 자료를 얻을 수 있다. 전문가는 모델을 활용해 자료실과 과제를 만드는 속도를 높일 수도 있다.

그러나 훈련하려는 모델에 과제를 만들고 자기 답의 옳고 그름까지 판단하게 하면 신호가 불안정하다고 푸디는 주장했다. 특히 발표 자료나 법률 메모처럼 가능한 답이 다양한 업무에서는 어떤 실수가 있었는지 모델 스스로 안정적으로 찾기 어렵다. 그래서 전문가가 과제와 평가 기준을 검토해야 한다는 설명이다. 더 뛰어난 모델이 상대적으로 약한 모델을 위한 과제를 만드는 경우 등은 예외로 들었다.

## 데이터 가격과 다음 과제

머코르는 고객별 맞춤 과제, 여러 고객에게 판매하는 기존 데이터셋, 전문가의 시간 제공이라는 방식을 사용한다. 푸디에 따르면 개별 과제 가격은 50달러에서 1만 달러까지 폭이 넓다. 가격을 정할 때는 고객이 원하는 모델 성능 개선과 과제 제작 비용을 함께 본다. 예를 들어 사람이 10시간을 들이고 시간당 150달러를 받는 과제라면 인건비 기준 비용이 1,500달러가 된다.

앞으로의 변화로 푸디는 더 긴 과제와 가상 동료를 꼽았다. 현재 에이전트가 훈련받는 과제는 대체로 10시간을 넘지 않지만, 사람이 100시간 또는 1,000시간을 들이는 일도 다뤄야 한다는 견해다. 또 실제 업무에는 다른 사람과의 협업이 많지만, 이를 측정하는 평가는 매우 적다고 지적했다. 그가 말한 다음 과제는 앱을 조작하는 능력을 넘어 긴 업무와 협업 과정을 학습 환경에 담는 것이다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=a00xIn5kwhM)
