핵심 요약
- 랭체인 공동창업자이자 CEO인 해리슨 체이스는 에이전트를 모델·맥락·하네스의 결합으로 설명했다. 하네스는 필요한 맥락을 적절한 시점에 모델에 전달하고 도구 실행을 조율하는 구조다.
- 체이스는 범용 하네스로 시작한 뒤, 특정 업무에서 필요한 점검 단계와 제어 장치를 추가할 것을 권했다.
- 그에 따르면 업무가 모델이 학습 과정에서 익힌 작업 범위를 벗어날수록 하네스를 조정할 필요가 커진다. 다만 파일 편집처럼 모델이 이미 익힌 세부 작업 방식은 살리는 편이 낫다.
- 하네스를 개선하려면 업무별 평가 기준과 실행 기록이 필요하다. 정확도뿐 아니라 응답 시간과 비용도 함께 비교해야 한다.
하네스가 하는 일
체이스가 제시한 에이전트의 기본 구조는 단순하다. 요청을 받은 언어 모델이 응답을 생성하고, 필요하면 도구를 호출한다. 도구의 실행 결과를 다시 모델에 전달하는 과정이 반복된다. 하네스는 이 과정에서 고정된 정보와 실행 중 새로 생긴 정보를 모델에 넣고, 외부 시스템과의 상호작용을 조율한다.
그는 에이전트에 쓰이는 맥락으로 기억, 지식, 이전 대화 등을 들었다. 모델을 바꿔 쓸 수 있는 능력도 강조했다. 특정 모델에 묶이지 않으면서 해당 시점에 적합한 모델을 선택할 수 있기 때문이다.
범용 구조에서 업무별 구조로
기본 반복 구조를 바꾸지 않고도 하네스를 조정할 수 있다. 모델 호출 전에 맥락이 너무 길어졌는지 확인해 요약하거나, 도구 호출 결과가 클 때 별도로 처리하는 식이다. 샌드박스, 파일 시스템, 하위 에이전트, 기억에 대한 접근도 이런 지점에 추가할 수 있다. 체이스는 이를 미들웨어, 즉 실행 흐름의 특정 단계에 끼워 넣는 처리 방식으로 설명했다.
단계를 더 명시적으로 정하는 방법도 있다. 그는 하위 질문을 만들어 나눠 조사하는 심층 리서치와 정해진 단계를 거치는 코드 리뷰를 예로 들었다. 체이스에 따르면 과거에는 모델만으로 작업을 진행하기 어려워 이런 구조를 많이 썼다. 지금도 특정 업무의 진행 방식을 강하게 제어해야 할 때는 유용하다. 다만 그의 권고는 먼저 범용 하네스로 시작하고, 잘해야 할 업무가 뚜렷해지면 점검 단계와 제약을 추가하는 것이다.
직접 만들 시점을 가르는 기준
체이스는 기성 하네스가 모델에 익숙한 작업에서 강점을 보일 가능성이 크다고 봤다. 반면 작업이 모델의 익숙한 범위에서 멀어질수록 하네스를 조정할 필요가 커진다는 판단이다. 이는 기성 제품을 전부 쓰거나 하네스를 처음부터 전부 만드는 양자택일이 아니다. 기존 구조에 미들웨어를 추가하는 단계부터 업무 전용 실행 구조를 설계하는 단계까지 폭이 있다.
그는 법률 AI를 예로 들었다. 전체 법률 업무는 모델에 익숙하지 않을 수 있지만, 그 안에 포함된 파일 편집은 모델이 학습 과정에서 연습한 작업일 수 있다. 체이스에 따르면 모델마다 익힌 파일 편집 방식에도 차이가 있다. 따라서 전체 하네스를 법률 업무에 맞추더라도 파일 편집 도구는 사용하는 모델의 익숙한 방식에 맞출 수 있다. 랭체인의 Deep Agents는 모델에 따라 파일 편집 구현을 바꾸는 모델 프로필을 사용한다고 소개했다.
예측 가능성과 통제 역시 조정 이유다. 체이스는 금융 서비스 고객 중에는 범용 에이전트보다 단계를 명확히 제어할 수 있는 구조를 원하는 곳이 있다고 말했다. 다만 하네스가 결국 하나의 형태로 수렴할지에 대해서는 모른다고 답했다.
평가와 실행 기록으로 문제 찾기
체이스는 중요한 업무에 쓰는 에이전트라면 해당 업무의 평가 기준을 만들게 될 것이라고 전망했다. 평가 결과로 성능 저하를 발견하고, 모델이나 하네스를 바꾼 효과를 비교할 수 있다. 그가 소개한 오픈소스 평가 실행 도구 Harbor에서는 작업별 실행 환경, 에이전트에 주는 지시, 결과를 확인하는 테스트를 정의한다. 테스트에는 코드나 단위 테스트뿐 아니라 다른 모델 또는 에이전트의 판단도 쓸 수 있다. 비교할 때는 점수와 함께 지연 시간, 토큰 사용량, 비용도 봐야 한다는 설명이다.
평가 점수만으로는 실패 원인을 알기 어렵다. 체이스는 모델 호출이 잘못됐을 때 모델의 능력뿐 아니라 모델에 전달된 맥락을 살펴봐야 한다고 강조했다. 어떤 도구가 실행됐고 그 결과가 어떤 순서로 맥락에 쌓였는지 확인할 수 있어야 문제를 추적할 수 있다. 그는 맥락의 질이 문제인 경우가 더 많다고 판단했다.
실행 기록을 개선으로 잇는 과정
체이스가 설명한 개선 과정은 에이전트를 실행하고, 실행 기록을 모아 공통된 문제를 찾은 뒤, 수정안을 실험하는 것이다. 이용자가 명시적으로 평가하지 않더라도 제품 화면의 설계에 따라 반응을 얻을 수 있고, 기록을 대상으로 자동 평가를 돌릴 수도 있다. 자동 평가에 비싼 모델을 매번 쓰면 비용이 커지므로, 그는 작은 모델이나 맞춤형 지시를 준 기존 모델, 간단한 경우에는 코드로 평가하는 방법을 언급했다.
랭체인이 시연한 LangSmith Engine은 실행 기록을 살펴 반복되는 문제를 묶고 근거가 된 기록을 연결해 수정안을 제시하는 에이전트다. 시연에서는 지시문과 맥락, 하네스 코드의 변경안이 제시됐다. 체이스는 Engine 자체도 평가한다고 설명했다. 서로 다른 에이전트를 같은 평가 작업에 투입한 결과, Codex가 실행 기록을 분석하는 작은 스크립트를 적극적으로 작성하는 모습을 보고 그 방식을 Engine의 하네스에 반영했다고 말했다.
체이스의 기준은 업무에 맞는 평가에서 출발한다. 범용 하네스로 작업을 시작하고, 실행 기록과 평가 결과가 특정 제약이나 처리 방식의 필요성을 보여줄 때 그 부분을 조정하는 접근이다.
댓글 0
첫 댓글을 남겨 주세요.