핵심 요약

  • Trajectory 공동창업자 아르준 카라남은 모델의 능력이 높아져도 실제 업무 경험이 쌓이지 않는 문제를 ‘경험 격차’로 설명했다.
  • 그가 제시한 지속 학습은 에이전트의 작업 기록과 사용자 피드백을 수집해 목표를 정의하고, 모델과 실행 환경 중 적절한 부분을 개선하는 방식이다.
  • 단순한 좋아요·싫어요보다 사용자의 수정, 실행 취소, 재시도에서 더 구체적인 학습 신호를 얻을 수 있다고 봤다.
  • 실제 제품에서 쓰는 실행 환경과 평가·훈련 환경을 가깝게 만들고, 도구 호출과 하위 에이전트의 작업까지 기록해야 한다고 강조했다.
  • 고객 데이터의 직접 학습이 어려운 경우에는 데이터 분포를 참고해 합성 데이터를 만드는 접근을 언급했지만, 구체적인 적용 결과는 제시하지 않았다.

모델의 능력과 업무 경험 사이의 격차

카라남은 AI 모델이 계속 발전하고 있지만, 에이전트와 일할 때는 매번 첫 출근한 사람을 상대하는 듯한 느낌이 남는다고 말했다. 그의 구분에서 모델 자체의 능력과 특정 업무를 수행하며 쌓는 경험은 서로 다른 축이다. Trajectory가 풀려는 문제는 사용 중 생성되는 작업 기록을 버리지 않고, 이후의 성능 개선에 활용하는 것이다.

그가 설명한 지속 학습은 모델 가중치만 계속 바꾸는 뜻이 아니다. 제품의 지능은 모델, 도구, 실행 환경, 제공되는 맥락으로 이루어진 시스템이며, 새로 얻은 정보가 어느 부분에 반영돼야 하는지를 판단해야 한다는 관점이다.

사용 기록에서 학습 목표까지

첫 단계는 작업의 전체 경로를 기록하는 것이다. 카라남은 주된 동작만 남기고 도구 호출이나 하위 에이전트의 작업을 버리면, 최종 결과가 어떻게 나왔는지 학습하기 어렵다고 지적했다. 제품은 사용자와 에이전트의 상호작용을 포착하는 동시에 필요한 피드백을 얻을 수 있어야 한다.

좋아요·싫어요 같은 평가는 신호가 불분명할 수 있다. 코딩 에이전트의 변경을 일단 받아들였다가 여러 커밋 뒤 문제를 발견하는 경우처럼, 평가 시점과 오류 발견 시점이 다를 수 있기 때문이다. 그는 사용자의 편집, 실행 취소, 재시도를 함께 기록해야 한다고 말했다.

Trajectory는 이런 상호작용에서 에이전트가 무엇을 해야 하는지 정의하는 명세와 보상 신호를 추출하는 연구를 진행한다고 설명했다. 이후 긴 작업 기록을 활용한 강화학습으로 모델을 개선하는 한편, 정보의 성격에 따라 실행 환경에도 반영하려 한다. 예컨대 어떤 회사가 상장 폐지됐다는 사실은 모델에 학습시키기보다 에이전트가 사용할 수 있는 맥락으로 제공하는 편이 적절하다는 것이 그의 예시다.

실제 사용과 가까운 평가 환경

카라남은 사용자가 쓰는 제품, 평가 환경, 훈련 환경이 가능한 한 가까워야 한다고 주장했다. 평가 과제에는 현재의 실제 사용 방식뿐 아니라 사용자가 요청했지만 제품이 아직 수행하지 못하는 일도 반영할 수 있다.

이를 위해 사용자가 수행한 작업을 다시 실행할 수 있게 만드는 것이 중요하지만, 그는 이를 상당한 인프라 과제로 봤다. 평가 역시 운영 환경에서 쓰는 실제 실행 체계를 통해 이뤄져야 한다고 말했다. 여기서 실행 체계는 에이전트에 도구와 정보 접근 방식을 제공하고 작업 흐름을 뒷받침하는 부분이다.

에이전트가 사용할 수 있는 도구와 응답

카라남은 과거 모델의 오류를 막도록 설계된 실행 체계가 지금의 에이전트에는 지나치게 고정된 작업 순서를 강제할 수 있다고 봤다. 대신 검색 도구나 비공개 정보 접근 같은 기본 기능을 제공하고, 에이전트가 이를 조합하도록 하는 방향을 제안했다. 이상적으로는 사용자가 화면에서 할 수 있는 일을 에이전트도 도구 호출로 할 수 있어야 한다는 설명이다.

도구가 돌려주는 정보도 중요하다. 데이터베이스에 무언가를 쓴 뒤 응답이 ‘완료’에 그치면, 에이전트는 무엇이 기록됐는지 알기 어렵다. 카라남은 실제로 읽고 쓴 내용을 파악할 수 있는 응답이 있어야 이후의 평가와 학습에도 도움이 된다고 말했다.

모델 측면에서는 가중치를 직접 다루며 개선하려면 공개 가중치 모델의 운영에 익숙해질 필요가 있다고 했다. 다만 전환에는 보안, 안전, 접근 권한 등 여러 고려 사항이 따른다고 덧붙였다. 작업에 맞는 모델을 선택하는 라우터의 활용도 시험해 볼 대상으로 제시했다.

피드백의 의미와 적용 범위

질의응답에서 카라남은 피드백을 두 종류로 나눴다. 사용자가 불만을 표시하거나 세션을 떠나면 무언가 잘못됐다는 점은 알 수 있지만, 올바른 결과가 무엇인지는 알기 어렵다. 반면 사용자가 결과를 고치거나 재시도 끝에 정답에 도달하면, 원하는 결과에 관한 신호가 더 분명해진다.

피드백이 누구에게 적용되는지도 구별해야 한다. 특정 도구 호출이 반복해서 실패한다는 정보는 여러 사용자에게 유효할 수 있어 모델 개선의 대상이 될 수 있다. 반대로 한 사용자가 하위 에이전트를 쓰지 말라고 한 선호는 모델 전체에 학습시키기보다 해당 사용자의 맥락에 두는 편이 적절하다는 설명이다. 조직이나 고객 단위에만 해당하는 정보도 있을 수 있다.

고객 데이터 사용 제약에 관한 질문에는, 고객 데이터를 직접 훈련에 쓰지 않고 그 분포를 참고해 합성 데이터를 만든 뒤 분포를 비교하는 접근을 설명했다. 이는 그가 제시한 가능한 방법이며, 발표에서 그 방법의 성능이나 개인정보 보호 수준이 검증됐다는 수치는 제시되지 않았다.

어디에서 효과를 기대하는가

카라남은 지속 학습이 여러 작업에 적용될 수 있다고 보면서도, 특히 사용자가 현재 제품 능력의 경계에서 시도하는 작업에 관심을 보였다. 사용자가 요청했지만 에이전트가 간신히 수행하거나 실패한 일을 훈련을 통해 수행하게 되는 사례를 고객에게서 보고 있다고 말했다. 다만 해당 사례의 규모나 성과 수치는 밝히지 않았다.

그가 제시한 핵심은 사용 기록을 모으는 데서 끝나지 않는다. 무엇이 잘못됐고 무엇이 더 나은 결과였는지, 그 변화가 모든 사용자에게 적용되는지 특정 고객에게만 적용되는지를 구분해야 경험이 실제 개선으로 이어질 수 있다는 것이다.