핵심 요약
- 하비의 게이브 페레이라는 응용 서비스 기업이 대형 AI 연구소와 경쟁하려면 자체 평가 기준을 만들고 외부 모델·연구 인프라를 활용해야 한다고 주장했다.
- 하비는 민감한 고객 데이터를 학습에 쓰지 않는다. 대신 법률 전문가가 문제와 채점 기준을 설계하고, 이를 바탕으로 합성 데이터를 생성한다.
- 모델 성능은 법률 과제 평가만으로 판단하지 않는다. 제품별 테스트와 사람의 평가를 거쳐 출시하고, 운영 중에도 사용 지표와 고객 반응을 살핀다.
- 합성 데이터가 실제 제품 사용 양상을 충분히 반영하지 못한다는 점은 아직 해결되지 않은 과제다.
고객 데이터 없이 법률 과제를 만드는 방법
하비 공동창업자이자 사장인 게이브 페레이라는 AI 응용 서비스 기업이 대형 모델 연구소보다 자금, 인력, 컴퓨팅 인프라, 데이터에서 불리하다고 설명했다. 그가 제시한 출발점은 평가 기준인 벤치마크를 직접 만드는 것이다. 모델이 어떤 법률 업무를 수행해야 하는지 검증할 수 있어야 학습 결과도 판단할 수 있기 때문이다.
하비는 대형 로펌의 변호사 업무를 다루는 Legal Agent Bench, 기업 내부의 계약 협상을 다루는 데이터셋, 실사 업무용 데이터셋을 만들었다고 밝혔다. 실사 데이터셋의 가장 큰 자료실은 8천만 토큰 규모다. 페레이라에 따르면 이 데이터셋으로 긴 문맥을 다루는 복잡한 과제를 연구한다.
제약은 고객의 법률 자료를 학습에 쓸 수 없다는 점이다. 인수합병 실사에는 계약서뿐 아니라 협상 과정의 이메일과 회의 내용도 필요하지만, 이런 입력 자료는 공개돼 있지 않다. 최종 인수 계약서를 공개 자료에서 찾더라도 그것을 작성할 때 검토한 자료실까지 얻을 수 있는 것은 아니다.
하비의 법률 전문가들은 먼저 실사에서 찾아야 할 문제와 채점 기준을 정한다. 예를 들어 계약서끼리 내용이 맞지 않거나 필요한 계약서가 빠진 상황을 설계한 뒤, 그 문제가 들어 있는 가상의 자료실을 생성한다. 모델이 실사 메모를 작성하면 미리 심어 둔 문제를 발견했는지 확인할 수 있다. 페레이라는 Mercor와 Snorkel 같은 기업의 도움으로 생성 자료의 규모와 현실성을 높인다고 설명했다. 다만 합성 데이터만으로 충분하다고 보지는 않는다.
평가 환경의 비용과 공개 범위
자료실이 커지면 평가 비용도 커진다. 하비의 실사 데이터셋에는 언어 모델이 출력을 판정하는 단위 테스트가 1천 개 넘게 들어 있다. 큰 모델로 여러 차례 학습 시도를 하면 이 평가 과정이 비싸지기 때문에, 하비는 평가 환경의 효율을 높이는 작업도 했다고 밝혔다.
하비가 일부 데이터셋을 공개한 이유는 다른 연구자들이 사용해야 데이터의 결함을 더 잘 찾을 수 있기 때문이다. 페레이라는 외부의 수정 제안과 새 모델의 평가 결과를 얻을 수 있다고 말했다. 동시에 공개된 벤치마크에 모델이 맞춰질 수 있다는 긴장도 인정했다. 그는 공개 합성 데이터로 여러 시스템의 개선을 돕는 한편, 로펌이 비공개 자료를 활용해 자체 시스템을 맞춤화하는 일에도 가치를 둔다고 설명했다.
외부 연구 파트너와 사내 후속 학습
페레이라는 강력한 공개 모델을 특정 업무에 맞게 추가 학습하는 후속 학습이 가능해졌다고 봤다. 그의 주장은 모든 분야에서 대형 모델과 동등해진다는 뜻은 아니다. 하비처럼 범위가 뚜렷한 과제에서는 경쟁력 있는 결과를 얻을 수 있다는 설명이다.
하비는 여러 외부 연구·인프라 기업과 협력한다. 페레이라에 따르면 연구 프로젝트가 사내 인력이나 단일 파트너의 처리 능력보다 많고, 파트너마다 연구 접근법과 다루는 공개 모델이 다르다. 하비는 협력 과정에서 데이터셋과 학습 방법을 점검하면서 사내 후속 학습도 늘리고 있다. 목표는 그 결과를 비공개 모델과 함께 제공할 수 있는 자체 모델로 묶는 것이다.
모델을 제품에 넣기 전후의 검증
모델을 학습한 뒤 실제 제품에 제공하는 일은 별개의 과제다. 페레이라에 따르면 하비는 60개국에서 여러 제품을 운영하며, 고객마다 선호하는 모델도 다르다. 서비스 수준을 맞추려면 모델과 제공 업체를 여러 개 두고 장애 시 대체할 경로도 마련해야 한다.
하비는 새 모델이 나오면 법률 벤치마크와 사람의 비교 평가를 먼저 살핀다. 이어 제품별 주요 사용 흐름에서 자동 테스트와 사람의 테스트를 수행한다. 일반적인 법률 평가에서 좋은 점수를 받더라도 특정 제품에는 맞지 않을 수 있기 때문이다. 비용, 응답 지연, 지역별 제공 가능 여부도 출시 판단에 포함한다. 출시 후에는 큰 변경에 대한 A/B 테스트, 사용 지표, 가동 시간, 토큰 효율, 고객 반응을 확인한다.
하비는 후속 학습 모델을 넣기 전에 기존 제품에서 공개 모델로 바꿀 수 있는 부분도 찾는다. 페레이라는 가장 큰 모델이 필요하지 않은 인용문 생성 기능을 한 사례로 들었다. 일부 요청만 공개 모델로 보내는 모델 라우팅도 활용할 수 있다. 이 경험이 쌓이면 후속 학습 모델 역시 같은 운영·평가 체계에서 다룰 수 있다는 설명이다.
아직 남은 간극
질의응답에서 페레이라는 합성 데이터의 분포가 실제 제품 사용 양상과 다르다고 인정했다. 실사 자료실에서 좋은 성능을 보인 모델이 이메일 초안 작성에서도 잘 작동한다는 보장은 없다. 고객 데이터를 들여다볼 수 없기 때문에 이 간극을 좁히는 방법이 어려운 문제로 남아 있다. 벤치마크에 지나치게 맞춰진 모델은 더 일반적인 업무에서 성능이 떨어질 수도 있다.
하비가 운영 중 얻는 피드백 신호도 고객 데이터로 모델을 학습한다는 뜻은 아니다. 페레이라는 사용자 테스트 등의 결과를 다음 데이터셋 설계와 모델 개선에 참고한다고 구분했다. 장기적으로는 로펌이나 기업마다 하는 일에 맞춰 AI 시스템을 개선하면서도 고객 자료를 보호하는 체계를 과제로 제시했다.
하비의 접근은 법률 업무의 평가 자료를 만들고, 그 결과로 모델을 학습·선별한 뒤, 실제 제품에서 다시 확인하는 과정으로 이어진다. 페레이라는 이 과정의 기반이 이미 운영 중인 제품이며, 후속 학습은 그보다 넓은 제품 체계에 들어가는 한 요소라고 설명했다.
댓글 0
첫 댓글을 남겨 주세요.