핵심 요약

  • OpenRouter의 알렉스는 여러 모델을 함께 쓰면 단일 모델에 의존하지 않으면서 작업에 맞는 성능과 비용을 찾을 수 있다고 봤다.
  • 범용 에이전트는 여러 자료를 연결하는 데 유용하지만, 맡기는 일이 늘수록 사람이 업무를 이해하고 점검하기 어려워질 수 있다.
  • 한 가지 작업을 맡는 전문 에이전트와 출력 형식이 정해진 결정 모델은 책임 범위와 검사 기준을 분명히 할 가능성이 있다. 다만 이를 자연스럽게 쓰는 제품 형태는 아직 확립되지 않았다.
  • 모델이 커질수록 더 안전해지는지, 오히려 속임수에 능해지는지는 대담에서도 결론이 나지 않았다.

여러 모델을 쓰려는 이유

알렉스에 따르면 OpenRouter가 풀려는 문제 중 하나는 기업이 AI를 쓰면서 특정 모델이나 공급업체에 묶이지 않도록 하는 것이다. 그는 고객이 기존 범용 모델을 직접 쓰는 것보다 나은 서비스를 만들려면 고유한 데이터와 서비스뿐 아니라, 서로 다르게 훈련된 모델들의 능력을 결합하는 일이 중요할 수 있다고 봤다.

비용도 이유다. 알렉스는 AI 사용 비용이 충분히 낮아지기 전에는 성립하기 어려운 사업이 있다고 말했다. 그는 모델을 비교하고 선택할 수 있는 시장이 공급자의 가격 인하를 유도할 수 있다고 주장했다. 다만 모델의 장점을 웹페이지에 기능 목록으로 모두 적을 수는 없으며, 실제 사용 사례를 봐야 특정 작업에 무엇이 맞는지 알 수 있다고 설명했다.

알렉스가 예상보다 놀랐던 점은 기업들이 공개 가중치 모델을 탐색하려는 태도였다. 그가 본 기업들은 비용을 줄이고 자체 AI 역량을 쌓기 위해 기존 주요 모델 외의 선택지를 시험했다. 반면 어떤 모델이 특정 업무에서 더 나은지 보여줄 기업 내부 평가 기준은 아직 충분히 만들어지지 않았다고 지적했다.

범용 에이전트가 늘릴 수 있는 부담

대담에서는 한 에이전트가 일정, 대화, 코드 저장소, 영업 자료를 연결하면 서로 떨어진 정보를 찾을 수 있다는 사례가 나왔다. 암자드는 자신이 쓰는 에이전트가 과거의 만남과 현재 영업팀의 논의를 연결해 회의 준비에 도움을 준다고 설명했다.

알렉스는 반대쪽 비용을 짚었다. 에이전트에 더 많은 일을 맡길수록 사용자는 각 업무에서 무슨 일이 일어나는지 덜 이해하게 되는데, 에이전트가 그에 따른 책임까지 떠안지는 않는다는 것이다. 그는 매일 자신에게 필요한 일을 찾아보는 범용 에이전트를 개선하려 해도, 약 일주일 뒤에는 결과를 무시하게 되는 경험을 들었다.

그가 제안한 방향은 업무별 전문 에이전트다. 각 에이전트가 한 영역을 맡고 그 일을 제대로 하는지 별도로 검사하면, 사람은 문제가 생기는 영역에 더 깊이 관여할 수 있다. 다만 알렉스는 여러 전문 에이전트를 하나의 대화 상대처럼 편하게 쓰게 해주는 방식이 아직 발견되지 않았다고 인정했다.

기업에서는 접근 권한도 경계가 된다

암자드는 개인용 에이전트와 기업용 에이전트의 조건이 다르다고 봤다. 최고경영자는 폭넓은 관리자 권한으로 여러 자료를 연결할 수 있지만, 직원이나 팀마다 접근 가능한 정보는 다르다. 따라서 기업의 모든 맥락을 아는 범용 에이전트를 각 직원에게 그대로 제공하기는 어렵다는 설명이다.

전문 에이전트끼리 협력하더라도 정보 경계는 남는다. 대담에서는 은행 계좌를 아는 봇과 소셜 계정을 아는 봇이 서로 작업을 요청하되 인증 정보는 공유하지 않는 예가 나왔다. 암자드는 한 에이전트가 다른 에이전트를 설득해 허용되지 않은 정보를 받아내지 못하도록 통신 방식과 데이터 분리가 필요하다고 말했다. 그는 그 통신을 자연어에만 맡기는 방식에도 의문을 제기했다.

알렉스는 빠르고 저렴한 결정 모델을 가능한 검사 수단으로 들었다. 결정 모델은 정해진 선택지나 형식으로 판단을 내리는 모델이다. 예를 들어 에이전트의 도구 호출이 별도의 정책에 맞는지 매번 확인하고, 거부할 때 이유를 돌려주는 방식이다. 그는 OpenRouter에서 관련 소규모 시제품을 내부적으로 운영한다고 밝혔지만, 이를 확립된 해법으로 제시하지는 않았다.

작은 모델이 적합한 작업

암자드는 범용 모델이 반복되는 제한된 작업을 발견하면, 그 작업을 맡을 전문 모델을 따로 훈련하는 구상을 제시했다. 그는 이런 모델이 비용을 낮추고 위험을 줄일 가능성이 있다고 봤다. 다만 주요 모델 개발사가 충분히 저렴한 모델을 내놓는다면 별도 훈련의 비용상 이점은 달라질 수 있다는 조건도 달았다.

그가 든 실제 사례는 내부 비용 추정 모델이다. 입력을 받으면 예상 비용이 어느 금액 구간에 속할지 확률 분포를 내도록 훈련했다는 설명이다. 알렉스는 이처럼 출력 범위가 정해진 분류 모델은 자유롭게 글을 쓰거나 코드를 실행하는 모델보다 잘못 행동할 여지가 작다고 봤다. 기업이 자체 데이터로 만든 분류 모델은 범용 모델의 새 기능을 따라가기 위해 계속 다시 훈련해야 한다는 압박도 덜할 수 있다고 말했다.

여러 모델을 조합하는 시도도 언급됐다. 알렉스는 OpenRouter의 초기 결합 모델이 심층 조사 작업에서 특정 주요 모델 수준의 품질을 약 절반의 비용으로 냈다고 주장했다. 암자드도 모델 결합과 실행 방식을 함께 바꾼 자체 결과에서 주요 모델 수준을 비용의 40~50%로 달성했다고 말했다. 두 수치는 각각의 발표 결과에 대한 화자의 설명이며, 모든 작업에 적용되는 성능 비교는 아니다.

전문화가 해결하지 못한 문제

대담 참가자들은 큰 모델이 더 위험해질지에 대해서도 의견을 나눴다. 암자드는 모델이 평가받는 상황을 알아차리거나 속임수를 더 잘 수행할 가능성을 우려했다. 알렉스는 반대로 모델의 능력이 높아지면서 협력과 안전성도 나아질 수 있다는 주장이 있으며, 어느 쪽이 맞는지 아직 모른다고 말했다. 그에 따르면 관련 평가의 상당수는 공개되지 않아 판단하기 어렵다.

따라서 전문화는 범용 모델을 일괄적으로 대체한다는 결론이 아니다. 대담이 보여준 것은 작업의 범위, 필요한 데이터 접근, 출력 형식, 검사 가능성, 비용에 따라 모델을 나눠 쓸 이유가 있다는 점이다. 동시에 전문 에이전트의 사용 방식과 에이전트 사이의 안전한 통신은 여전히 풀어야 할 과제로 남아 있다.