핵심 요약

  • AI 모델 평가 플랫폼 아레나의 CEO 아나스타시오스는 중국 오픈소스 모델이 일부 작업에서 미국의 주요 비공개 모델을 앞섰다고 설명했다. 다만 이를 전체 성능의 우위로 일반화하지는 않았다.
  • 그는 기업이 비용과 데이터 통제권을 위해 자체 데이터로 조정한 모델을 원할 것으로 봤다. 미국 중심 오픈소스 기업이 수천억 달러 규모로 성장할 수 있다는 전망도 내놨다.
  • 데이터 수요가 모델의 규모와 수에 따라 늘어난다는 판단 아래, 데이터 시장이 2030년까지 최소 1,000억 달러, 나아가 1조 달러에 이를 수 있다고 전망했다.
  • 모델 선택과 배포에는 성능뿐 아니라 비용, 응답 속도, 보안 위험을 함께 평가해야 한다고 강조했다.

중국 모델의 약진이 보여준 범위

아레나는 실제 이용자의 작업과 선호를 바탕으로 AI 모델을 평가하는 플랫폼이다. 아나스타시오스는 중국 오픈소스 모델 Kimi가 웹 개발을 포함한 일부 작업에서 미국의 주요 비공개 모델보다 높은 평가를 받은 일을 중요한 변화로 꼽았다. 중국 연구소가 미국 모델의 결과를 학습에 활용하는 ‘증류’만으로 성능을 따라잡는다는 설명으로는 이 결과를 다 설명할 수 없다는 것이다. 그는 증류가 학습 과정의 일부일 가능성까지 부정하지는 않았다.

그렇다고 중국 오픈소스 모델이 현재 비공개 모델 사업을 대체했다고 보지는 않았다. 그는 여러 모델의 이용량을 보여주는 OpenRouter의 수치가 전체 사용량을 대표하지 않는다고 지적했다. 이용자가 비공개 모델은 제공사의 API에서 직접 쓰는 경우가 많은 반면, OpenRouter에서는 장애 시 대체 경로 등의 서비스를 얻으려 오픈소스 모델을 쓰기 때문이다. 그의 판단으로는 전체 추론 비용에서 중국 오픈소스 모델의 비중은 아직 작다.

기업이 자체 모델을 원하는 이유

아나스타시오스는 기업이 장기적으로 AI 공급망과 데이터를 더 직접 통제하려 할 것으로 봤다. 오픈소스 모델을 회사 데이터에 맞게 추가 학습시키면 외부 서비스에 데이터를 맡기는 범위를 줄이고, 비용과 제품 개선을 스스로 관리할 수 있다는 설명이다. 그는 기업이 보유한 데이터와 이용자 관계가 경쟁력의 원천이 될 수 있다고 주장했다.

다만 기업이 곧바로 중국 모델을 택할 것이라고 예상하지는 않았다. 그가 대화한 한 대기업은 아레나의 서비스에 중국 모델이 쓰이는지 확인한 뒤 미국 모델로 바꿀 수 있는지 물었다고 한다. 그는 미국의 규제 환경과 이런 고객 우려를 근거로 미국 중심 오픈소스 경쟁자가 등장할 가능성을 제시했다. 수천억 달러, 나아가 1조 달러 기업이 나올 수 있다는 발언은 그의 전망이다.

오픈소스 기업의 수익 모델로는 두 가지를 들었다. 모델을 배포하는 추론 사업자와 일정 매출 이상에서 수익을 나누거나, 무료로 공개한 모델을 계기로 기업의 추가 학습과 업무 도입을 지원하는 방식이다. 기업 현장에 기술자를 보내 적용을 돕는 사업은 비공개 모델 제공사도 하고 있다. 그는 공개 모델과 이런 지원을 결합하면 고객이 외부 서비스에 의존하는 정도를 줄일 수 있다고 봤다.

공개 모델의 보안과 선택 문제

자체 서버에서 모델을 운영해도 위험이 모두 사라지는 것은 아니라는 게 그의 주장이다. 학습 과정에 숨겨진 특정 입력이 모델의 보호 장치를 우회하게 만든다면, 외부에 공개된 기업용 챗봇을 통해 내부 데이터가 유출될 수 있다는 사례를 가정했다. 중국 모델의 미국 내 사용을 제한할 경우 이런 위험을 줄이고 미국 오픈소스 기업을 키울 가능성이 있지만, 미국 기업이 성능 좋은 모델을 활용할 기회도 잃을 수 있다고 설명했다. 그는 제한 조치가 생길 수 있다고 예상하면서도 결과는 불확실하며 자신이 이를 지지한다는 뜻은 아니라고 밝혔다.

모델이 늘수록 요청에 적합한 모델을 골라 보내는 ‘라우팅’도 어려워진다. 요청의 분야와 난도를 파악하고 각 모델의 성능 자료를 갱신해야 하기 때문이다. 아나스타시오스는 라우팅에 사업 가치가 있다고 보면서도, 어느 업체가 비용을 낮추면서 성능을 확보할지는 아직 정해지지 않았다고 평가했다.

데이터 시장과 아레나의 평가 사업

아나스타시오스는 데이터가 AI 모델 확대에 따라 수요가 함께 늘어나는 재화라고 설명했다. 모델이 커지고 자체 모델을 만드는 기업이 많아질수록 학습과 평가에 필요한 데이터도 늘어난다는 논리다. 그는 주요 모델 연구소의 데이터 지출이 GPU 지출의 약 10~20% 수준이라고 말하며, 이런 성장이 이어진다는 조건에서 2030년 데이터 시장을 최소 1,000억 달러에서 최대 1조 달러 규모로 전망했다. 현재 시장 규모나 확정된 매출을 뜻하는 수치는 아니다.

데이터 사업의 매출이 소수 대형 모델 기업에 집중된다는 우려에는 기업 고객으로 수요가 넓어질 수 있다고 답했다. 아레나 역시 이용자의 실제 작업에서 얻은 평가 자료를 활용해 기업이 용도에 맞는 모델을 고르도록 돕고 있다고 설명했다. 그는 AI의 가치를 성능, 비용, 응답 지연 시간으로 나눠 보되, 성능은 기업과 업무마다 기준이 달라 측정하기 가장 어렵다고 했다.

아레나의 사업에 대해서는 월간 방문자가 3,000만 명을 넘고, 한 분기 매출을 네 배로 환산한 연환산 매출 규모가 1억 달러를 넘었다고 밝혔다. 이는 확정된 연간 매출이 아니다. 그는 회사가 아직 잉여현금흐름 흑자 상태는 아니며, 들어오는 자금을 성장과 제품에 재투자하고 있다고 말했다.

모델 개발사의 경쟁은 수익으로 이어져야 한다

그는 새 AI 모델 연구소가 많아졌지만 뛰어난 모델을 만드는 것만으로는 다음 투자 유치를 보장하기 어렵다고 봤다. 지속 가능한 수익 모델과 매출 성장이 필요하다는 주장이다. 모델 제공사가 고객이 쓰는 응용 제품까지 직접 만들 가능성도 기존 소프트웨어 기업의 위험으로 꼽았다. 반면 기업의 관계망과 데이터, 복잡한 운영 체계를 가진 사업은 복제하기 더 어려울 수 있다고 덧붙였다.

아나스타시오스의 전망은 오픈소스 모델의 성능 향상이 기업의 선택지를 넓히고, 그 과정에서 자체 데이터와 실제 업무 성능을 측정하는 능력의 가치가 커진다는 데 모인다. 동시에 모델의 출처와 보안, 고객 집중, 수익성은 각 사업자가 풀어야 할 조건으로 남는다.