# 기업이 자체 AI 역량을 구축하는 이유와 순서

> 2026-08-11 · Sequoia Capital · 큐레이션 김태우
> https://challengekim.com/insights/기업이-자체-ai-역량을-구축하는-이유와-순서
> 원문: https://www.youtube.com/watch?v=bMMv0bZzONg

## 핵심 요약

- 강연에서 말하는 ‘소버린 AI’는 기업이 외부 서비스에만 의존하지 않고, 필요한 영역에서 모델 가중치까지 직접 보유하며 AI 역량을 통제하는 방식이다.
- 자체 모델을 고려하는 이유는 비용, 응답 속도, 특정 업무에서의 성능, 외부 제공업체에 대한 의존도를 줄이려는 필요다.
- 모든 AI 기능을 직접 만들 필요는 없다. 기능별 비용과 지연 시간, 요구 성능, 독점 데이터의 가치를 따져 보유할 영역을 정해야 한다.
- 기술 개발은 평가 체계를 먼저 마련한 뒤 모델과 실행 구조를 조정하고, 필요한 경우 추가 학습과 고객 사용 데이터의 피드백으로 이어진다.

## 자체 AI를 고려하는 이유

연사는 소버린 AI를 기업이 자신의 AI 역량을 모델의 가중치 수준까지 보유하는 것으로 설명했다. 다만 이는 Opus나 GPT 같은 외부 모델 사용을 중단하자는 뜻은 아니라고 선을 그었다. 코딩 에이전트, 데스크톱 작업, 고성능 모델 API에는 외부 모델이 여전히 유용하다는 판단이다.

자체 모델을 검토하는 첫 번째 이유는 비용이다. 연사에 따르면 AI 제품이 많이 사용될수록 모델 사용에 따른 원가도 커질 수 있어, 수익성이 낮은 기업에는 비용 구조가 중요한 문제가 된다. 두 번째는 속도다. 코딩이나 보안처럼 응답 시간이 중요한 일부 업무에서는 작게 압축해 맞춤화한 모델이 대형 범용 모델보다 적합할 수 있다고 설명했다.

세 번째는 특정 업무의 성능이다. 연사는 공개된 가중치를 가진 모델을 기업 데이터에 맞춰 조정하면 일부 영역에서 폐쇄형 모델보다 나은 성능을 낼 수 있다고 주장했다. 마지막 이유는 통제권이다. 외부 모델 제공업체가 좋은 협력 상대이더라도, 기업은 핵심 제품 역량을 스스로 운용할 선택지를 원한다는 것이다.

## 무엇을 보유하고 무엇을 외부에서 쓸 것인가

자체 AI 구축은 전부 아니면 전무의 선택이 아니다. 연사가 제시한 판단 기준은 해당 기능의 원가 비중, 속도와 지연 시간의 중요도, 필요한 성능, 모델 개선에 쓰이는 데이터의 독점성 네 가지다.

코딩 제품을 예로 들면 에이전트에는 별도 조정 없이도 강한 성능을 내는 외부 모델을 주로 쓰는 반면, 탭 키 자동완성은 호출 빈도가 높고 속도가 중요해 자체 모델을 쓰는 경우가 많다고 설명했다. 생명과학 분야에서는 기업 고유 데이터의 가치가 자체 모델을 검토하는 이유로 제시됐다. 같은 제품 안에서도 기능에 따라 다른 결론이 나올 수 있다는 뜻이다.

## 연구팀과 결과를 보여주는 방식

연사는 자체 AI 연구를 기존의 공통 AI 플랫폼팀에 맡기는 방식에 신중해야 한다고 봤다. 여러 제품팀을 지원하는 조직과 모델 성능을 새로 끌어올리는 연구 조직에는 다른 역할이 필요하다는 이유다. 연구 중심 경력과 엔지니어링 중심 경력 모두 연구 책임자로 이어질 수 있으며, 팀의 구성은 수행할 연구의 성격에 맞춰야 한다고 설명했다. 사례로는 연구팀 7명으로 연구 결과를 발표해 온 Harvey를 들었다.

또 연구 성과를 외부에서 이해할 수 있게 드러내는 일을 별도 과제로 제시했다. 연사의 설명에 따르면 구매자는 AI 공급업체의 기술 역량을 가려야 하므로, 연구 발표나 별도 연구 조직을 통한 기술적 설명이 기업의 역량을 판단하는 근거가 될 수 있다.

## 평가부터 학습까지의 기술 경로

기술 작업의 출발점은 ‘평가’다. 평가란 제품이 맡길 실제 업무에서 모델의 성능을 측정하는 절차다. 연사는 이를 먼저 마련해야 이후의 모델 선택과 개선 결과를 판단할 수 있다고 강조했다.

그다음에는 요청을 적절한 모델에 보내는 라우터와, 모델에 도구·맥락·실행 절차를 제공하는 구조인 하네스를 조정할 수 있다. 기존 모델만으로 충분한 성능을 얻는 기업도 있고, 추가 학습이 필요한 기업도 있다. 사전 학습에 앞선 단계의 학습이나 처음부터 모델을 학습시키는 작업까지 필요한 경우는 더 드물다고 설명했다. 최종적으로는 고객이 제품을 사용하며 생기는 데이터를 성능 개선에 반영하는 피드백 구조를 구상한다.

자체 모델을 운용하면 단순한 API 호출 외에도 모델 선택과 추가 학습, 하네스 설정, 운영 중 성능 변화의 평가, 양질의 학습 데이터 확보가 필요하다. 연사는 데이터의 형태로 전문가의 작업 과정, 합성 데이터, 강화학습 환경을 들었다. 공개 가중치 모델은 기업이 이런 요소를 직접 조정할 여지를 주지만, 그만큼 운영해야 할 기술 체계도 복잡해진다.

## 결론

강연의 제안은 AI 전체를 일괄적으로 자체 구축하라는 것이 아니다. 기업이 비용·속도·성능·데이터의 가치를 기능별로 따지고, 직접 보유하기로 한 영역에서는 평가와 운영 체계를 갖춰 개선 결과를 확인하자는 것이다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=bMMv0bZzONg)
