핵심 요약
- Reflection AI는 강화학습 연구에서 출발했지만, 학습의 앞단과 뒷단이 긴밀하게 연결돼 있다는 판단 아래 모델을 처음부터 직접 만드는 쪽으로 방향을 바꿨다.
- 첫 공개 모델 Beam은 코딩과 에이전트 작업을 겨냥한다. 회사 측은 비슷한 성능대의 모델보다 작업을 끝내는 데 3~4배 효율적이라고 설명했다.
- 라스킨은 기업이 공개 모델을 도입하려면 모델 가중치뿐 아니라 추론 소프트웨어, 클러스터 관리, 업무에 맞춘 실행 환경이 필요하다고 봤다.
- 그는 중국 공개 모델의 기여를 인정하면서도 모델과 인프라 공급원이 한곳에 집중되지 않는 경쟁 구조가 필요하다고 주장했다.
강화학습 연구에서 모델 전체 개발로
Reflection AI 공동창업자 겸 CEO인 미샤 라스킨은 회사가 처음에는 기존 공개 모델을 바탕으로 강화학습을 확장하려 했다고 설명했다. 강화학습은 모델이 작업 결과에 따른 신호를 받아 성능을 높이는 학습 방식이다. 당시 팀은 수학과 코딩 같은 영역에 이를 적용하면 대화 중심 모델을 실제 작업을 수행하는 에이전트로 발전시킬 수 있다고 봤다.
그러나 회사의 초기 연구와 업계의 진전은 예상보다 빨랐다. 라스킨에 따르면 당시 필요한 수준의 공개 기본 모델은 주로 중국에서 나왔고, 규모가 큰 강화학습을 잘 수행하려면 그 앞단의 사전학습도 직접 다뤄야 했다. 이에 Reflection AI는 사전학습부터 강화학습까지 맡기로 했다. 약 1년 전 30명가량이던 조직은 인터뷰 시점에 약 300명으로 늘었고, Beam을 첫 공개 모델로 내놓았다.
라스킨은 모델 개발의 어려움을 연산 자원 한 가지로 좁히지 않았다. 인재 채용과 유지, 데이터 확보, 연산 자원을 실제로 쓸 수 있게 하는 인프라 구축이 함께 맞아야 한다는 설명이다. 기존 대형 연구소에서는 연구자가 당연하게 쓰던 도구도 새 연구소에서는 만들어야 했다고 말했다.
Beam의 학습 규모와 효율
라스킨에 따르면 Beam은 전체 매개변수 5,000억 개 가운데 한 번의 처리에 230억 개를 사용하는 모델이다. 사전학습에는 GB300 약 6,000개를 몇 주간 사용했고, 강화학습에는 GB300 1만 개가 조금 넘는 규모를 4주간 사용했다고 설명했다. 강화학습 단계에는 에이전트의 실행 환경을 포함한 대규모 추론과 학습이 모두 필요해, 투입된 연산량이 사전학습보다 많았다는 것이다.
회사가 강조하는 지표는 정답에 도달하는 능력뿐 아니라 작업을 끝내는 데 드는 시간과 비용이다. 라스킨은 Beam이 비슷한 성능대의 모델보다 3~4배 효율적이며, 더 큰 일부 모델과 비교하면 차이가 10배가량에 이른다고 주장했다. 강한 사전학습 기반 위에서 강화학습을 크게 확장한 결과라는 게 그의 설명이다. 이 수치는 인터뷰에서 제시한 회사 측 평가로, 모든 작업에서 같은 차이가 난다는 뜻은 아니다.
연구 전반의 비용에 대해서도 그는 추정치를 제시했다. 최전선 모델을 따라잡는 데 필요한 자본은 1년에서 1년 반 전에는 수억 달러 규모였지만, 인터뷰 무렵에는 한 자릿수 십억 달러 규모로 올라갔다고 봤다. 다만 최전선을 따라가는 연구는 이미 확인된 방법을 활용할 수 있어 새로운 방법을 탐색하는 최전선 연구보다 자본을 효율적으로 쓸 여지가 있다고 말했다.
기업은 모델보다 업무 시스템을 먼저 바꾼다
라스킨은 폐쇄형 모델의 토큰을 구매하는 일을 모델, 추론 소프트웨어, GPU와 운영 체계를 함께 빌리는 것에 비유했다. 반면 공개 모델을 직접 운영하려는 기업은 그 주변 도구와 지원까지 마련해야 한다. Reflection AI는 대기업과 공공 부문 고객에게 이런 배포 도구와 서비스를 제공하는 사업을 구상하고 있다.
그는 기업이 처음부터 자체 모델을 미세조정하기보다, 기존 업무에 맞는 에이전트 실행 환경을 먼저 구성할 것으로 예상했다. 고객 확인 절차나 금융 규제 준수 업무가 예시다. 작업을 평가할 기준을 만들 수 있으면 고객 데이터를 그대로 학습시키지 않고도 유사한 합성 데이터를 만들어 모델을 개선할 수 있다고 설명했다. 반면 이미 공개 모델을 활용하는 AI 전문 기업에서는 제품 자체가 모델을 깊게 맞춤화한 형태인 경우가 많아, 두 시장의 도입 경로를 같게 보지 않았다.
라스킨이 접한 기업들은 대체로 폐쇄형 모델로 상당한 업무량을 처리한 뒤 비용과 통제 문제를 검토하면서 공개 모델을 고려했다. 자체 장비를 마련하더라도 장비와 실제 업무 서비스 사이를 연결할 소프트웨어와 운영 지원이 필요하다. 그가 Reflection AI의 역할을 모델 제공에만 한정하지 않는 이유다.
중국 오픈 모델과 인프라 경쟁
라스킨은 중국에서 나온 공개 모델이 서구 기업의 제품 개발에도 도움이 됐다고 평가했다. 동시에 공개 모델의 주요 공급원이 한 국가에 집중되는 것은 바람직하지 않다고 봤다. 그가 미국의 경쟁력 있는 공개 모델 생태계를 강조하는 이유는 중국 모델의 성과를 부정해서가 아니라 선택지를 늘리려는 데 있다.
그는 중국 기업이 앞으로도 좋은 모델을 만들 것으로 예상했다. 중국 기업이 모델을 계속 공개할 유인에 대해서는 자국 시장의 사업 기회와 해외 확산에 따른 이점을 가설로 제시했다. 공개 모델을 채택한 조직이 이를 실행하는 소프트웨어와 칩까지 같은 공급망에 의존하게 될 수 있다는 것이다. 이는 향후 채택 양상에 관한 그의 전망이지, 모든 공개 모델이 특정 장비를 요구한다는 확인된 사실은 아니다.
공개와 안전을 함께 보는 관점
공개 모델의 안전성에 대한 우려는 정당하다고 라스킨도 인정했다. 다만 소수의 폐쇄형 연구소 연구자만으로 시스템의 긴 취약점 목록을 모두 찾기는 어렵다고 주장했다. 더 많은 사람이 모델을 살피고 문제를 고칠 수 있다는 점에서 공개가 방어에 기여할 수 있다는 견해다.
그는 특히 사이버 영역에서는 공격 능력과 방어 능력을 깔끔하게 분리하기 어렵다고 말했다. 공격에 쓸 수 있는 기능을 제한하면 방어 측의 대응도 막힐 수 있다는 것이다. 그렇다고 안전하게 학습된 공개 모델을 위험한 용도로 바꾸는 일이 불가능하다고 주장하지는 않았다. 그는 현재 관찰되는 보안 문제와 더 이론적인 재난 시나리오를 구분하고, 발견한 취약점을 평가 데이터와 후속 학습으로 고치는 실무를 중시했다.
연구자의 역할은 어디로 가는가
라스킨은 모델이 연구자의 실험 속도를 높인다고 봤다. 매개변수 탐색이나 인프라의 세부 작업에는 이미 도움이 되지만, 어떤 아이디어를 어느 규모까지 시험할지 판단하는 데는 여전히 사람의 직관이 필요하다고 설명했다. 작은 실험에서는 드러나지 않고 큰 규모에서야 나타나는 효과도 있기 때문이다.
그는 같은 일을 하는 데 필요한 인원은 줄 수 있어도 연구 목표가 함께 커지고 있어 회사에서는 인력이 부족하다고 말했다. 핵심 모델 개발에 수천 명의 연구자가 필요한지는 회의적이었지만, 기업별 실제 업무에 모델을 적용하고 평가할 인력 수요는 클 것으로 예상했다.
Beam 사례에서 라스킨이 제시한 사업의 축은 모델 성능, 확보한 연산 자원, 고객의 신뢰다. 공개 가중치만으로는 기업의 업무가 돌아가지 않으며, 실제 배포와 평가를 맡을 역량까지 갖춰야 한다는 것이 그의 설명이다.
댓글 0
첫 댓글을 남겨 주세요.