핵심 요약
- 리플렉션 AI는 강화학습 연구에서 출발했지만, 대규모 강화학습을 효과적으로 하려면 사전학습 모델도 직접 만들어야 한다고 판단해 개방형 모델 Beam을 개발했다.
- 라스킨 CEO에 따르면 Beam은 총 5,000억 개의 매개변수 중 실행 시 230억 개를 사용하는 모델이다. 학습에는 사전학습보다 강화학습에 더 많은 연산량이 들었다.
- 라스킨은 기업이 모델을 곧바로 미세조정하기보다, 먼저 업무용 시스템을 모델 주위에 구축할 가능성이 크다고 봤다.
- 그는 모델을 공개해 더 많은 사람이 취약점을 살필 수 있어야 한다고 주장하면서도, AI 안전 문제 자체는 정당한 우려라고 인정했다.
강화학습 연구실이 모델 전체를 만들게 된 이유
리플렉션 AI 공동창업자이자 CEO인 미샤 라스킨은 창업 당시 수학·코딩 같은 영역에 강화학습, 즉 결과에 따른 피드백으로 모델의 행동을 개선하는 학습법을 적용하려 했다고 설명했다. 기존 개방형 모델을 기반으로 연구하면 독립 연구실도 비교적 적은 자본으로 이 일을 할 수 있다는 구상이었다.
그러나 회사의 실험과 업계에서 강화학습이 예상보다 빨리 발전했고, 리플렉션 AI가 기반으로 삼을 만한 서구권 개방형 모델은 부족하다고 판단했다. 라스킨은 연구상의 이유도 들었다. 강화학습을 큰 규모에서 잘 작동시키려면 그에 맞는 사전학습이 필요해 두 단계를 분리하기 어렵다는 것이다. 회사는 이에 따라 모델을 처음부터 끝까지 만드는 방향으로 범위를 넓혔다.
그는 약 1년 전 30명가량이던 조직이 현재 약 300명으로 늘었다고 말했다. 인재와 데이터, 연산 자원을 확보하는 것뿐 아니라 연구자가 실제로 쓸 수 있는 학습 인프라를 구축하는 일도 어려웠다고 했다.
Beam 학습에서 강화학습이 차지한 비중
라스킨에 따르면 Beam은 코딩과 도구를 사용해 여러 단계를 수행하는 에이전트 작업에 초점을 맞췄다. 총 매개변수는 5,000억 개이고, 한 번의 실행에 활성화되는 매개변수는 230억 개다. 그는 사전학습에 GB300 약 6,000개를 몇 주간, 강화학습에 GB300 1만 개 이상을 4주간 사용했다고 설명했다. 이 경우 강화학습에 투입한 연산량이 더 크다는 것이 그의 설명이다.
라스킨은 같은 수준의 모델과 비교할 때 Beam이 작업을 끝내는 데 필요한 추론이 3~4배 효율적이라고 주장했다. 더 큰 일부 모델과 비교하면 차이가 약 10배에 이른다고도 했다. 대담에는 비교 대상이나 측정 방식의 세부 내용이 제시되지 않았으므로, 이 수치는 회사 측 평가로 봐야 한다.
그는 더 많은 강화학습이 능력뿐 아니라 문제 해결 속도에도 기여한다고 설명했다. 다만 모델의 능력이 모든 작업에 고르게 퍼지는 것은 아니다. 서로 다른 평가 환경 사이에서 성능이 그대로 이어지지 않을 수 있지만, 적절한 데이터를 얻으면 새 환경에 빠르게 적응할 수 있다는 것이 그의 관찰이다.
기업은 모델보다 업무 시스템을 먼저 바꿀 수 있다
라스킨은 기업의 도입 경로를 AI를 중심으로 제품을 만든 회사와 구분했다. 일부 개방형 모델 전용 추론 업체에서는 요청의 90% 이상이 맞춤형 모델에서 나온다는 이야기를 들었지만, 그 고객은 처음부터 모델을 제품에 맞춰 개발한 회사가 많다는 것이다. 그는 일반 기업에서는 기존 도구와 업무 절차를 연결해야 하므로 미세조정, 즉 모델 자체를 추가 학습시키는 단계에 곧장 들어가기 어렵다고 봤다.
그의 예상은 기업이 먼저 기존 모델 주위에 에이전트 실행 환경을 구성하고, 필요해지면 모델을 미세조정하는 순서다. 예로 금융권의 고객 신원 확인과 준법 업무, 사이버 방어, 법률 업무를 들었다. 고객 데이터를 그대로 학습시키기보다 해당 업무를 평가할 방법을 만들고, 그 평가에 맞는 합성 데이터를 생성할 수 있다고 설명했다.
사업 모델에서도 모델 공개만으로는 충분하지 않다고 말했다. 기업이 자체 환경에서 모델을 운영하려면 추론 소프트웨어, 연산 자원 관리 도구, 에이전트 실행 환경이 필요하다. 리플렉션 AI는 이런 도구와 도입 지원을 제공해 기업의 실제 추론 사용량을 늘리려 한다. 라스킨은 기업이 폐쇄형 모델로 상당한 업무량을 먼저 처리한 뒤 비용과 통제권을 검토하면서 개방형 모델로 옮기는 사례를 관찰했다고 말했다.
개방형 모델 경쟁은 인프라 경쟁이기도 하다
라스킨은 중국에서 나온 개방형 모델이 서구 기업에도 도움이 됐다고 평가했다. 동시에 널리 쓰이는 개방형 모델의 공급원이 한 나라에 집중되는 상황은 바람직하지 않다고 봤다. 그는 미국을 포함한 다른 지역에도 경쟁력 있는 개방형 모델 생태계가 필요하다고 주장했다.
그의 설명에서 모델은 단독 제품으로 끝나지 않는다. 이를 효율적으로 실행하려면 소프트웨어와 칩, 데이터센터까지 이어지는 기반이 필요하다. 따라서 특정 국가의 모델을 채택하는 일이 그 나라의 인프라 공급망과 연결될 수 있다는 것이 그의 견해다. 그는 중국 기업이 모델과 함께 전체 인프라를 제공할 유인이 있다고 추정했다. 이는 향후 시장에 관한 해석이지 확정된 결과는 아니다.
공개와 안전성에 관한 주장
라스킨은 개방형 모델의 안전성 우려를 정당한 문제로 인정했다. 다만 소수의 폐쇄형 연구실 연구자만으로 모델에서 생길 수 있는 긴 목록의 취약점과 예상하지 못한 결과를 모두 찾기는 어렵다고 주장했다. 더 많은 연구자와 개발자가 모델을 살피고 문제를 고치는 편이 안전에 도움이 된다는 입장이다.
그는 특히 사이버 공격 능력과 방어 능력을 완전히 분리하기 어렵다고 말했다. 공격에 쓰일 수 있다는 이유로 능력을 제한하면 방어자도 같은 도구를 쓰지 못할 수 있다는 것이다. 반면 안전하게 훈련된 개방형 모델을 위험하게 바꾸는 일이 불가능하다고 주장하지는 않았다. 상당한 연산 자원과 노력이 필요할 수 있다는 것이 그의 판단이다.
그는 안전 문제를 당장 관찰되는 사이버 위험과 더 이론적인 시나리오로 나눠 살펴야 한다고 했다. 모델을 의도한 대로 행동하게 만드는 작업도 하나의 해법보다는 취약점을 발견하고 데이터와 평가 방법으로 수정하는 과정에 가깝다고 설명했다.
연구자의 역할에 대한 전망
라스킨은 자신의 박사학위 논문에서 다룬 문제를 언어 모델에 제시해 왔다고 말했다. 그의 평가로는 몇 년 전 모델은 이를 풀지 못했지만, 6개월 전에는 박사과정 수준으로 올바르게 해결했고 최근에는 당시 자신이 고려하지 못한 내용도 제시했다. 다만 그는 적절한 연구 질문을 찾는 것 자체가 큰 작업이라고 덧붙였다.
리플렉션 AI의 연구에서도 모델은 일부 실험과 세부 인프라 작업을 빠르게 수행하는 도구로 쓰인다. 라스킨은 작은 규모의 실험 결과가 큰 규모에서도 나타나는 것은 아니어서, 어디에 연산 자원을 더 투입할지는 여전히 연구자의 판단이 필요하다고 했다. 그는 핵심 모델 연구 인력이 무한히 늘지는 않겠지만, 모델을 실제 기업 문제에 적용하고 평가하는 엔지니어의 수요는 클 것으로 예상했다.
결론
Beam은 개방형 모델의 경쟁이 모델 성능만으로 결정되지 않는다는 리플렉션 AI의 판단을 보여준다. 라스킨이 제시한 사업의 핵심은 효율적인 모델을 만들고, 기업이 이를 자기 업무와 인프라에서 운영할 수 있도록 돕는 데 있다.
댓글 0
첫 댓글을 남겨 주세요.