핵심 요약

  • 딥시크의 V3와 R1은 같은 사전학습 기반 모델에서 출발하지만, 이후 서로 다른 후학습을 거친다. R1은 추론 능력을 강화한 모델이다.
  • 딥시크의 효율은 필요한 전문가 부분만 활성화하는 모델 구조와 메모리 사용을 줄이는 어텐션 기법, GPU 간 통신을 세밀하게 조정한 구현에서 나온다.
  • V3의 사전학습에 쓰였다는 약 2,000개 GPU를 딥시크의 전체 보유량이나 R1을 포함한 총개발비로 해석해서는 안 된다.
  • 공개 가중치는 자체 서버에서 모델을 운영할 수 있게 하지만, 학습 데이터와 코드까지 공개했다는 뜻은 아니다.
  • 스타게이트의 1,000억·5,000억 달러는 이미 확보된 자금 규모가 아니다. 대담에서는 첫 구간의 자금 조달 가능성과 이후 단계의 불확실성을 구분했다.

V3와 R1은 어디서 갈라지는가

AI 연구자 네이선 램버트의 설명에 따르면 딥시크는 대량의 텍스트에서 다음 토큰을 예측하는 사전학습으로 V3의 기반 모델을 만들었다. 이 기반 모델에 일반적인 지시 따르기 후학습을 적용한 것이 대화형 V3다. R1은 같은 기반 모델에서 출발해 추론을 위한 별도의 후학습을 거쳤다. 램버트는 추론 강화학습 뒤에도 선별한 답변을 이용한 학습과 사람의 선호를 반영하는 학습 등이 이어졌다고 설명했다.

따라서 V3와 R1을 각각 처음부터 독립적으로 학습한 모델로 보거나, V3의 대화형 모델에 기능 하나를 덧붙인 관계로 이해하면 학습 과정을 놓치게 된다.

효율을 만든 구조와 구현

반도체 분석가 딜런 파텔은 딥시크의 핵심 기법으로 전문가 혼합 모델과 다중 헤드 잠재 어텐션을 꼽았다. 전문가 혼합 모델은 매번 전체 매개변수를 계산하는 대신 입력에 필요한 일부만 활성화한다. 파텔에 따르면 딥시크 모델의 전체 매개변수는 6,000억 개가 넘지만, 한 번의 처리에 활성화되는 매개변수는 약 370억 개다. 다만 전문가를 여러 GPU에 나눠 배치하면 특정 부분에 작업이 몰리고 다른 GPU가 쉬는 문제가 생긴다.

다중 헤드 잠재 어텐션은 모델이 앞선 내용을 참조할 때 필요한 메모리 부담을 줄인다. 램버트는 어텐션 부분의 메모리를 기존 방식보다 약 80~90% 절약할 수 있다고 설명하면서, 이것이 모델 전체 비용의 80~90% 절감을 뜻하지는 않는다고 선을 그었다. 파텔은 딥시크가 GPU 간 통신도 낮은 수준에서 직접 조정했다고 설명했다. 효율은 단일 기법의 결과가 아니라 구조와 구현을 함께 다듬은 결과라는 분석이다.

저렴한 학습비라는 주장에 빠진 비용

파텔에 따르면 딥시크가 공개한 약 2,000개 H800 GPU는 V3 기반 모델의 사전학습에 관한 수치다. R1의 비용, V3 대화형 모델과 R1의 후학습 비용, 기법을 고르기 위한 연구와 실험 비용은 여기에 포함되지 않았다. 램버트는 주목할 만한 모델을 만들 때 본 학습 실행에 쓰는 연산량의 2~4배를 실험에 쓰는 것이 일반적이라고 말했다.

딥시크와 연결된 헤지펀드 하이플라이어는 2021년 이미 1만 개 A100 GPU 규모의 클러스터를 구축했다고 발표했다. 파텔은 딥시크의 전체 GPU가 약 5만 개에 가깝다고 추정했지만, 이 수치는 공개된 보유량이 아니라 그의 조사에 따른 추정이다. 사전학습 한 차례의 GPU 사용량과 기업이 확보·운영하는 전체 연산 자원을 구분해야 하는 이유다.

서비스 가격에도 같은 주의가 필요하다. 대담 당시 렉스 프리드먼은 출력 토큰 100만 개당 R1이 2달러, OpenAI o1이 60달러라고 제시했다. 램버트와 파텔은 가격 차이에 모델 구조뿐 아니라 공급자의 가격 책정도 작용한다고 봤다. 파텔은 당시 딥시크가 수요에 맞춰 서비스를 제공할 GPU 용량이 부족했다고 설명했다. 낮은 API 가격만으로 실제 운영비나 수익성을 확정할 수는 없다.

공개 가중치가 열어 주는 것과 남기는 것

공개 가중치는 모델의 수치화된 매개변수를 내려받아 직접 실행할 수 있다는 뜻이다. 램버트는 이를 회사 서버에 요청을 보내는 API 사용과 구분했다. 자체 환경에서 실행하면 이용자가 데이터를 어디로 보내는지 통제할 수 있지만, 외부 업체가 운영하는 앱이나 API를 쓰면 그 운영자의 데이터 처리 방식에 의존한다.

딥시크 R1은 상업적 이용 제한이 적은 MIT 라이선스로 제공된다고 램버트는 설명했다. 반면 공개 가중치만으로 학습 과정 전체를 재현할 수는 없다. 그는 학습 데이터와 코드까지 있어야 재현이 쉬워진다고 강조했다. 딥시크가 상세한 기술 논문을 공개한 점과 데이터·코드 공개 여부는 별개의 문제다.

커지는 클러스터와 확정되지 않은 투자

파텔은 AI 서비스에 답을 제공하는 추론용 GPU는 여러 데이터센터에 분산할 수 있지만, 대규모 학습에는 촘촘히 연결된 클러스터가 중요하다고 설명했다. 그가 제시한 규모는 GPT-4 학습의 약 2만 개 A100 GPU에서 xAI의 멤피스 클러스터 20만 개 GPU까지 커졌다. 규모가 커질수록 전력, 냉각, GPU 간 연결도 함께 확보해야 한다.

스타게이트에 대해서는 발표액과 확보 자금을 구별했다. 파텔은 텍사스 애빌린의 첫 단계에 붙은 1,000억 달러를 서버 구매비만이 아니라 운영 등을 포함한 총소유비용으로 설명했다. 그는 첫 10만 개 GB200 GPU 규모의 클러스터에는 자금을 댈 수 있다고 봤지만, 이후 단계의 자금 조달은 불확실하다고 말했다. 5,000억 달러라는 전체 구상도 이미 집행됐거나 계약으로 확정된 투자액으로 제시하지 않았다.

결론

대담이 보여 준 딥시크의 성과는 모델 구조와 운영 기술의 개선이다. 다만 사전학습 비용, 서비스 가격, 전체 개발비는 서로 다른 숫자다. 초대형 데이터센터 계획 역시 발표 규모와 실제 확보 자금을 나눠 읽어야 한다.