# 알파고를 다시 만들며 살펴본 탐색과 학습의 관계

> 2026-05-15 · Dwarkesh Patel · 큐레이션 김태우
> https://challengekim.com/insights/알파고를-다시-만들며-살펴본-탐색과-학습의-관계
> 원문: https://www.youtube.com/watch?v=X_ZVSPcZhtw

## 핵심 요약

- 알파고는 정책망으로 유망한 수를 좁히고 가치망으로 끝까지 두지 않은 판의 승리 가능성을 추정해, 방대한 바둑 탐색을 줄인다.
- 몬테카를로 트리 탐색(MCTS)이 만든 수의 선택 분포를 정책망의 학습 목표로 삼으면, 탐색에 들인 계산을 다음 모델의 예측에 반영할 수 있다.
- 탐색 결과가 언제나 더 좋은 학습 목표는 아니다. 가치망의 평가가 틀리거나 탐색 횟수가 부족하면 오히려 나쁜 수를 가르칠 수 있다.
- 에릭 장은 바둑에서 통하는 이 방식이 언어모델에 그대로 적용되기는 어렵다고 본다. 언어의 선택지는 훨씬 넓고 중간 상태의 가치를 평가하기도 어렵다.

## 바둑의 탐색을 줄이는 두 가지 예측

바둑은 마지막에 승패가 정해지므로, 중간의 한 수가 좋은지 즉시 알기 어렵다. 19×19 판에는 첫 수를 둘 수 있는 지점이 361곳 있고, 대국은 250\~300수까지 이어질 수 있다. 가능한 수를 끝까지 모두 펼쳐 보는 방식은 감당하기 어렵다.

장은 알파고의 핵심을 탐색의 폭과 깊이를 함께 줄이는 데서 찾는다. **정책망**은 현재 판에서 둘 만한 수마다 확률을 매겨 탐색할 곳을 안내한다. **가치망**은 판을 보고 그 상태에서 이길 가능성을 추정한다. 가치망 덕분에 탐색은 매번 대국의 끝까지 내려가지 않아도 된다. 장의 저예산 실험에서는 잔차 신경망이 트랜스포머보다 나았지만, 그는 이를 모든 조건에 적용되는 결과로 제시하지 않았다.

## 탐색 결과가 다음 학습 목표가 된다

MCTS는 현재 판에서 시작해 수를 선택하고, 아직 살펴보지 않은 가지를 늘린 뒤, 가치망으로 평가하고, 그 값을 앞선 선택들에 되돌려 반영한다. 이를 반복하면서 각 수를 방문한 횟수가 최종 선택 분포를 이룬다. 탐색은 이미 유망해 보이는 수와 덜 살펴본 수 사이에서 선택을 조절한다.

자가 대국에서는 매 수마다 정책망의 초기 예측을 MCTS로 다듬는다. 대국이 끝난 뒤 정책망은 단순히 이긴 대국의 수를 따라 하는 대신, 각 상태에서 **탐색이 만든 분포**를 예측하도록 학습한다. 가치망은 해당 상태에서 실제로 누가 이겼는지를 학습한다. 장의 설명대로라면 정책망은 이전 탐색의 결과를 다음 예측에 담고, 새 탐색은 그 예측에서 다시 출발한다.

## 더 나은 교사가 되기 위한 조건

장은 MCTS가 정책망보다 좋은 수를 제시한다는 것은 실전에서 유용한 가정이지 보장이 아니라고 강조한다. 가치망이 종반 상태를 잘못 평가하면 그 값이 탐색 경로를 거슬러 올라가 수의 선택까지 왜곡한다. 탐색 횟수가 적어 충분한 가지를 살피지 못할 수도 있다. 대국을 자주 기권으로 끝내 종반 자료가 부족해지는 상황이 그가 든 사례다.

그래서 그는 먼저 전문가 대국이나 기존 바둑 AI가 둔 대국으로 가치망을 초기화하는 방법을 권한다. 작은 판에서 무작위 대국을 만들어 초기 자료를 얻는 방법도 설명했다. 이는 그의 구현 경험에 따른 제안이다. 과거 대국을 다시 탐색해 학습시키는 실험도 어느 정도 작동했지만, 현재 모델이 도달하지 않을 판에 지나치게 학습하면 모델의 용량을 낭비할 수 있다고 봤다.

## LLM 강화학습과 다른 점

대담은 승리한 대국의 모든 수를 강화하는 방식과 MCTS를 비교한다. 승리에는 결정적인 한 수가 있었더라도, 결과만으로는 어느 수가 기여했는지 가려내기 어렵다. 장은 MCTS가 각 상태에서 수의 학습 목표를 다시 만든다는 점을 차이로 설명한다. 언어모델이 완성된 코드가 시험을 통과했는지 같은 결과로 학습할 때도, 결과에 기여한 단계에 공을 배분하는 문제가 남는다.

그렇다고 바둑의 탐색 규칙을 언어모델에 그대로 옮길 수 있다는 뜻은 아니다. 바둑에는 정해진 합법적 수와 판의 상태가 있고, 대국의 승패로 가치 추정을 확인할 수 있다. 반면 언어의 선택지는 넓고 열린 형태여서 같은 탐색 가지를 다시 방문할 가능성이 낮다. 장은 바둑의 수 선택 규칙인 PUCT가 언어모델의 사고 경로를 찾는 데 적절하지 않을 수 있으며, 언어모델의 추론에 전방 탐색이 어떤 형태로 쓰일지는 아직 결론이 나지 않았다고 말했다.

## 재구현 비용과 연구 자동화의 한계

장은 자신이 공개한 바둑 AI를 강하게 만드는 초기 단계에서 KataGo 모델을 상대로 한 최적 대응 학습을 썼다고 밝혔다. 인터뷰 당시에는 처음부터 자가 대국만으로 학습하는 단계가 성립하는지 검증 중이었다. Prime Intellect에서 받은 약 1만 달러 지원 가운데 약 4천 달러를 탐색적 연구에, 약 3천 달러를 최종 학습 실행에 썼다고 설명했다. 따라서 이 비용을 처음부터 학습한 알파고 제로의 재현 비용으로 볼 수는 없다.

코딩 모델은 장의 실험에서 매개변수를 조정하고, 실험을 실행해 그래프와 보고서를 만드는 데 유용했다. 그러나 그는 공개된 모델들이 다음 실험의 방향을 고르거나, 진행 중인 연구 경로를 버리고 문제를 다시 정의하는 데는 부족했다고 평가했다. 시스템 오류도 스스로 적절한 질문을 던진 뒤에야 찾아낸 경우가 있었다. 바둑은 승패를 비교적 쉽게 확인할 수 있는 연구 환경이지만, 개별 실험의 실패가 아이디어 때문인지 오류 때문인지 판단하는 문제까지 없애지는 못한다.

알파고 재구현에서 드러난 것은 탐색 자체만이 아니라 탐색을 학습 목표로 바꾸는 과정의 중요성이다. 그 과정은 신뢰할 만한 가치 평가와 적절한 학습 상태에 의존한다. 장은 바로 그 조건이 바둑과 언어모델 사이의 핵심적인 차이라고 설명했다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=X_ZVSPcZhtw)
