핵심 요약

  • AI가 국제수학올림피아드 문제를 잘 풀고 단위거리 문제의 추측에 반례를 찾았지만, 분야와 문제 유형에 따라 능력 차이가 크다.
  • 두 사람은 이미 제시된 문제를 푸는 능력 다음으로 좋은 추측과 새로운 개념을 만드는 능력을 주목했다. 그 가치는 정답처럼 즉시 판정하기 어렵다.
  • 수학에서 AI의 빠른 진전에는 답을 검증할 수 있다는 점뿐 아니라 같은 문제를 여러 번 시도할 수 있다는 점도 작용할 수 있다. 이는 파텔의 추정이며, 두 사람은 형식 증명의 역할을 두고도 차이를 논의했다.
  • 증명이 늘어날수록 그것이 왜 성립하는지 이해하고, 어떤 아이디어를 살펴볼지 고르는 일이 중요해진다. 다만 AI가 설명까지 잘하게 되면 인간의 역할도 다시 달라질 수 있다.

올림피아드 성적이 보여준 불균형

수학 교육 채널 3Blue1Brown을 운영하는 그랜트 샌더슨은 AI의 수학 능력을 하나의 점수로 보기 어렵다고 말했다. 그의 설명에 따르면 2024년 국제수학올림피아드에서 AI는 기하 문제를 매우 빠르게 풀었지만 조합론 문제에는 어려움을 겪었다. 그는 그해 조합론 문제가 두 개였으며, 기하 문제가 더 많았다면 금메달 성적에 도달했을 것이라고 평가했다. 이는 실제 수상 결과가 아니라 문제 구성에 관한 가정이다.

드와르케시 파텔은 과거 AI가 올림피아드 금메달 수준에 이르면 인간이 하는 일 전반도 할 수 있지 않겠느냐고 물었다. 샌더슨의 당시 답은 금메달 역시 여러 성능 기준 중 하나가 될 것이라는 것이었다. 이번 대담에서도 두 사람은 수학의 특정 난제를 푸는 능력이 사무직 업무 전반의 자동화를 곧바로 뜻하지는 않는다고 봤다.

문제를 푸는 것과 문제를 만드는 것

대담에서 전환점으로 다룬 사례는 AI가 단위거리 문제에 관한 추측의 반례를 찾은 일이다. 파텔은 이를 기존 지식을 연결해 새로운 발견에 이른 사례로 받아들이면서, 다음에는 무엇을 기준으로 삼아야 할지 물었다. 그가 제시한 후보는 연구할 만한 추측을 만들거나 여러 분야를 묶는 새로운 수학적 대상을 고안하는 능력이다.

샌더슨은 좋은 추측의 가치를 시험 점수처럼 판정하기 어렵다고 지적했다. 어떤 추측이 흥미롭다는 평가는 수학자들의 판단에 달려 있다. 그는 AI가 연구 문제를 정하는 대화에도 도움이 된다고 수학자들이 말하기 시작하는지가 변화의 징후가 될 수 있다고 봤다. 반례 하나를 찾았다는 사실만으로 이런 능력까지 갖췄다고 판단할 수는 없다는 뜻이다.

갈루아의 아이디어는 왜 늦게 인정받았나

샌더슨은 새로운 개념의 가치를 평가하기 어려운 사례로 갈루아의 작업을 들었다. 5차 방정식의 일반적인 풀이 공식이 불가능하다는 증명에는 아벨이 앞섰다. 갈루아가 밀고 나간 생각은 공식 자체보다 그 뒤에 있는 대칭성을 살펴보는 것이었다. 하지만 그의 원고는 생전에 받아들여지지 않았고, 이 생각이 정리되어 현대적인 군론의 모습에 가까워지기까지도 오랜 시간이 걸렸다.

이 사례에서 중요한 것은 갈루아의 작업을 당시의 정답 여부나 즉각적인 활용도로 평가하기 어려웠다는 점이다. 샌더슨은 AI를 정답이 확인되는 문제만 풀도록 훈련할 때, 아직 성과로 입증되지 않은 유망한 관점을 어떻게 알아볼지가 남는다고 말했다. 그는 여러 결과를 더 적은 개념으로 설명하는 능력이 평가의 실마리가 될 수 있다고 제안했지만, 이를 수치화하기 쉽다고 보지는 않았다.

증명과 이해 사이의 거리

두 사람은 AI가 큰 난제를 풀더라도 해법의 형태에 따라 인간의 이해에 주는 효과가 다를 것이라고 봤다. 익숙한 두 분야의 아이디어를 연결한 증명은 연결 지점을 설명할 수 있다. 새로운 이론을 세운 증명은 그 이론을 배우는 시간이 필요하다. 새로운 관점 없이 매우 긴 추론으로 얻은 증명이라면, 참이라는 확인과 별개로 왜 참인지 다시 설명해야 할 수 있다.

샌더슨은 이미 증명된 결과에도 설명되지 않은 문제가 남을 수 있다고 강조했다. AI가 많은 증명을 내놓는다면 정확성 확인에 더해 결과를 이해할 수 있는 형태로 정리하는 작업이 필요하다. 한편 그는 좋은 새 아이디어를 찾는 AI가 그것을 설명하는 일까지 잘할 가능성도 있다고 봤다. 설명이 언제까지 인간 수학자만의 역할로 남을지는 단정하지 않았다.

반복 실험과 형식 증명의 역할

파텔은 수학과 코딩이 AI 훈련에 유리한 이유로 반복 가능한 시도를 들었다. 코드는 같은 출발점의 작업 환경을 복제해 여러 해법을 시험할 수 있다. 반면 웹사이트에서 실제 업무를 수행하거나 사업을 운영하는 일은 같은 상황을 대량으로 재현하기 어렵다. 그는 결과를 검증할 수 있는지뿐 아니라 이런 반복이 가능한지도 진전 속도에 영향을 준다고 추정했다.

두 사람은 Lean 같은 형식 증명 도구의 역할도 구분했다. 파텔은 단위거리 문제의 공개된 풀이 설명에 Lean이 쓰이지 않았다는 점을 들어, 최근 성과 모두를 형식화로 설명할 수는 없다고 말했다. 샌더슨도 자연어 풀이의 진전을 인정하면서, 형식 증명에는 다른 강점이 있다고 답했다. 증명의 각 단계를 기계로 확인할 수 있다면 방대한 결과를 검토하는 수학자가 최소한 정확성은 확인할 수 있다. 그는 AI가 형식화된 수학 지식의 모음인 Mathlib를 계속 확장하는 연구 방식도 상상했지만, 그 결과가 유용할지는 별도의 판단이 필요하다고 했다.

서로 다른 시도와 인간의 선택

두 사람은 AI가 가진 또 다른 가능성으로 여러 접근을 병렬로 시험하는 능력을 꼽았다. 한쪽은 명제를 증명하고 다른 쪽은 반례를 찾게 하거나, 서로 다른 정보와 가정을 준 AI가 같은 문제를 풀게 할 수 있다. 샌더슨은 기존 풀이 방식에 갇혔을 때 출발점을 바꾸는 일이 인간 연구자에게도 어렵다고 설명했다. 다만 어떤 접근을 얼마나 다양하게 시도할지는 여전히 설계해야 할 문제다.

샌더슨은 AI가 증명과 설명을 맡더라도, 수많은 아이디어 가운데 무엇에 관심을 기울일지 고르는 사회적 역할을 인간이 할 수 있다고 봤다. 그는 이를 미술관의 작품을 안내하는 큐레이터에 비유했다. 수학의 경제적 효과에 대해서도 분야별 차이를 강조했다. 물리적 설계와 가까운 수학은 점진적인 개선으로 이어질 수 있지만, 큰 수학적 돌파구가 곧바로 큰 경제적 성과를 낳는다고 예측하지는 않았다.

이 대담은 AI의 수학 성과를 하나의 완주선으로 취급하지 않는다. 이미 제시된 문제의 해답, 새로운 연결과 개념, 증명의 정확성, 인간의 이해는 각각 다른 기준이다. 어느 기준에서 진전이 일어났는지를 구분해야 그 성과가 실제로 무엇을 바꾸었는지도 판단할 수 있다.