핵심 요약
- Anthropic을 떠난 연구자는 AI 개발이 인류를 위험에 빠뜨릴 수 있다고 주장했다. Anthropic의 안전 연구 책임자도 향후 10년 안에 인류가 멸종할 가능성을 개인적으로 10% 넘게 본다고 밝혔다.
- 패널은 그 주장을 뒷받침할 새로운 내부 자료가 공개됐는지 따졌다. 위험의 크기와 대응 방식에 대해서도 의견이 갈렸다.
- 논쟁의 핵심에는 AI가 인간 연구자 없이 다음 모델을 반복해서 개발할 수 있는지, 그리고 그 과정에 인간의 승인 단계를 둘 수 있는지가 있었다.
- OpenAI의 수학 연구를 둘러싼 대화는 성과의 해석과 별개로, 이용자의 연구 과정이 AI 서비스에 남아 다른 개발에 활용될 수 있는지로 이어졌다.
멸종 위험 주장과 공개된 근거
진행자는 OpenAI와 Anthropic에서 일한 뒤 Anthropic을 떠난 연구자의 게시물을 소개했다. 연구자는 AI를 만드는 사람들 가운데 AI가 10년 안에 인류를 죽일 수 있다고 진지하게 믿는 이들이 있으며, 기업들이 스스로 개선하는 초지능을 향해 경쟁하고 있다고 주장했다. Anthropic에서 안전 연구를 이끄는 인물은 이 주장에 동의하며 자신의 위험 추정치를 제시했다. 그는 AI의 목표와 행동을 인간의 의도에 맞추는 정렬 문제를 해결할 계획이 아직 없다고도 했다.
패널의 반론은 공개된 증거에 집중됐다. 데이비드 색스는 퇴사자가 일반에 알려지지 않았던 보고서나 데이터를 제시하지 않았다고 지적했다. 그는 게시물의 확산이 조직적으로 이뤄졌다고 의심했지만, 대화에서 제시한 정황만으로 그 의혹이 입증된 것은 아니다. 이 논쟁은 위험을 단정하거나 일축하기보다, 제시된 추정과 확인 가능한 근거를 구분해야 한다는 문제를 드러냈다.
스스로 다음 모델을 만드는 AI는 가능한가
패널이 짚은 핵심 위험 시나리오는 재귀적 자기 개선이었다. AI가 연구자의 일을 완전히 대신해 다음 모델의 학습을 설계하고 실행하며, 새 모델이 다시 그다음 모델을 만드는 과정이다. 이를 주장하는 쪽은 인간이 개발 과정에서 빠질 수 있다고 우려한다.
색스는 연구자가 AI로 코드 작성 같은 업무 일부를 빠르게 처리하는 단계와, 인간의 승인 없이 학습을 계속 실행하는 단계를 구분했다. 패널 일부는 현재의 AI가 일상적인 작업에서도 인간의 판단을 필요로 한다며 후자의 단계에 이르렀다는 판단에 반대했다. 인간이 실행을 승인하도록 소프트웨어에 단계를 둘 수 있다는 의견도 나왔다. 이는 위험이 사라졌다는 증명이 아니라, 논의에서 제시된 통제 방법이다.
안전 규제가 오픈소스에 미칠 영향
규제를 둘러싼 대화에서는 모델을 공개한 뒤에도 중앙에서 감시하거나 되돌릴 수 있어야 한다는 기준이 쟁점이 됐다. 색스는 공개된 모델의 가중치가 퍼지고 나면 이를 회수하기 어렵기 때문에, 그런 기준을 일률적으로 적용하면 오픈소스 모델의 공개가 막힐 수 있다고 주장했다.
다른 패널은 AI 안전성 시험과 보호 장치 자체는 필요하다고 인정하면서도, 개발 허가 권한이 한곳에 집중될 가능성을 우려했다. 반면 재귀적 자기 개선의 위험을 제기한 쪽은 개발 속도에 대한 주의를 요구한다. 대화에서 규제가 실제로 도입됐거나 오픈소스 공개가 금지됐다는 사실이 제시된 것은 아니다.
수학 연구가 던진 성과 해석의 문제
후반부에는 OpenAI가 오래된 유체 역학 관련 수학 문제의 해법을 발표했다는 내용이 소개됐다. 패널은 발표된 작업에 많은 AI 에이전트와 출력 토큰이 쓰였다고 설명했다. 데이비드 프리드버그는 이를 AI가 인간이 이해할 수 없는 통찰을 얻은 사례로 보기보다, 여러 시스템이 계산과 검토를 대량으로 수행해 연구자의 작업을 압축한 사례로 해석했다. 대화에 등장한 인간 노동 시간 환산치는 그의 거친 추정으로, 검증된 측정값으로 제시되지는 않았다.
성과의 출처를 둘러싼 의혹도 제기됐다. 먼저 문제를 연구하던 이용자들의 작업이 OpenAI 모델에 영향을 줬을 수 있다는 주장이다. 대화에서 소개된 OpenAI의 설명은 이용자 사용 기록에서 개인 식별 요소를 제거한 데이터가 모델 개선에 기여했을 가능성을 배제할 수 없다는 것이었다. 이것이 특정 연구자의 작업을 누군가 직접 열람하거나 가져갔다는 뜻은 아니다. 색스 역시 그런 직접 열람에는 회의적이었다.
기업이 AI에 맡긴 지식은 어디에 남는가
프리드버그는 이름과 회사 정보를 지워도 문제를 푸는 접근법 자체가 기업의 지식재산일 수 있다고 지적했다. 그는 자신의 과거 대화에서 다룬 아이디어와 비슷한 답을 뒤에 다른 계정으로 받았다는 경험을 소개했지만, 그것만으로 앞선 대화가 학습에 사용됐다고 확인된 것은 아니다.
패널은 민감한 연구 자료를 다루는 기업이라면 데이터 보존 조건과 모델 운영 방식을 따져야 한다고 말했다. 프리드버그는 기업이 통제하는 별도 환경에서 모델을 운영하는 방안을 언급했다. 동시에 단순히 개인 장비에서 모델을 실행하는 것만으로 여러 사람이 함께 쓰는 업무 환경의 요구를 충족하기는 어렵다고 덧붙였다.
이번 대화는 AI의 장기 위험을 둘러싼 주장과 당장 서비스를 쓰는 조직의 데이터 문제를 함께 다뤘다. 두 쟁점 모두 추정과 공개된 사실의 경계를 확인해야 한다는 점에서 맞닿아 있다.
댓글 0
첫 댓글을 남겨 주세요.