핵심 요약

  • OpenAI의 노엄 브라운은 AI 모델을 평가할 때 정답률과 함께 답을 만드는 데 쓴 토큰·비용·시간을 제시해야 한다고 주장했다.
  • 모델을 여러 번 실행해 가장 좋은 답을 고르는 방식은 점수를 높일 수 있지만, 같은 추론 비용에서 더 나은지는 별도로 확인해야 한다.
  • 긴 작업에서 성능이 계속 개선된다면 위험 능력 평가에도 실행 예산과 기간을 명시해야 한다. 다만 더 오래 실행해도 개선되지 않는 과제도 있다.
  • 브라운은 현재 모델이 연구자의 작업을 빠르게 할 수는 있지만, 연구 주제를 판단하고 새로운 알고리즘을 찾는 일까지 온전히 대신하지는 못한다고 봤다.

점수 하나로는 드러나지 않는 차이

테스트 시점 연산은 학습이 끝난 모델이 답을 만드는 동안 쓰는 연산이다. 브라운에 따르면 모델 5.5가 공개됐을 때 일부 벤치마크의 점수는 5.4보다 몇 퍼센트포인트 높은 정도여서 성능 향상에 회의적인 반응이 있었다. 그러나 그는 최대 설정에서 5.4가 답을 내기까지 더 오래 생각하며, 생각하는 시간을 맞춰 비교하면 5.5의 향상이 더 뚜렷하다고 설명했다.

과거 모델은 오래 실행해도 성능 향상이 비교적 빨리 멈췄다. 브라운은 최근 모델은 작업을 이어가도록 적절히 구성하면 일부 벤치마크에서 몇 주 동안 성능이 개선될 수 있다고 말했다. 따라서 성능이 멈추는 지점까지 기다리는 평가가 현실적이지 않은 경우에는 토큰·비용·시간 예산을 정하거나, 사용한 연산량에 따른 성능 변화를 보여줘야 한다는 주장이다.

오래 실행한 결과를 어떻게 평가할까

진행자는 사이버 보안 평가에서 1억 토큰을 쓴 뒤에도 성능 개선이 이어진 사례를 언급했다. 브라운은 전체 실행에 시간이 너무 오래 걸린다면 일정 예산까지 측정한 개선 추세로 더 큰 예산에서의 성능을 추정하는 방법을 연구할 수 있다고 봤다. 다만 적은 비용의 평가만으로 훨씬 큰 비용에서의 성능을 얼마나 잘 예측할 수 있는지는 아직 충분히 연구되지 않았다고 했다.

실사용에서는 기다리는 시간도 중요하다. 브라운은 질문마다 일주일씩 기다리는 방식은 실용적이지 않으며, 빠른 응답이 필요한 때와 긴 사고가 필요한 때에 맞춰 실행 시간을 조절해야 한다고 말했다.

벤치마크 점수를 높이는 여러 방법

한 모델을 한 번 실행하는 대신 다섯 번 실행해 가장 좋은 답을 고르거나 다른 모델에 답을 판정하게 하면 점수가 높아질 수 있다. 브라운이 제기한 문제는 그 방식이 연산량까지 감안해도 더 우수한가다. 그는 공개된 벤치마크에만 맞춰 성능을 높일 위험을 줄이기 위해 비공개 평가 문제를 남겨두는 방법도 제시했다.

브라운은 개인적으로 모델에 포커 프로그램을 만들게 해 성능을 살핀다. 초기 모델은 거의 진전이 없었지만, 5.2와 함께 포커의 마지막 단계인 리버를 계산하는 프로그램을 만들 수 있었다고 했다. 이 과정에는 자신의 지도가 필요했고, 모델이 실제로 주장한 작업을 수행했는지 계속 확인해야 했다. 반면 5.5는 가벼운 지도로 더 큰 범위의 포커 계산 프로그램을 만드는 데 도움이 됐다고 설명했다. 이는 그가 직접 다뤄 온 문제에서 관찰한 변화다.

안전성 평가에도 필요한 예산 기준

브라운에 따르면 연구소의 안전성 평가 체계는 모델이 위험한 능력을 갖췄는지 살피지만, 평가에 투입하는 테스트 시점 연산량은 충분히 반영하지 않는 경우가 많다. 그는 지금은 같은 모델도 10달러를 쓸 때와 1만 달러를 쓸 때 수행할 수 있는 일이 다르다고 말했다. 따라서 위험 능력을 어느 예산에서 평가할지 정해야 한다는 것이다. 그는 이 문제만으로 모델 공개 여부에 결론을 내리지는 않았다.

평가 기간도 과제다. 브라운은 최근 모델을 구성해 몇 주나 몇 달에 걸친 실험을 맡길 수 있다고 봤다. 한 달 실행했을 때 무엇을 할 수 있는지 확실히 알려면 실제로 한 달을 실행해야 한다. 그는 모델 출시 주기가 그보다 짧을 수 있어, 출시 전에 능력의 상한을 충분히 확인하기 어렵다고 지적했다.

연구를 돕는 능력과 남은 한계

브라운은 내부 모델이 수학 문제의 반례를 찾은 사례를 들었다. 이후 공개 모델 5.5도 풀이 방향을 여러 개 제시하게 하고 유망한 방향을 반복해서 탐색하도록 이끌면 같은 결과에 도달할 수 있었다고 말했다. 다만 일반적인 절차로 이를 재현하려면 상당한 비용이 들 것이라는 추정도 덧붙였다. 한 번의 질문으로 결과를 얻은 사례는 아니었다.

더 많은 연산이 모든 과제에 도움이 되는 것도 아니다. 브라운은 모르는 사실을 기억해내는 문제는 오래 생각해도 개선에 한계가 있는 반면, 여러 조합을 시도할 수 있는 스도쿠 같은 문제는 시간을 더 쓰면 나아질 수 있다고 설명했다. 연구에서도 기존 알고리즘의 코드를 빠르게 최적화하는 능력과 더 나은 새 알고리즘을 구상하는 능력은 달랐다. 그는 자신의 포커 알고리즘을 최적화하는 데는 모델이 큰 도움이 됐지만, 긴 시간을 줘도 새로운 알고리즘을 만들어내지는 못했다고 했다.

브라운은 모델이 연구자를 대신해 스스로 더 나은 모델을 만드는 급격한 변화보다는, 현재로서는 연구자의 일부 작업을 가속하고 다른 작업이 병목으로 남는 모습을 설명했다. 여러 모델의 답을 합치는 방식도 개별 모델을 같은 비용만큼 더 오래 실행한 결과와 비교해야 한다는 것이 그의 판단이다.

결국 브라운의 주장은 모델의 성능을 말할 때 무엇을 풀었는지와 함께 얼마나 많은 시간과 연산을 썼는지 밝혀야 한다는 데 모인다. 그 기준은 성능 비교뿐 아니라 위험 능력과 연구 자동화의 한계를 살피는 데도 적용된다.