# 피리어딕 랩스가 실험 데이터를 AI와 연결하는 방법

> 2026-04-03 · No Priors · 큐레이션 김태우
> https://challengekim.com/insights/피리어딕-랩스가-실험-데이터를-ai와-연결하는-방법
> 원문: https://www.youtube.com/watch?v=Oru2Jxr1xHU

## 핵심 요약

- 피리어딕 랩스는 AI가 소재와 화학 연구에 쓰이려면 실제 실험에서 얻은 데이터와 연결돼야 한다고 본다.
- 문헌에 보고된 물성값은 서로 크게 다를 수 있다. 실험은 모델의 판단을 현실에 맞춰 검증하는 수단이다.
- 회사는 언어모델로 문헌·실험 데이터를 살피고 실험을 조율하면서, 원자계에 맞춘 별도 신경망도 도구로 사용한다.
- 데이터가 풍부한 영역에서 가장 큰 내부 진전을 봤지만, 한 물리 영역에서 얻은 성능이 다른 영역으로 그대로 옮겨가지는 않는다.

## 언어모델에서 물리 세계로

피리어딕 랩스 공동창업자 리엄 페더스는 학부에서 물리학을 공부하고 암흑물질 연구에 참여했다. 이후 입자 재구성 문제를 다루며 머신러닝으로 관심을 옮겼고, 구글 브레인과 오픈AI에서 일했다. 오픈AI에서는 사전 학습된 GPT-4를 제품으로 만드는 과정에 참여했다. 당시 여러 제품 구상이 있었지만, 범용 챗봇을 만들자는 방향이 채택됐다고 설명했다.

그가 다시 물리 세계로 관심을 돌린 이유는 과학 연구가 사고만으로 진행되지 않기 때문이다. 페더스는 실험을 하고 결과에서 배워야 한다고 강조했다. 그의 판단으로는 2022년 말의 AI 기술만으로 피리어딕 랩스가 구상한 작업을 수행하기 어려웠다. 이후 모델의 추론, 오류 수정, 도구 사용 능력이 좋아지면서 물리 세계와 연결할 기반이 생겼다는 설명이다.

## 문헌 데이터가 답하지 못하는 것

피리어딕 랩스는 공개 모델이 학습한 논문과 인터넷 자료에서 출발한다. 따라서 언어를 이해하거나 코드를 작성하는 능력을 처음부터 다시 만들 필요는 없다. 페더스에 따르면 회사는 코딩 모델 자체의 개선에 자원을 쓰기보다 기존 모델이 충분하지 않은 발견 분야에 머신러닝 역량을 집중한다.

하지만 문헌에 있는 값이 곧 확실한 측정값은 아니다. 페더스는 팀의 한 엔지니어가 특정 소재의 보고된 물성값을 살펴봤을 때, 문헌에서 추출한 수치가 여러 자릿수에 걸쳐 퍼져 있었다고 말했다. 그런 값만으로 모델을 학습시키면 보고된 값들의 분포는 익힐 수 있어도 어느 값이 현실에 가까운지는 알기 어렵다. 이때 직접 얻은 실험 데이터가 판단의 기준이 된다.

핵심은 데이터를 쌓는 데서 끝나지 않는 **실험과 분석의 반복 과정**이다. 연구자는 결과에서 이상치와 패턴을 찾고, 시뮬레이션 및 문헌과 맞는지 살핀 뒤 다음 실험을 정한다. 페더스는 특정 영역에 데이터가 풍부할 때 회사 내부에서 가장 큰 진전을 봤다고 했다. 다만 양자역학적 효과가 강한 계에서 얻은 일반화 능력이 유체역학처럼 다른 수준의 문제에 큰 도움을 주지는 않는다고 선을 그었다.

## 언어모델과 특화 모델의 역할

페더스의 설명에서 언어모델은 연구 전체를 조율하는 층에 가깝다. 문헌과 실험 데이터를 읽고 여러 형태의 정보를 다루며 실험 방향을 정하는 데 쓰인다. 여기에 피리어딕 랩스는 원자계의 대칭성을 고려해 설계한 별도 신경망을 결합한다. 이 모델들은 지연 시간이 더 짧고 특정 용도에 맞게 조정돼 있으며, 전체 시스템에서 도구나 평가 기준으로 사용될 수 있다.

회사는 먼저 자사 과학자들을 첫 사용자로 삼아 연구 방식을 시험했다. 페더스는 소재·공정 공학 때문에 어려움을 겪는 기업에서도 엔지니어가 데이터의 이상치를 찾고, 장비 문제를 진단하고, 더 나은 배합을 찾는 데 이 접근법을 쓸 수 있다고 본다. 사업 형태는 우선 기업의 실험과 문제 해결을 돕는 소프트웨어로 생각하고 있다. 발견한 소재 자체의 가치가 큰 경우 다른 사업 형태도 가능하다고 언급했지만, 이를 현재의 사업으로 제시하지는 않았다.

## 자동화가 실험량을 늘릴 때

페더스는 더 많고 품질 높으며 다양한 실험 데이터를 얻는 것이 목표라고 말했다. 이를 위해 사람과 자동화 장치를 함께 사용한다. 현재 쓰는 로봇 장치는 비교적 단순한 기성 제품에 가깝고, 회사가 로봇 기술 자체를 크게 개선하는 데 집중하고 있지는 않다. 그에 따르면 지금의 혼합 방식으로도 신뢰할 만한 데이터를 대량 생산할 수 있다.

더 범용적인 로봇이 비정형 실험실에서 지시를 안정적으로 수행할 수 있다면 실험실을 새로 구축하고 운영하는 속도를 높일 수 있다. 그러나 페더스는 그런 로봇이 실험과 학습의 반복 과정을 만드는 데 필수 조건은 아니라고 했다. 현재의 물리적 자동화는 세심한 설계가 필요하고 구축에도 시간이 걸린다.

그는 자동화만 늘면 연구자가 쏟아지는 데이터를 해석하는 일이 병목이 될 수 있다고도 봤다. 실험 규모를 키우려면 데이터를 만드는 장치와 그 결과를 이해해 다음 실험에 반영할 지능형 시스템이 함께 필요하다는 주장이다. 자본 측면에서는 물리적 설비의 긴 구축 기간과 안정적인 운영의 어려움을 인정하면서도, 회사의 주된 비용은 컴퓨팅이라고 설명했다.

## 분야마다 다른 AI의 한계

페더스는 AI의 능력을 하나의 점수로 보기 어렵다고 말했다. 어떤 수학 문제에서 뛰어난 시스템도 질문을 조금 바꾸면 성능이 크게 떨어질 수 있다는 것이다. 소프트웨어 개발은 방대한 데이터가 있고 단위 테스트처럼 결과를 빠르고 저렴하게 확인할 수 있어 AI가 개선에 참여하기 좋은 분야로 꼽았다. 하지만 코드 저장소를 작성하고 버그를 고치는 능력이 곧 생물학을 이해하는 능력으로 이어지지는 않는다.

AI 연구의 평가 과정도 코드 테스트보다는 느리다. 모델이 수렴했는지, 규모를 키웠을 때 어떤 특성을 보이는지, 다른 문제에도 적용되는지를 확인하려면 GPU와 긴 실험 시간이 필요하다. 물리 과학에서는 실제 실험까지 포함한 반복 과정이 필요하다는 것이 피리어딕 랩스의 전제다.

피리어딕 랩스가 제시한 방향은 AI의 제안을 실험으로 확인하고, 그 결과로 다음 실험을 정하는 연구 체계다. 페더스는 데이터가 충분한 영역에서 진전을 봤다고 설명하면서도, 물리 영역 사이의 일반화와 실험 자동화에는 뚜렷한 한계가 있음을 함께 인정했다.

---

원문을 바탕으로 AI 가 한국어로 요약·재구성한 글입니다. 인용·수치는 원문 링크에서 확인해 주세요. [원문 링크](https://www.youtube.com/watch?v=Oru2Jxr1xHU)
