핵심 요약
- 마크 저커버그는 모든 질병을 치료·예방·관리하는 데 기여하겠다는 목표에 대해, 처음에는 금세기 말까지도 어려울 것으로 봤지만 이제는 그 시한이 지나치게 보수적이라고 생각한다고 말했다. 이는 달성 시점에 대한 확정적 전망은 아니다.
- Biohub의 목표는 질병을 직접 치료하는 것이 아니라, 과학계 전체의 연구 속도를 높일 공통 도구를 만드는 것이다.
- 이를 위해 AI 모델 개발과 실험 생물학을 한 조직의 작업으로 묶었다. 생물학에서는 모델 학습에 필요한 데이터 자체를 얻으려면 새로운 관찰·측정 방법을 개발해야 한다는 판단이다.
- 새 단백질 모델로 11억 개가 넘는 단백질의 구조를 예측하고 단백질 설계 실험도 진행했지만, 분자 설계가 곧 환자 치료를 뜻하지는 않는다.
질병별 해법보다 과학계의 공통 도구
프리실라 챈은 약 10년 전 과학자들과 만나 모든 질병에 대응한다는 목표를 논의했을 때 회의적인 반응을 들었다고 회고했다. 대화를 이어가며 확인한 문제는 연구실 간 단절과 공유 도구의 부족이었다. 한 연구실에서 만든 유용한 도구가 연구자의 컴퓨터에만 남아, 그가 떠나면 함께 사라지는 경우도 있었다.
Biohub는 대학 간 과학자와 엔지니어를 모아 장기간 쓸 도구를 개발하는 방식으로 출발했다. 이후 샌프란시스코에서 뉴욕과 시카고로 활동을 넓혔다. 초기에는 개별 세포의 유전자 발현을 살피는 단일세포 분석 방법의 공유를 지원했고, 인간 세포 아틀라스와 세포 데이터 활용 도구인 cellxgene에도 투자했다. 챈에 따르면 연구자들이 데이터를 추가하면서 이 도구는 관련 모델의 기반 자료로 쓰이게 됐다.
AI만으로 만들 수 없는 생물학 데이터
저커버그는 인터넷에 대량의 자료가 있는 언어 모델과 달리, 생물학 모델에 필요한 데이터 중에는 아직 존재하지 않는 것이 많다고 설명했다. 보이지 않던 현상을 영상으로 관찰하거나, 몸속 세포의 움직임과 염증을 측정할 방법부터 만들어야 한다는 것이다. 그는 뉴욕의 세포 공학과 시카고의 측정 장치 개발을 그런 작업의 사례로 들었다.
연구진은 단백질에서 세포로, 다시 여러 세포가 상호작용하는 체계로 모델을 확장하려 한다. 각 단계는 필요한 데이터와 모델링 방식이 다를 수 있다. 챈은 세포 안에서 분자가 어디에 위치하는지, 세포끼리 어떻게 신호를 주고받는지 살피는 실험이 단계 사이를 연결한다고 설명했다. 목표인 가상 세포는 유전 정보, 유전자 발현, 단백질과 관찰 가능한 세포의 특성을 연결하고, 학습 과정에서 보지 못한 개입의 결과까지 예측할 수 있는 모델이다. 대담에서는 이를 위해 대규모 데이터 생산과 일반화 능력이 여전히 필요하다고 밝혔다.
단백질 모델의 성과와 실험 검증
AI 연구를 이끄는 알렉스 리브스는 새 ESM Fold를 단백질 서열 수십억 개로 학습한 모델로 소개했다. 연구진은 이를 이용해 11억 개가 넘는 단백질의 구조를 예측했다고 밝혔다. 또 모델 내부의 표현을 분석해 이미 알려진 단백질과 정보가 적은 단백질 사이의 관계를 탐색한다. 기계적 해석은 모델이 무엇을 근거로 예측하는지 들여다보려는 접근이며, 그 결과가 새로운 생물학적 지식으로 이어질지는 계속 확인해야 한다.
리브스에 따르면 연구진은 디지털 환경에서 수많은 후보를 탐색한 뒤 약 96개의 단백질을 합성·시험해 나노몰 수준에서 표적에 결합하는 후보를 찾았다. 단백질의 기능과 결합 구조도 실험실에서 확인했다. 그는 항체나 특정 표적 하나만을 위해 만든 모델이 아니라는 점을 강조했다. 다만 이 결과는 분자 설계와 실험 검증의 성과로, 환자에게 쓸 치료법이 완성됐다는 뜻은 아니다.
개방형 연구와 희귀질환의 가능성
저커버그는 모델을 오픈소스로 공개하면 더 많은 과학자가 더 빨리 활용할 수 있다고 봤다. 데이터 생산에는 새로운 과학적 방법과 큰 비용이 들고, 도구 개발에는 10~15년의 시야가 필요하다는 설명도 덧붙였다. 챈은 질병의 종류가 많고 희귀질환은 관심에서 밀리기 쉬워, 여러 연구자가 공통 도구를 활용하는 방식이 중요하다고 말했다. 그는 환자 단체가 등록 자료와 임상 연구에 필요한 자원을 직접 조직하는 사례도 소개했다. 저커버그는 개방을 추진하면서 생물안전 문제를 함께 검토해야 한다고 인정했다.
치료까지 남은 거리
챈이 그리는 최종 목표는 개인의 유전적 특성에서 단백질의 작용, 질병의 발생 과정까지 연결해 이해하고 그 사람에게 맞는 개입을 설계하는 것이다. 그러나 질병마다 그 연결고리에서 밝혀진 부분이 다르다. 어떤 질병에서는 원인이 되는 유전자 변이부터 가려야 하고, 다른 질병에서는 기전을 알아도 단백질 기능을 바꿀 수단이 부족하다.
연구진은 특정 질병의 치료제를 직접 정하기보다 염증이나 면역계처럼 여러 질병과 관련된 체계를 이해하는 데 무게를 둔다. 챈은 모델이 신장 세포 같은 예상 밖의 조직에 약물이 미칠 영향을 사전에 가늠하는 데 도움이 되기를 기대했다. 동시에 연구 성과가 실제 진료로 이어지는 경로는 아직 분명하지 않으며, 임상 연구 방식과 안전한 적용을 더 고민해야 한다고 말했다.
Biohub가 제시한 성과는 단백질 모델과 실험 도구의 진전이다. 모든 질병에 대응하겠다는 목표의 달성 여부는 이 도구들이 세포와 인체의 작동을 얼마나 정확히 설명하고, 임상에서 얼마나 안전하게 검증되는지에 달려 있다.
댓글 0
첫 댓글을 남겨 주세요.