핵심 요약

  • 차이 디스커버리는 수많은 후보를 실험으로 선별하는 신약 탐색을, 원하는 성질을 지정해 분자를 설계하고 실험실에서 검증하는 과정으로 바꾸려 한다.
  • 공동창업자 조시는 창업 당시 항체 설계의 결합 성공률을 약 0.1%, 자사 Chai 2 모델의 성공률을 약 15%라고 설명했다. 이는 실험실에서 표적에 결합한 비율에 관한 주장이다.
  • 회사는 데이터·모델·연산 규모를 키우면서 구조를 단순하게 유지하는 데 무게를 둔다. 실험 결과의 오차와 여러 표적에서의 재현성도 함께 확인해야 한다고 강조한다.
  • 직접 신약 개발 과정을 운영하기보다 제약사에 분자 설계 도구를 제공한다. 협력사의 검증과 사내 실험에서 얻은 데이터는 다음 모델을 개선하는 데 쓰인다.

발견에서 설계로

차이 디스커버리 공동창업자 조시와 맷은 신약 개발을 소프트웨어 설계처럼 더 빠르게 반복할 수 있는 과정으로 만들고 싶다고 말했다. 기존 탐색에서는 수백만 개에서 수십억 개의 분자를 선별해 작동하는 후보를 찾는다. 이들이 구상하는 방식은 먼저 원하는 분자의 성질을 정하고, 모델이 그 조건에 맞는 후보를 만든 뒤 실험실에서 확인하는 것이다.

실험을 없애겠다는 뜻은 아니다. 조시는 설계의 효율이 높아지면 실험의 가치도 커져 오히려 실험을 더 많이 할 수 있다고 봤다. 후보가 표적에 결합하는지뿐 아니라 제조할 수 있는지도 측정해야 한다. 실험 결과를 얻는 데는 며칠 또는 몇 주가 걸릴 수 있으며, 설계의 출발점이 된 가설이 틀렸다면 모델과 실험을 다시 반복해야 한다.

단백질 예측에서 항체 설계까지

맷은 단백질의 형태를 예측하던 연구가 원하는 형태와 기능을 가진 단백질을 만드는 연구로 이어졌다고 설명했다. 초기에는 단백질을 이루는 아미노산 사이의 거리를 예측해 구조를 구성했다. 이후 주어진 구조에 맞는 아미노산 서열을 설계하는 방향으로 발전했고, 확산 모델을 통해 구조와 서열을 함께 생성할 수 있게 됐다고 말했다. 확산 모델은 흐트러진 대상을 조금씩 바로잡는 단계를 반복해 결과를 만드는 방식이다.

두 창업자가 2024년 창업을 결심한 배경에는 항체 설계의 가능성이 있었다. 당시에는 항체 구조를 예측하기에 데이터가 부족하다는 견해가 있었고, 초기 단백질 설계 연구도 주로 다른 종류의 작은 단백질에 집중했다. 두 사람은 항체의 형태를 예측할 수 있어야 치료 목적의 항체를 설계할 수 있다고 봤다.

결합률이 높아져야 다음 성질을 살필 수 있다

조시의 설명에 따르면 창업 당시 항체 설계에서는 만든 분자 약 1,000개 중 1개가 실험실에서 표적에 결합하는 수준이었다. 성공 후보가 적으면 표적에 따라 결합 분자를 하나도 얻지 못할 수 있고, 후보의 다른 성질을 비교할 자료도 부족하다. 그는 Chai 2의 성공률을 약 15%로 제시하며, 이 수준에서는 1,000개를 시험해 약 150개의 결합 후보를 얻어 성질을 분석하고 모델을 개선할 수 있다고 설명했다.

결합 성공률은 신약의 효능이나 임상 성과를 뜻하지 않는다. 조시가 제시한 다음 과제는 결합 여부를 넘어 제조 가능성 같은 성질을 설계 단계부터 반영하는 것이다. 맷도 특정한 표적을 만났을 때 원하는 결합 특성을 더 정확히 제어하는 일을 앞으로 풀어야 할 기술 과제로 꼽았다.

규모를 키우되 모델과 평가를 단순하게

맷은 Chai 1에 서로 다른 하위 모듈이 약 23개 있었다고 회고했다. 모듈이 많으면 각각의 동작을 이해하고 개선하기 어려워진다. 두 창업자는 특정 표적을 해결하려고 기능을 하나씩 덧붙이는 방식보다, 핵심 구조를 단순화하고 데이터·모델·연산을 확장할 방향을 찾는 방식을 선호한다고 설명했다. 다만 더 큰 모델이 어려운 표적을 해결할 것이라는 기대는 검증이 필요한 연구 가설로 제시했다.

평가에도 주의를 기울인다. 조시는 실험실 측정값의 오차가 클 수 있어 작은 수치 차이를 진전으로 해석해서는 안 된다고 말했다. 일부 과제에서 좋아 보이는 결과가 다른 표적에도 적용되는지 확인해야 제약사가 사용할 도구가 된다. 회사 내부에서도 과학팀, 모델 연구팀, 제품팀이 말하는 ‘어려운 표적’의 뜻이 각각 다르다. 실험에서 작동하지 않는 표적, 구조를 예측하기 어려운 단백질, 사용자에게 복잡한 분자를 표현하기 어려운 문제가 모두 설계 도구의 과제다.

데이터와 제약사 협력이 만드는 반복

모델에 쓰이는 자료로는 실험 연구자들이 축적한 단백질 구조와 대규모 아미노산 서열 데이터가 제시됐다. 맷은 서열을 학습한 모델이 단백질의 입체 구조에 관한 정보도 내부적으로 익힐 수 있다고 설명했다. 구조 예측 모델이 개선되면 서열 데이터에서 새 구조 정보를 얻을 수 있고, 사내 실험에서 나온 결과도 다음 모델을 위한 자료가 된다. 조시는 서열 데이터가 많아도 중복되거나 잡음이 섞여 있을 수 있다고 덧붙였다.

차이 디스커버리는 자체 신약 개발 과정에 자원을 집중하기보다 제약사가 쓰는 분자 설계 도구를 만들기로 했다. 조시는 여러 협력사의 서로 다른 표적에서 모델을 시험해야 소수의 성공 사례만 보고 성능을 과신할 위험을 줄일 수 있다고 설명했다. 제약사는 도입 전에 회사의 주장을 검증하며, 모델이 실제 연구 과정에서 쓸 만한 결과를 내야 협력이 이어진다는 것이다.

차이 디스커버리가 제시한 방향은 후보 분자를 더 의도적으로 설계하고, 실험 결과로 모델을 고치는 과정을 빠르게 반복하는 것이다. 인터뷰에서 제시된 결합률 향상은 그 과정의 한 단계다. 제조 가능성과 다양한 표적에서의 성능, 이후 개발 과정의 결과는 별도로 검증해야 한다.