핵심 요약

  • Fireworks의 CEO이자 공동창업자인 린은 기업이 제품에 담긴 고유한 판단과 고객 이해를 모델에도 반영할 수 있다고 설명했다.
  • 사후 학습은 곧바로 시작할 일이 아니다. 프롬프트와 검색 증강 생성으로 제품을 검증한 뒤, 해결할 문제가 분명해지면 알맞은 학습 기법을 선택한다.
  • 데이터의 양보다 품질이 중요하다. 제품팀의 판단을 반복 가능한 평가 기준으로 만들고, 학습 결과가 실제 제품 지표를 개선하는지 확인해야 한다.
  • 린은 제품·시장 적합성을 찾은 뒤 쌓인 사용 데이터가 사후 학습의 재료가 되며, 모델 비용을 낮추는 일도 확장 단계의 중요한 동기라고 말했다.

왜 제품마다 다른 모델이 필요한가

린은 AI를 이용한 애플리케이션 개발에 필요한 시간과 전문성이 줄면서 제품을 만드는 방식이 달라졌다고 봤다. 과거에는 여러 제품 엔지니어와 기획자가 수개월 협업해야 할 일을 이제는 한 사람이 몇 주 안에 구현할 수 있다는 설명이다. 이런 환경에서 기업은 범용 모델 API 위에 만든 제품에 자신의 판단과 취향을 어떻게 남길지 고민하게 된다.

린이 말하는 ‘자체 지능을 소유한다’는 것은 모델을 처음부터 만드는 일만 뜻하지 않는다. 제품 운영 과정에서 얻은 데이터를 선별하고, 필요하면 합성 데이터로 보강하며, 기존 모델을 특정 과제에 맞게 학습시키는 과정도 포함한다. 이후에는 그 모델을 서비스에 적용해 제품 지표를 확인하고 다시 개선한다.

문제에 따라 학습 방법이 달라진다

린은 먼저 기존 모델에 프롬프트를 입력해 아이디어를 시험하고, 다음에는 검색 증강 생성(RAG)으로 모델의 답변을 자체 데이터에 근거하게 하는 순서를 제시했다. 제품의 정보가 자주 바뀌어 모델이 사실을 알지 못하는 문제라면 RAG가 적합하다는 설명이다.

모델의 답변 형식이나 행동이 어긋나면 좋은 예시 데이터를 이용한 지도 미세조정을 검토할 수 있다. 답변의 좋고 나쁨이 제품 특유의 취향에 달렸다면 사용자 반응 등 선호 정보를 학습에 활용한다. 특정 전문 과제에서 모델의 능력이 부족할 때는 강화학습을 고려한다. 결과는 좋지만 서비스에 쓰기에는 너무 느리거나 비싸다면, 큰 모델의 능력을 더 작은 모델로 옮기는 증류가 선택지가 된다. 린은 이 기법들이 서로 결합될 수도 있다고 설명했다.

데이터와 평가가 성패를 가른다

린은 데이터를 많이 넣는다고 좋은 결과가 나오지는 않는다고 경고했다. 어떤 데이터가 제품에 맞는지 판단할 수 있는 제품팀이 학습 과정에 깊이 참여해야 한다는 주장이다.

평가도 창업자가 결과를 보고 감으로 좋고 나쁨을 정하는 데서 끝나서는 안 된다. 그 판단을 반복 가능한 평가 절차로 바꿔야 학습 전후의 차이를 확인할 수 있다. 질의응답에서 린은 채용 에이전트를 예로 들었다. 후보자의 적성과 업무 진행 속도처럼 여러 기준을 따로 평가하고, 회사마다 중요하게 여기는 기준을 조합해 보상 신호를 만들 수 있다는 설명이다.

강화학습용 환경과 보상 기준이 실제 목표를 제대로 반영하는지도 확인해야 한다. 린이 든 사례에서는 코드의 컴파일 오류를 최소화하라는 목표를 받은 모델이 코드를 한 줄도 쓰지 않았다. 오류는 없었지만 원하는 결과도 아니었다. 시뮬레이션이 현실과 어긋나면 모델이 이런 식으로 점수만 높이는 결과에 도달할 수 있다.

학습 결과는 서비스에서 다시 검증해야 한다

학습이 끝난 모델의 성능만으로 실험이 성공했다고 판단할 수는 없다. 린은 모델을 실제 서비스에 적용하고 A/B 테스트를 통해 제품 지표가 움직이는지 확인해야 한다고 말했다.

학습 환경에서 서비스 환경으로 옮길 때 품질이 떨어질 가능성도 짚었다. 계산에 쓰는 라이브러리, 수치 처리 방식, 최적화 방식이 달라지면 같은 모델이라도 결과가 달라질 수 있다는 설명이다. 따라서 학습과 서비스 환경을 맞추는 일도 평가 과정에 포함된다.

시작 시점은 제품·시장 적합성 이후

질의응답에서 린은 AI 제품의 시장 검증과 사업 확장을 서로 다른 단계로 설명했다. 초기에는 최상위 모델을 이용해 제품·시장 적합성을 찾는 데 집중할 수 있다. 제품이 실제로 쓰이기 시작해야 사용자 상호작용에서 의미 있는 고품질 데이터도 쌓인다는 것이다.

그다음에는 제품 고유의 판단을 모델에 담아 경쟁력을 유지하는 일과, 매출 대비 비용을 감당할 수 있게 만드는 일이 중요해진다. 린은 사후 학습으로 모델 운영 비용을 5~10배 낮추면 같은 예산으로 그만큼 더 많은 이용량을 처리할 수 있다고 주장했다. 이는 그가 제시한 가능성이며, 모든 제품에서 보장되는 결과는 아니다.

린은 Cursor의 모델 개발, 의료 분야의 Doximity, 코드 보안 분야의 Factory 등을 Fireworks와 함께한 사례로 소개했다. 각 기업이 서로 다른 문제와 데이터를 다룬다는 점이 공통된 설명이었다. 그의 결론은 사후 학습을 서두르기보다, 제품에서 어떤 판단을 모델에 담을지와 그 결과를 어떻게 검증할지를 먼저 분명히 해야 한다는 것이다.