핵심 요약
- 시밀리의 출발점인 ‘스몰빌’은 기억·계획·성찰 기능을 갖춘 생성형 에이전트 25명이 작은 마을에서 생활하도록 만든 연구 실험이었다.
- 시밀리는 실제 사람에게서 수집한 인터뷰·설문·행동 데이터를 바탕으로 에이전트를 만들고, 고객이 특정 집단에 관한 질문을 시험할 수 있는 서비스를 제공한다.
- 박준성 창업자는 온라인에서 사람이 말한 내용과 실제 행동 사이의 차이 때문에 대형 언어 모델만으로는 사람을 충분히 재현하기 어렵다고 본다.
- 회사가 제시한 예측 성능과 평가 기준은 특정 연구·측정 방식에 관한 것이다. 여러 사람이 상호작용한 뒤의 결과까지 같은 정확도로 예측한다는 뜻은 아니다.
작은 마을에서 시작한 연구
2023년 스탠퍼드에서 진행한 스몰빌 실험에는 25명의 생성형 에이전트가 등장했다. 각 에이전트에는 인물 설정과 함께 기억, 계획, 성찰 기능이 주어졌다. 이들은 일어나 일과를 보내고, 일하고, 서로 관계를 맺었다. 카페 주인 이사벨라는 밸런타인데이 파티를 준비하며 손님을 초대했고, 다른 에이전트들은 초대를 잊거나 데이트 상대와 함께 카페를 찾았다. 연구진은 이런 상호작용을 통해 개별 행동이 모여 어떤 일이 생기는지 살폈다.
앞선 2022년 연구에서는 온라인 커뮤니티를 여러 가상 인물로 채워 운영 방침에 따른 반응을 시험했다. 피츠버그의 관광지를 논의하도록 설정한 커뮤니티에서는 인물들이 장소를 추천하고 함께 여행을 계획했다. 박준성은 이후의 과제가 단순한 인물 설정을 넘어 시간이 지나도 행동을 이어가는 에이전트를 만들고, 시뮬레이션이 현실을 얼마나 잘 반영하는지 검증하는 일이었다고 설명했다.
실제 사람의 데이터를 다시 모으는 이유
시밀리의 고객은 이해하려는 사람들의 집단을 지정한다. 회사는 갤럽을 비롯한 협력 업체를 통해 실제 사람에게 접근하고, 짧은 시간에 그 사람을 파악하는 데 도움이 될 데이터를 수집한다고 설명했다. 이 데이터로 만든 에이전트를 고객이 여러 질문에 활용하는 방식이다.
박준성이 강조한 문제는 말과 행동의 차이다. 대형 언어 모델의 학습 자료에는 사람들이 온라인에서 밝힌 생각이 많이 들어 있지만, 그것만으로 실제 선택을 알기는 어렵다는 주장이다. 시밀리는 어디서 자랐고 삶에서 어떤 어려운 결정을 내렸는지 묻는 인터뷰와, 짧은 시간에 여러 선택을 확인할 수 있는 설문을 함께 쓴다. 사회과학 및 가격 연구에서 실시한 무작위 대조 실험의 행동 신호를 모델에 반영하는 작업도 진행 중이라고 했다. 고객이 보유한 데이터를 책임 있고 윤리적인 방식으로 활용해 특정 고객 집단에 맞는 모델을 만드는 방안은 논의 단계로 소개했다.
고객이 시험하는 것은 무엇인가
박준성에 따르면 CVS는 약 반년 동안 시밀리와 협력해 왔다. CVS의 담당자는 조사할 수 있는 질문의 수에 한계가 있고, 한 결정이 시장에 미치는 후속 영향을 알아보기 어렵다는 문제에 관심을 보였다고 한다.
현재 고객이 시작하는 대표적인 작업은 새 제품 구상이나 시장에 전할 메시지에 대한 콘셉트 테스트다. 시밀리는 고객이 특정 집단의 반응을 빠르게 물을 수 있다고 설명한다. 박준성은 온라인 광고 실험도 가능하지만, 응답하는 사람이 일부 집단에 치우칠 수 있으며 애초에 조사하려는 사람들에게 접근하기 어려울 수 있다고 지적했다. 대표성 있는 사람을 확보해 데이터를 모으는 일을 시밀리의 핵심 과제로 제시한 이유다.
고객의 관심은 제품을 일정 시간 사용한 뒤의 반응이나 여러 에이전트의 상호작용으로도 넓어진다. 박준성은 실적 발표에 대한 청중 반응을 시뮬레이션해 달라는 요청도 받는다고 했다. 전기차 출시가 기존 비전기차에 대한 인식과 다른 제품군에 어떤 영향을 줄지 살피는 사례는 한 결정의 연쇄 효과를 탐색하려는 구상으로 제시했다. 이런 장기 영향까지 검증됐다고 말하지는 않았다.
예측 성능을 판단하는 기준과 한계
박준성은 미국인 1,000명을 시뮬레이션한 연구에서, 사람들의 행동을 예측하는 성능이 같은 사람들이 자신의 응답을 다시 재현하는 성능의 85% 수준이었다고 말했다. 이는 모든 행동을 85% 정확도로 맞혔다는 뜻이 아니다. 사람도 같은 질문에 매번 조금씩 다르게 답하기 때문에 예측에는 한계가 있다고 덧붙였다.
수량화할 수 있는 질문에는 실제 응답 분포와 시뮬레이션 응답 분포의 차이를 재는 총변동거리(TVD)를 사용한다고 설명했다. 박준성은 이 값이 0.15보다 낮으면 의사결정에 쓸 만한 강한 근거라고 보는 회사의 기준을 제시했다. 여러 에이전트가 오래 상호작용할 때에는 작은 오차가 쌓일 수 있다. 그는 결과가 대체로 한 방향으로 모이는 시뮬레이션과, 초기 차이에 따라 결과가 갈라지는 시뮬레이션을 구분했다. 후자의 경우 같은 실험을 여러 번 돌려 결과가 나타나는 빈도와 가능한 결과의 폭을 살펴야 한다는 설명이다. 어떤 질문이 어느 쪽에 해당하는지 엄밀하게 판별하는 일은 여전히 연구 과제로 남아 있다.
사람을 닮은 모델이라는 목표
박준성은 객관적 답이 있는 기술 문제에 강한 모델과 사람의 가치관·선호·취향의 다양성을 재현하는 모델에는 다른 목표가 필요하다고 본다. 시밀리가 자체 모델을 개발하는 이유도 여기에 있다. 기존의 최첨단 모델은 연구 계획을 세우는 데 활용한다고 설명했다.
그는 더 큰 규모의 시뮬레이션이 금융 위기나 집단행동 같은 사회적 질문을 탐구하는 데 쓰일 가능성도 제시했다. 다만 이는 현재 서비스가 해결한 문제가 아니라 장기적인 연구 방향이다. 시밀리의 당면 과제는 실제 사람의 데이터에 근거한 시뮬레이션을 만들고, 질문의 종류에 맞춰 그 결과가 얼마나 믿을 만한지 검증하는 일이다.
댓글 0
첫 댓글을 남겨 주세요.