핵심 요약

  • 리슨랩스는 AI가 인터뷰 질문을 구성하고 고객과 대화한 뒤 응답을 분석하는 고객 조사 플랫폼이다.
  • 창업자 알프레드 발포르스는 인터뷰 속도만큼 누구에게 묻는가가 중요하다고 강조했다.
  • 발포르스에 따르면 같은 사람에게 다시 물었을 때 객관식 설문보다 AI 인터뷰의 답변이 더 일관됐다. 다만 답변의 일관성이 실제 구매 행동까지 입증하는 것은 아니다.
  • 리슨랩스는 실제 인터뷰를 바탕으로 고객 응답을 예측하는 기능을 개발하고 있다. 발포르스는 중요한 결정에는 여전히 실제 사람의 의견이 필요하다고 봤다.

인터뷰의 비용과 시간을 줄이다

리슨랩스는 고객 조사를 위한 AI 인터뷰 플랫폼이다. 기업이 조사 주제를 입력하면 AI가 인터뷰 가이드를 만들고, 참가자를 찾아 음성·영상으로 대화한 뒤 응답을 분석한다. 발포르스는 플랫폼에 3,000만 명의 참가자가 있으며, 수백 건의 인터뷰를 진행할 수 있다고 설명했다. 인터뷰 결과의 각 데이터는 해당 영상이나 발언으로 돌아가 확인할 수 있도록 설계했다고 말했다.

이 제품의 출발점은 창업팀 자신의 문제였다. 발포르스와 공동창업자가 만든 AI 아바타 소비자 앱에는 하룻밤 사이 2만 명의 사용자가 모였지만 이탈도 많았다. 이들은 사용자가 왜 떠나는지, 제품을 어떻게 받아들이는지 알아보기 위해 AI 인터뷰 도구를 만들었다.

발포르스는 기존 시장 조사에서 질문 설계, 참가자 모집, 수많은 통화의 분석에 상당한 수고가 든다고 설명했다. 리슨랩스에서는 실제 참가자의 응답을 5분 안에 받기 시작할 수 있다고 주장했다. 참가자가 정해진 시간에 조사자와 만나지 않아도 되는 비동기 방식은 비용을 낮추는 요인으로 꼽았다.

응답과 실제 행동 사이의 간격

진행자는 설문에 답하고 돈을 받는 사람에게는 표본 편향이 생길 수 있고, 말로 밝힌 의향이 실제 행동과 다를 수 있다고 지적했다. 발포르스도 A/B 테스트가 유용한 검증 방법이지만 충분히 많은 사용자가 필요해 실행이 어렵다고 답했다.

발포르스에 따르면 리슨랩스가 같은 사람에게 객관식 질문을 다시 했을 때 답은 크게 달라졌다. 반면 이유를 생각해 설명해야 하는 AI 인터뷰에서는 같은 질문에 대한 답이 더 일관됐다. 회사는 의류 브랜드 처비스의 셔츠를 조사한 뒤 몇 달 후 실제 판매 데이터와 결과를 비교한다고도 했다. 영상 인터뷰에서는 표정과 말투를 함께 살피며, 광고에 열정적으로 반응한 경우 실제 광고 성과도 더 좋았다는 것이 그의 설명이다. 이는 발포르스가 제시한 회사의 관찰이며, 모든 응답이 행동을 정확히 예측한다는 뜻은 아니다.

처비스 사례는 인터뷰가 찾을 수 있는 구체적 문제를 보여준다. 발포르스에 따르면 일부 셔츠 소재가 가슴 털과 맞닿을 때 불편하다는 점을 조사에서 발견했고, 처비스는 셔츠를 바꿨다. 그는 맨스케이프드가 리슨랩스의 조사 결과를 반영해 슈퍼볼 광고를 수정한 사례도 들었다.

조사 대상 선정이 결과를 바꾼다

발포르스는 제품의 핵심 고객을 정확히 찾는 데 엔지니어링 자원의 80%를 쓴다고 말했다. 기존 고객 관계 관리 시스템(CRM)에 연결해 고객에게 인터뷰를 보낼 수도 있지만, 아직 고객이 아닌 사람을 찾아 기존 고객과 비교하는 일이 특히 중요하다고 설명했다.

참가자를 무작정 많이 모으면 적합한 사람을 골라내는 절차가 길어진다. 발포르스는 지원자 10명 중 1명만 인터뷰 자격을 얻는 경우를 예로 들었다. 여러 인터뷰에서 드러난 관심사와 전문성을 참가자 프로필에 축적하면, 다음 조사에서 맞는 사람을 찾기 쉬워진다는 것이 회사의 구상이다. 그는 참가자 규모를 10억 명으로 키우는 것을 목표로 제시했으며, 이는 현재 규모가 아니다.

실제 인터뷰를 바탕으로 한 시뮬레이션

리슨랩스는 한 사람의 인터뷰 내용을 바탕으로 그 사람이 이후 질문에 어떻게 답할지 예측하는 기능을 개발 중이다. 발포르스는 특정 질문에서는 예측 정확도가 95%에 이른다고 주장했지만, 어떤 질문에 적용되는지에 따라 결과는 달라진다. 그가 유용한 용도로 꼽은 것은 광고 문구나 발표 제목 같은 메시지 테스트다.

발포르스는 고객 집단을 모델링한 시뮬레이션에 발표 제목 후보 100개를 넣어 본 경험을 소개했다. 가장 높은 평가를 받은 제목이 다음 후보보다 약 두 배 높은 점수를 받았지만, 그는 그 결과가 맞는지는 알 수 없다고 인정했다. 다른 발표 사례를 비교했을 때는 일반 ChatGPT보다 자사 시뮬레이션이 실제 성과에 맞는 선택을 했다고 말했다. 이 역시 그가 소개한 초기 사례다.

그는 신용카드 지출과 구매 행동 데이터도 시험했지만, 질문을 따라가며 이유와 행동을 물을 수 있는 인터뷰가 가장 유용했다고 설명했다. 동시에 아무 인터뷰나 충분한 것은 아니며 질문 설계가 중요하다고 강조했다. 리슨랩스는 중대한 광고 결정에는 실제 사람을 인터뷰하고, 상대적으로 작은 문구 선택에는 시뮬레이션을 쓰는 방식을 예상한다. 사람들 사이의 상호작용까지 모의하는 방식에는 예측이 어려워질 수 있다며 신중한 태도를 보였다.

인터뷰 품질도 계속 검증해야 한다

발포르스는 초기 제품에서 일반 언어 모델로 인터뷰를 만들었을 때 고객이 활용하기 어려운 데이터를 받았다고 말했다. 질문을 반복하지 않고 지시를 따르는지 평가하는 내부 지표도 처음에는 약 20%였으며, 개선 후 85%까지 올랐다고 했다. 화면 녹화 내용을 이해하고 불필요해진 질문을 건너뛰는지 확인하는 더 어려운 평가를 도입하자 다시 약 20%가 됐다고 설명했다.

리슨랩스는 고객 이탈 인터뷰에서 버그가 발견되면 코딩 AI에 연결해 해결하도록 하는 사례도 보고 있다. 다만 발포르스가 확신하는 것은 AI만으로 고객 조사를 끝낼 수 있다는 전망이 아니다. 그는 사람의 선호가 예기치 않게 바뀔 수 있어 앞으로도 실제 고객의 의견이 필요하며, 시뮬레이션이 사람의 행동을 어디까지 예측할지는 아직 불확실하다고 말했다.