핵심 요약

  • 수노는 처음부터 음악 생성이 가능하다고 확신하지 않았다. 오디오를 이해하는 기술로 출발했지만, 소리를 효율적으로 압축하는 기술적 돌파구를 찾은 뒤 생성으로 방향을 넓혔다.
  • 모델에 음계나 악기 목록을 미리 정해주지 않고 소리 자체를 다룬다. 슐먼은 이런 선택이 예상 밖의 소리를 만드는 데 중요했다고 설명했다.
  • 슐먼에 따르면 하루 이용자의 약 90%가 무언가를 만든다. 수노가 주목하는 경험은 완성된 곡을 듣는 일뿐 아니라 만드는 과정 자체다.
  • 초기에는 음질보다 가사가 있는 완결된 노래를 우선했다. 앞으로는 다른 사람과 함께 만들고 자신의 목소리를 곡에 담는 기능에 집중할 계획이다.

불가능해 보였던 음악 생성

수노의 창업자이자 CEO인 마이키 슐먼은 창업 초기 계산으로는 좋은 음악을 생성하려면 당시 예상한 것보다 훨씬 큰 연산 자원과 모델 역량이 필요해 보였다고 말했다. 소리는 텍스트처럼 분리된 단위로 다루기 어렵다는 판단이었다. 그래서 팀은 처음에 오디오를 만들어내기보다 이해하는 기술을 개발했다.

이후 소리를 효율적으로 압축하는 기술적 돌파구를 찾으면서 음악 생성이 가능하다는 것을 알게 됐다. 초기 결과물의 품질은 낮았다. 디스코드에 공개하기 전에는 약 12.5초짜리 클립을 만들 수 있었고, 요청한 가사를 늘 제대로 따르지도 않았다. 그래도 팀은 만드는 과정이 재미있었고, 디스코드 봇으로 공개해 다른 사람의 반응을 확인했다. 슐먼은 많은 사람이 이를 즐긴 경험이 음악 회사로 나아가는 데 확신을 줬다고 회고했다.

음계를 가르치는 대신 소리를 모델링하다

이용자가 ‘자동차 여행을 주제로 한 1990년대 힙합’을 요청하면 수노는 여러 대규모 언어 모델을 이용해 가사를 만들고, 장르와 스타일에 관한 단서를 확장한다. 그런 다음 자체 모델이 이 정보를 받아 소리를 생성한다. 요청에 여행의 구체적인 이야기가 없다면 가사는 이용자의 의도와 다를 수 있으며, 이후 수정할 수 있다.

슐먼에 따르면 생성 모델에는 보컬과 악기의 구분이나 악기 종류를 미리 알려주지 않는다. 음악 지식을 규칙으로 넣을수록 만들 수 있는 소리가 제한된다고 봤기 때문이다. 그는 서양 음악의 12개 음이나 정해진 악기 목록을 모델에 주는 경우를 예로 들었다. 수노는 대신 초당 4만8,000번 표본을 뽑은 연속적인 음파를 모델링하는 접근을 택했다.

슐먼은 그 결과 서로 어울리지 않을 것 같은 장르의 조합이나 미분음 음악도 나타난다고 설명했다. 다만 모든 장르의 결과가 고른 것은 아니다. 그의 평가로는 컨트리와 팝에서 좋은 결과가 잘 나오지만, 다른 장르에서는 만족스러운 결과를 찾기까지 더 많이 생성해야 할 수 있다.

모델 평가와 이용자 취향은 다르다

슐먼은 음악 모델의 발전이 단순히 크기를 키우는 문제는 아니라고 말했다. 음악에는 하나의 정답이 없고 사람마다 선호하는 곡도 다르기 때문이다. 작은 모델은 곡을 더 빨리 전달할 수 있다는 제품상의 이점도 있다.

그는 테스트에서 한 모델이 다른 모델보다 10~15% 더 선호된다고 해도, 출시 후 이용자의 사용량이나 제품 성장에 비슷한 차이가 나타나는 것은 아니라고 설명했다. 수노는 이용자의 선호 데이터를 모델 조정에 쓰며, 그 데이터가 새로운 연구 방법을 개발하는 데도 도움이 된다고 본다. 모델 버전의 공개 시점 역시 모든 연구를 끝낸 뒤 정하기보다 일정한 출시 흐름 속에서 구분한다고 말했다.

듣는 사람에서 만드는 사람으로

슐먼은 음악이 사람들 사이의 경험이라는 점에 동의하면서도, 수노에서 핵심은 생성 자체가 즐거운 활동이 된다는 데 있다고 말했다. 그에 따르면 하루 이용자의 약 90%는 무언가를 만든다. 많은 이용자가 만든 곡을 다른 곳에 가져가 쓰려는 목적 없이 창작의 즐거움 때문에 음악을 만든다는 것이 그의 설명이다.

그는 다섯 살 자녀와 함께 만든 두 곡을 예로 들었다. 다른 사람 대부분에게는 관심 없는 노래일 수 있어도 당사자에게는 의미가 있다. 이 사례는 생성된 곡의 가치가 대중적인 인기로만 결정되지 않는다는 그의 관점을 보여준다. 동시에 슐먼은 수노로 만든 곡이 차트에 오르거나 제작자가 음반 계약을 맺은 사례도 있다고 말했다. 오랫동안 시를 써온 한 창작자가 자신의 시를 음악으로 만들며 새로운 청중을 만난 사례를 특히 인상 깊게 꼽았다. 전문 음악가에게도 수노는 작업 전체를 대신하기보다 일부에 쓰이는 도구라고 설명했다.

제품 선택이 모델 선택을 이끌었다

수노는 2023년 말 디스코드에서 웹 앱으로 옮겼다. 슐먼은 이용자가 디스코드에 더 오래 머물 것으로 예상했지만, 기능이 충분하지 않은 초기 웹 앱을 내놓은 뒤 닷새 만에 트래픽의 90%가 웹으로 이동했다고 말했다.

초기 제품에서는 배경음악보다 가사가 있는 노래, 짧은 음원보다 처음부터 끝까지 이어지는 곡을 우선했다. 슐먼은 노래가 이야기를 전달하고 사람의 목소리가 듣는 이에게 더 강하게 닿는다고 판단했다. 당시 짧은 음원을 만드는 기술보다 음질이 떨어지는 대가를 치렀지만, 완결된 곡을 만들기 위해 자기회귀 방식의 생성 기술을 선택했다는 설명이다.

슐먼은 모델만으로 경쟁력을 오래 유지할 수 있을지 불확실하다고도 말했다. 그래서 소비자가 재미를 위해 쓰고 직접 비용을 지불하는 제품일수록 사용 경험에 더 투자해야 한다고 본다.

협력과 다음 제품 구상

워너와의 합의·협력에 관한 질문에 슐먼은 기존 음반업계와 함께 새로운 경험을 만들고 싶다고 답했다. 그가 제시한 방향은 팬이 좋아하는 아티스트와 음악을 통해 상호작용하는 제품이다. 이는 협력의 구상이지, 대담에서 구체적인 제품 출시가 확인된 것은 아니다.

수노가 앞으로 집중할 영역으로는 함께 곡을 만들고 주고받는 기능과 자기표현을 꼽았다. 슐먼은 곡 자체보다 다른 사람이 변형할 수 있는 틀을 공유하는 방식도 예로 들었다. 최근 출시한 자신의 목소리를 곡에 사용하는 기능 역시 그 방향에 있다. 관객이 아티스트와 함께 음악을 만드는 공연을 보고 싶다는 바람도 밝혔지만, 이를 확정된 행사로 제시하지는 않았다. 음악을 배경에 머물게 하기보다 사람들이 직접 참여하는 경험으로 만들겠다는 구상이다.