핵심 요약
- 피지컬 인텔리전스의 목표는 특정 로봇 하나가 아니라 다양한 몸체와 작업에 적용할 수 있는 로봇 기초 모델을 만드는 것이다.
- 연구진은 텍스트·이미지·로봇 동작 데이터로 학습한 모델에 상황 판단과 반복 연습을 결합하고 있다.
- 레빈에 따르면 낯선 주방을 청소하는 실험에서는 로봇 조작 데이터를 더하지 않고도 행동에 대한 언어 지시를 붙여 일반화 성능을 높였다.
- 로봇이 실제 환경에서 유용하게 일하며 데이터를 모으기까지의 시점은 불확실하다. 안전성과 이용자의 수용 수준도 배치 장소에 따라 다르다.
한 가지 작업보다 여러 몸체와 작업을 겨냥하는 이유
피지컬 인텔리전스 공동창업자 세르게이 레빈은 다양한 물리적 장치를 제어해 여러 작업을 수행하는 모델을 목표로 한다. 그의 판단은 특정 작업마다 별도의 로봇 지능을 만드는 방식보다, 여러 작업과 로봇에서 얻은 데이터로 물리적 상호작용을 학습하는 방식이 장기적으로 더 유리할 수 있다는 것이다. 새로운 작업마다 필요한 데이터를 줄이고, 기존에 배운 지식을 낯선 상황에도 적용할 여지가 있기 때문이다.
그는 언어 모델이 폭넓은 데이터에서 지식을 얻어 여러 언어 작업에 쓰이게 된 사례를 비유로 들었다. 다만 로봇에는 웹처럼 곧바로 활용할 수 있는 방대한 동작 데이터가 없다고 선을 그었다. 사람 모양 로봇도 가능한 몸체 가운데 하나일 뿐이다. 로봇 팔, 불도저, 휴머노이드는 형태가 달라도 물체가 움직이고 상호작용하는 방식에 관한 지식을 공유할 수 있다는 것이 그의 견해다. 각 몸체에 맞춘 추가 학습이 필요할 가능성은 남아 있다.
사전 지식과 실제 연습을 결합하다
연구의 출발점은 시각·언어·행동 모델이다. 언어 모델을 로봇 제어에 맞게 바꾼 것으로, 텍스트를 학습한 뒤 웹 이미지와 다양한 로봇 데이터를 통해 시각 정보와 동작을 연결한다. 로봇이 주방을 정리하라는 지시를 받으면 곧바로 움직이기보다 장면을 살피고 다음 행동을 언어로 정한 뒤 실행하는 방식도 실험하고 있다. 레빈은 이런 중간 판단에 사전 학습으로 얻은 지식이 쓰인다고 설명했다.
다른 축은 강화학습, 즉 작업을 반복하며 결과를 바탕으로 동작을 개선하는 방식이다. 에스프레소를 만드는 시연에서는 여러 차례 연습해 안정성과 속도, 처리량을 높였다고 한다. 레빈은 폭넓은 사전 지식과 연습을 통한 개선을 결합하는 문제가 아직 풀리지 않았으며, 현재 성과는 출발점이라고 평가했다.
병목은 손동작에서 상황 판단으로 옮겨가고 있다
레빈은 낯선 주방에서 청소하던 로봇이 실패했을 때의 실험을 소개했다. 기존에는 사람이 로봇을 원격 조작한 동작 데이터를 추가하는 접근을 썼다. 이번에는 로봇이 이미 겪은 상황에 다음 행동을 설명하는 언어 지시를 붙이고, 저수준 동작 데이터는 더하지 않았다. 그 결과 새로운 상황에 대응하는 능력이 개선됐다는 설명이다.
그는 이를 로봇이 물리적으로 동작하는 능력뿐 아니라 장면을 해석하고 다음 단계를 고르는 중간 수준의 판단이 중요한 병목이 됐다는 신호로 해석했다. 다만 언어가 언제나 최선의 판단 형식인지는 확정하지 않았다. 공간 관계를 다뤄야 할 때는 다른 표현 방식이 필요할 수 있으며, 연구진은 이 내부 판단 과정을 어떻게 구성할지 살펴보고 있다.
다양한 시연이 보여주는 것과 보여주지 못하는 것
피지컬 인텔리전스는 일상 작업을 모은 이른바 ‘로봇 올림픽’으로 새 작업을 모델에 익히는 절차를 시험했다. 레빈에 따르면 목록의 거의 모든 작업을 수행했지만, 셔츠를 뒤집는 작업은 집게가 소매 안에 들어가지 않아 실패했다. 오렌지 껍질도 손가락만으로 벗기는 조건은 충족하지 못해 작은 도구를 사용했다. 이 사례는 모델의 범용성을 시험하는 동시에 로봇 몸체의 제약을 드러낸다.
그는 시연 영상 하나만으로 일반화 능력을 판단하기 어렵다고 강조했다. 주방에서 접시를 집는 동작 자체보다 중요한 조건은 로봇이 이전에 그 집의 학습 데이터를 얻지 않았다는 점이다. 반대로 잘 통제된 환경에서 성공한 장면은 다른 장소에서의 성능을 보장하지 않는다. 연구 결과와 시연을 해석할 때는 어떤 데이터와 조건에서 작업했는지 함께 봐야 한다는 설명이다.
실제 배치가 데이터 학습의 전환점이다
레빈은 범용 로봇에 필요한 데이터의 총량을 아직 누구도 알지 못한다고 말했다. 그보다 중요한 단계는 로봇이 실제 환경에서 쓸모 있는 일을 하면서 새로운 데이터를 모을 만큼 유용해지는 것이다. 이를 위해 사람이 원격으로 조작하는 방식, 부분 자율 방식, 그 중간 형태 가운데 무엇이 맞는지는 작업 영역에 따라 달라진다. 집 안에서 외부 사람이 계속 조작하는 로봇을 받아들이는 문제와 다른 현장의 조건은 같지 않다.
데이터 출처에도 답이 정해지지 않았다. 레빈은 휴머노이드의 역동적인 움직임에는 시뮬레이션을 많이 쓰고 실제 데이터는 거의 쓰지 않는 접근이 있는 반면, 물체를 다루는 로봇에는 실제 데이터와 큰 모델을 많이 쓰는 접근이 있다고 설명했다. 두 방식을 어떻게 결합할지는 열린 문제다. 기업이 미리 데이터를 모으더라도 쉽게 구할 수 있는 영상이 필요한 학습 데이터와 일치한다고 단정할 수 없다고도 지적했다.
하드웨어 가격 하락은 실험 여건을 바꿨다. 레빈은 과거 사용한 PR2가 약 40만 달러였던 것으로 기억하고, 버클리 연구실에서 쓴 로봇은 약 3만 달러였다고 말했다. 현재 사용하는 장치의 로봇 팔 하나는 그보다 약 10분의 1 수준으로 추정했다. 다만 저렴한 팔은 높은 정밀도를 요구하는 전통적 제어 방식이라면 산업 현장에서 활용하기 어려웠을 것이라고 덧붙였다.
레빈은 작업 환경의 폭과 예외 상황 대응을 가장 큰 기술적 위험으로 꼽았다. 접시를 가끔 깨뜨리는 로봇을 허용할 수 있는 곳과 어린아이가 있는 집의 기준도 다르다. 피지컬 인텔리전스가 여러 작업과 몸체에서 학습을 이어가려는 이유는 분명하지만, 그 모델이 언제 어디에 배치될 수 있을지는 기술의 성능과 현장의 조건을 함께 확인해야 알 수 있다.
댓글 0
첫 댓글을 남겨 주세요.