Physical Intelligence 설립자가 설명하는 로봇의 신뢰성 향상, 강화학습, 다중 스케일 기억 시스템으로 실제 세계에서 유용한 범용 로봇을 개발하는 방법
로봇 공학의 미래: AI 모델로 범용 로봇 만들기
핵심 요약
- 물리적 지능의 도전: 로봇이 실제 세계에서 자율적으로 작동하려면 머신러닝 시스템보다 훨씬 더 높은 신뢰성(90% 이상)이 필요합니다.
- 확장 가능한 강화 학습: 인간의 개입을 통한 막다른 궤적 방지와 범용 가치 함수를 활용하여 처리량을 2배 증가시켰습니다.
- 다중 스케일 기억 시스템: 10초의 단기 비디오 기억과 수시간의 장기 텍스트 기억을 결합하여 10~15분 작업 수행이 가능합니다.
- Pi 0.7 모델의 성과: 미세 조정 없이 다양한 작업(옷 접기, 에스프레소 제조, 상자 조립)을 수행하며 구성적 일반화를 입증합니다.
- 실제 배포 진행 중: Ultra, Weave 등 회사들이 Pi 모델을 세탁물 접기, 창고 포장 등 현장 작업에 적용하고 있습니다.
실제 세계 로봇의 신뢰성 문제
AI가 텍스트, 광고, 번역 등 다양한 분야에 성공적으로 적용되어 왔지만, 로봇 공학은 근본적으로 다릅니다. 언어 모델은 사람이 추천을 모니터링하고 실수를 보정할 수 있지만, 로봇은 실제 세계에 직접 영향을 미치는 결정을 내려야 합니다.
예를 들어 에스프레소를 만드는 로봇의 경우, 포터필터를 정확히 삽입하고, 액체가 든 컵을 흘리지 않으며, 정확한 타이밍을 맞춰야 합니다. 이를 자동으로 이루려면 인간 감시 없이 90% 이상의 신뢰도 가 필수적입니다.
머신러닝의 일반적인 방식 — 데이터 수집, 모델 훈련, 성능 평가 — 은 복잡한 물리적 작업에서는 첫 시도에 안정적으로 작동하지 않습니다. 연구자들은 수동으로 더 많은 데이터를 수집하고, 엣지 케이스에 대해 반복 작업을 수행합니다. 하지만 인간이 수동으로 할 수 있는 작업에는 한계가 있습니다.
강화 학습으로 높은 신뢰성 달성하기
해결책은 AI 시스템이 스스로 반복 작업을 수행 하도록 하는 것입니다. 이는 강화 학습 알고리즘과 유사하게, 로봇이 시도하고, 실패로부터 배우며, 점진적으로 개선되는 방식입니다.
하지만 언어 모델의 강화 학습(PPO, GRPO)을 로봇에 직접 적용하면 비효율적입니다. 언어 모델은 컴퓨팅 자원에서 수백만 번의 반복을 실행할 수 있지만, 로봇은 물리적으로 작업을 시도해야 하므로 훨씬 더 많은 실제 시간이 필요합니다.
두 가지 주요 개선 사항
인간의 개입으로 비생산적 경로 방지: 로봇이 두 상자를 밀착된 상태로 잡으면, 인간이 개입하여 분리 방법을 보여주거나 에피소드를 조기에 종료합니다. 이는 로봇이 수집한 데이터의 효율성을 보장합니다.
범용 가치 함수: 단일 프롬프트에 대해 여러 번(10~50회) 시도하는 대신, 다양한 프롬프트에 걸쳐 경험을 분산시킵니다. 범용 가치 함수는 수많은 로봇 경험 비디오를 통해 훈련되어, "셔츠를 펼치는 것"(부정적 진행)과 "냉장고 문을 여는 것"(긍정적 진행)을 인식합니다.
이 두 가지 개선으로, 강화 학습 단계에서만 처리량이 약 2배 증가 했습니다. 에스프레소 작업에서는 90% 이상의 성공률 을 달성했으며, 라떼 제조 정책을 13시간 연속 으로 실행해도 잦은 실수 없이 작동했습니다.
장시간 자율성을 위한 다중 스케일 기억 시스템
로봇이 장기간 자율적으로 작동하려면 기억 이 필수입니다. 대부분의 현대 로봇 모델은 현재의 카메라 입력에만 의존하므로, 여러 단계를 포함하는 긴 작업(예: 주방 청소)에서 진행 상황을 추적할 수 없습니다.
단순히 과거 비디오를 입력하는 방식은 계산 비용이 너무 많이 듭니다. 4개 카메라에서 10초 분량의 비디오를 50Hz로 기록하면 512,000개 이상의 토큰 이 생성되기 때문입니다.
해결책: 다중 스케일 체화 기억
- 단기 비디오 기억: 약 10초 분량의 최근 비디오 데이터를 효율적으로 처리
- 장기 텍스트 기억: 수분~수시간에 걸친 과거 사건을 텍스트 요약으로 압축
이 시스템으로 로봇은 10~15분 동안 복잡하고 반복적이지 않은 작업을 자율적으로 수행 할 수 있습니다. 예를 들어 주방 청소 작업 중 로봇은 다음과 같이 텍스트 기억을 유지합니다: "나는 스펀지로 조리대를 닦았고, 종이 타월로 건조시켰으며, 종이 타올을 쓰레기통에 버렸다."
Pi 0.7 모델: 범용 로봇의 새로운 단계
로봇 공학은 이제 범용 AI의 발전 단계에서 "BERT에서 GPT로의 전환" 시점에 도달했습니다. 기존에는 각 프로젝트마다 맞춤형 데이터셋을 처음부터 수집했지만, Pi 0.7 모델은 미세 조정 없이도 다양한 작업을 수행 합니다.
Pi 0.7의 성과
모든 데이터(저품질 시연, 로봇 정책 롤아웃, 인간 영상, 웹 데이터)를 활용하여 비전-언어-행동(Vision-Language-Action) 기반 모델 을 훈련했습니다. 상위 수준 작업 지시(예: "주방 청소")와 하위 작업 지시(예: "칼 집어 들기")를 입력으로 받습니다.
미세 조정된 전문가 모델과 비교했을 때, Pi 0.7은 모든 하위 작업에서 동일하거나 더 나은 성능 을 보였습니다. 특히 강화 학습 후속 훈련이 적용된 작업에서도 마찬가지입니다.
구성적 일반화 입증
- 객체-작업 조합: 훈련 데이터에 거의 나타나지 않은 에어프라이어를 열고, 고구마를 넣고, 닫을 수 있습니다.
- 로봇 플랫폼 전이: UR5e 산업용 로봇(옷 접기 훈련 데이터 없음)에서도 셔츠를 성공적으로 접습니다. 옷 접기 성능은 인간 원격 조작에 가까워졌습니다.
실제 배포와 미래 전망
이 모델들은 이미 실제 환경에 배포 중입니다. Ultra 와 Weave(Y Combinator 소속 회사)는 Pi 모델을 세탁물 접기, 창고 포장 등 현장 작업을 위해 후속 학습시켰습니다. 표준 양팔 로봇, 드론, 수술 로봇, 심지어 트랙터에까지 적용되고 있습니다.
로봇 공학의 "ChatGPT 순간"은 언어 모델처럼 빠르게 확산되지는 않을 것으로 보입니다. Waymo의 자율주행이 월간 25만 건을 달성했듯이, 물리적 제약으로 인해 채택 속도가 더 느릴 것입니다. 그러나 현재 로봇들은 실제 세계에서 유용하게 사용될 수 있는 수준 에 도달하기 시작했으며, ChatGPT 수준의 역량은 향후 몇 년 안에 가시화될 것 으로 예상됩니다.
결론
Physical Intelligence가 개발한 확장 가능한 강화 학습, 다중 스케일 기억 시스템, Pi 0.7 같은 범용 모델은 로봇 공학의 새로운 시대를 열고 있습니다. 아직 로봇은 인간보다 느리고 실수를 하지만, 장기 자율성과 구성적 일반화의 능력은 실제 세계에서 진정으로 유용한 범용 로봇이 가능함을 보여줍니다. 소규모 팀도 이제 Pi Zero나 Pi O Five 같은 오픈 소스 범용 정책으로 시작하여 자신의 애플리케이션에 맞게 미세 조정할 수 있습니다. 로봇 공학의 미래는 이제 눈앞에 있습니다.
Original source: Chelsea Finn: This is the State of the Art in Robotics
powered by osmu.app