AI가 인간처럼 효율적으로 학습하지 못하는 이유와 월드 모델이 어떻게 이 격차를 줄일 수 있는지 알아보세요.
AI 샘플 효율성 문제: 월드 모델이 해결책인 이유
핵심 요약
- AI는 학습에 수만 개의 데이터 포인트가 필요하지만, 인간은 몇 번의 시도로 새로운 기술을 습득합니다.
- 샘플당 지능(intelligence per sample) 은 현재 AI 시스템이 해결해야 할 가장 중요한 미해결 문제입니다.
- 월드 모델 은 환경의 역학을 이해하여 적은 데이터로 정책을 학습하게 합니다.
- 완벽한 월드 모델이 있으면 샘플이 전혀 필요하지 않습니다(뉴턴 물리학처럼).
- 로봇 공학과 자율주행차에서 월드 모델이 가장 필요하며, 최신 확산 모델과 함께 실용화되고 있습니다.
AI의 두 가지 중요한 문제: 에너지와 데이터
AI 시스템이 해결해야 할 가장 중요한 문제는 두 가지입니다.
와트당 지능(intelligence per watt): 소비 에너지 대비 얼마나 효율적으로 작동하는가
샘플당 지능(intelligence per sample): 새로운 데이터 하나가 추가될 때 모델이 얼마나 더 똑똑해지는가
프랑수아 숄레 같은 연구자들은 진정한 지능을 단순히 특정 기술을 습득하는 것이 아니라 새로운 기술을 얼마나 빠르게 습득하는가 로 정의합니다. 현재 AI는 이 부분에서 인간에 비해 심각하게 뒤떨어져 있습니다.
인간 vs AI: 학습 효율성의 격차
인간의 학습 능력을 보여주는 좋은 예가 있습니다. ARKG 같은 지능 테스트에서 인간은 직관적으로 문제를 풀지만, 최첨단 AI 시스템도 이를 제대로 해결하지 못합니다.
인간은 수년간의 교육을 통해 강력한 귀납적 편향을 가지고 새로운 문제에 접근합니다. 반면 AI 모델은 인터넷 전체를 학습했음에도 불구하고 새로운 작업에 일반화하는 데 여전히 어려움을 겪습니다.
신경과학적 증거: 뇌의 월드 모델
흥미롭게도, 1967년 리처드슨의 연구에서 농구 레이업을 1시간 연습한 사람들은 약 24% 향상되었습니다. 놀랍게도 눈을 가리고 연습을 상상한 사람들도 23% 향상 되었습니다. 이는 우리 뇌가 놀랍도록 정교한 내부 월드 모델을 가지고 있음을 시사합니다.
신경과학자들은 신피질 확장이 본질적으로 세계를 모델링하기 위한 것이라고 합니다. 우리가 다른 사람의 행동을 예측하고, 제품의 "느낌"을 이해하는 능력은 모두 이러한 암묵적 월드 모델에서 비롯됩니다.
완벽한 월드 모델: 샘플이 필요 없는 지능
극단적인 시나리오를 생각해 봅시다. 만약 완벽한 월드 모델 이 있다면, 샘플이 전혀 필요하지 않을 것입니다.
이는 현실에서 실제로 일어나고 있습니다.
NASA의 소행성 요격 사례
NASA가 몇 년 전 소행성 요격 계획을 세웠을 때, 그들은 정밀한 수학적 월드 모델(뉴턴 물리학)을 가지고 있었습니다. 따라서 실제 테스트 없이도 궤적을 정확하게 예측할 수 있었습니다.
만약 달에 우주선을 발사하기 위해 백만 개의 훈련 예시가 필요했다면, 아폴로 임무는 불가능했을 것입니다.
현실은 미분 가능하기 때문에, 이러한 정확한 예측이 가능합니다. 이것이 바로 모델 예측 제어(MPC) 라는 기술을 가능하게 합니다.
강화 학습에서 월드 모델의 역할
강화 학습(RL)의 핵심은 세 가지 요소입니다.
상태(State): 현재 환경의 상황(예: 드론의 위치와 속도)
행동(Action): 우리가 취할 수 있는 결정(예: 추력)
월드 모델: 현재 상태와 행동이 주어졌을 때 다음 상태가 어떻게 변하는지 설명하는 전이 함수
드론을 착륙시키는 간단한 예에서, 뉴턴 물리학(F=MA)이 완벽한 월드 모델입니다. 이를 통해 정책을 도출하고 최적의 행동을 계산할 수 있습니다.
하지만 적대 드론이 요격하려는 상황 에서는 어떨까요? 이제 월드 모델이 확률적이고 미분 불가능해집니다. 이것이 강화 학습이 필요한 이유입니다.
게임과 실제 세계의 차이: 체스에서 자율주행까지
체스: 작은 행동 공간
체스의 상태 공간은 매우 크지만(32개 말로 인해 거대한 조합), 각 상태에서 기대되는 합법적인 수는 약 8개입니다. 이 작은 행동 공간 이 조합적 확장을 제한하여 게임을 "다루기 쉽게" 만듭니다.
AlphaGo: 확장의 한계
바둑은 체스보다 훨씬 큽니다. 19x19 바둑판에서 가능한 행동은 361개입니다. AlphaGo는 각 이동마다 800회의 몬테카를로 트리 탐색(MCTS) 시뮬레이션 을 수행하는데, 이는 약 24,000번의 모델 호출이 필요합니다.
만약 바둑판을 1000x1000으로 만들면 행동 공간이 백만 개가 되어 계산량이 천문학적으로 증가합니다.
자율주행차: 현실의 복잡성
자율주행차의 상태 공간은 사실상 무한합니다. 환경, 차량, 카메라, 날씨 등 모든 변수를 고려해야 합니다.
행동 공간도 거대합니다. 핸들(365도) × 강도(10단계) × 가속 페달 × 브레이크 = 약 36,500개의 행동. 이는 AlphaGo의 약 100배입니다.
더 큰 문제는, 사람들이 도로를 따라 운전할 때의 비디오만 대량 있다는 것입니다. 충돌 시나리오나 극단적인 상황의 데이터는 거의 없습니다.
월드 모델의 최신 기술: 확산 모델과 Dreamer
위르겐 슈미트후버의 선구적 연구
위르겐 슈미트후버는 "World Models" 논문에서 자동차 경주와 고전 게임(Doom)을 사용하여 환경의 역학을 예측하는 모델을 훈련했습니다. 핵심은 모델이 합성 롤아웃(가상 경험)을 생성하고, 이를 정책 훈련에 사용할 수 있다 는 것이었습니다.
Dreamer 시리즈의 발전
다니엘 하프너의 Dreamer 논문들은 이 개념을 확장했습니다. 최신 버전인 Dreamer V4 는 마인크래프트에서 동작합니다.
핵심 통찰:
- 관찰 데이터(비디오)만 사용하여 월드 모델을 훈련합니다.
- 소량의 행동 데이터로 행동 조건화를 추가합니다.
- 모델이 생성한 합성 데이터로 정책을 훈련합니다.
결과적으로 Dreamer V4는 다이아몬드 채굴 에 성공했습니다. 마인크래프트에서 인간 플레이어도 거의 달성하지 못하는 작업입니다.
확산 모델(Diffusion Models)의 등장
최신 접근 방식은 고급 비디오 생성 모델(확산 모델, 플로우 매칭) 을 사용하여 월드 모델을 만드는 것입니다.
프로세스:
- 방대한 관찰 데이터(YouTube 동영상 등)로 확산 모델 사전 훈련
- 소량의 행동 조건부 데이터로 미세 조정
- 행동 조건부 모델에서 대규모 샘플링하여 정책 훈련
이는 Wayve의 Gaia 프로젝트 처럼 자율주행차에 적용되고 있습니다.
로봇 공학의 최신 연구
DreamZero 개념을 로봇에 적용한 연구는 단 500시간의 원격 조작 데이터 로도 성과를 냈습니다. 비디오 확산 모델을 사용하여 상태 전이와 행동의 결합 모델을 훈련했습니다.
아직 미해결인 문제들
월드 모델이 진전하고 있지만, 여전히 많은 과제가 남아 있습니다.
1. 분포 외 데이터 문제
자율주행차 데이터의 대부분은 "안전한 주행"입니다. 만약 모델이 집으로 돌진하기 직전 상태에 놓인다면, 충돌 데이터가 거의 없기 때문에 모델은 집을 도로의 일부로 변환하거나 "충돌이 아니라"고 가정할 것입니다.
2. 계산 정밀도 문제
신경망은 기계 정밀도 때문에 완벽한 세계 모델을 만들 수 없습니다. NBA 선수 스테판 커리처럼 코트의 "데드 스팟"을 감지하려면 극도의 정확도가 필요합니다.
3. 실시간 적응 부족
인간의 뇌는 새로운 환경에 매우 빠르게 적응합니다. 예를 들어 테니스 경기에서 상대의 행동에 즉시 반응합니다. 현재 모델에는 이러한 빠른 적응 메커니즘이 없습니다.
4. 촉각 피드백의 부재
로봇 센서는 인간의 피부만큼 정교하지 않습니다. 마비된 손으로 신발 끈을 묶을 수 없는 것처럼, 촉각 피드백 없는 로봇도 정교한 작업을 수행하기 어렵습니다.
인간 뇌와 월드 모델: 수면의 역할
흥미로운 사실은 모든 지능적 종이 잠을 잔다 는 것입니다(문어, 돌고래, 코끼리 등). 이는 잠의 진화적 가치가 포식의 위험을 능가할 정도로 크다는 뜻입니다.
현재 AI 아키텍처에는 "깨어있는 잠(awake sleep)"이 없습니다. 하지만 해마에서 낮의 경험을 시뮬레이션하고 정책을 업데이트하는 것을 상상할 수 있습니다. 실제로 인간의 뇌는 수면 중에 단파 리플(short-wave ripple) 을 통해 경험을 양쪽 반구로 약 7번 다시 보냅니다.
잠을 자지 않으면 장기 기억이 형성되지 않습니다. 따라서 월드 모델의 완성도를 높이려면, 경험 재생과 내적 시뮬레이션이 필수입니다.
2026년: 로봇의 해를 향하여
이 모든 기술이 함께 움직이고 있습니다. 로봇 정책에서 월드 모델을 훨씬 더 많이 보게 될 것이며, 이는 완전 자율 주행을 가능하게 할 것 입니다.
현재의 계산 능력 증가와 병렬 처리를 통해 복잡한 상황(예: 복잡한 주차 혼잡)을 해결할 수 있게 될 것입니다. 이는 오랫동안의 꿈인 "로지 로봇"(가사일을 처리하는 가정용 로봇)을 현실로 만들 수 있는 수준에 도달하고 있음을 의미합니다.
데이터 수집과 고급 모델 개발에 상당한 투자가 필요하지만, 이러한 해결책들이 실현 가능하다고 강하게 믿을 수 있습니다.
결론
AI의 가장 큰 미해결 문제인 샘플 효율성 을 해결하는 열쇠는 월드 모델 입니다. 인간 뇌처럼 환경의 역학을 이해하고 미래를 시뮬레이션할 수 있는 AI는 적은 데이터로도 지능적으로 행동할 수 있습니다. 최신 확산 모델과 Dreamer 기술의 결합은 이제 로봇 공학과 자율주행 분야에서 실질적인 성과를 내고 있으며, 이 경향은 계속 가속화될 것입니다.
Original source: AI Can't Learn The Way Humans Do - This Could Fix That
powered by osmu.app