A Functional Taxonomy of World Models
Author: Fei-Fei Li (World Labs) | Source: drfeifei.substack.com | Published: 2026-06-04
한 줄 요약
“world model”이라는 과부하된 용어를 POMDP 루프(agent-action-state-observation) 위에서 Renderer(픽셀)·Simulator(상태)·Planner(액션) 세 기능으로 분해하고, 그중 Simulator가 가장 덜 주목받지만 가장 핵심적인 linchpin이라 주장.
핵심 주장/내용
- 언어 모델이 텍스트의 통계 구조를 배운다면, world model은 공간·시간의 통계 구조(빛, 물리 법칙, 객체의 힘 반응)를 학습. “world model”은 CV·로보틱스·RL·생성 AI가 각기 다른 의미로 사용하는 과부하 용어
- POMDP 루프가 통일 골격: agent가 action → state 변화 → observation → 새 action. 오늘날 불리는 다양한 world model은 이 루프의 서로 다른 projection
- 3가지 기능:
- Renderer(픽셀 출력, 시각 충실도): text-to-video, Genie 3, RTFM. 3D 구조 이해 없음 — 보이는 것만 생성(드론샷은 완벽하나 도시를 통과하려면 무너짐). 상업적으로 가장 성숙
- Simulator(상태 출력, 기하·물리·동역학 충실): 건축가·게임 개발자(정확성) + RL 에이전트·로봇·자율주행(대규모 학습장). 가장 덜 주목받지만 가장 중요 — 픽셀(렌더러)과 액션 결과(플래너) 모두를 도출할 수 있는 구조적 backbone
- Planner(액션 출력): observation + goal → 다음 행동. VLA, World Action Models. 가장 nascent(로봇 데모는 제약된 랩 환경에 국한)
- 경계 붕괴: 셋의 기저 지식(기하·물리·동역학)이 동일 → 컵을 어느 각도로든 렌더링하는 모델은 컵이 밀릴 때를 시뮬레이트하고 집는 손을 계획할 수 있어야 함. 논리적 종착점은 unified world model
주요 수치 / 사실
- 3D 데이터(명시적 기하·물질·물리 주석)는 렌더러용 인터넷 비디오보다 orders of magnitude 희소 → sim-to-real gap
- NVIDIA Omniverse는 1조 달러+ TAM(공장·창고·디지털 트윈) 추정
- World Labs의 Marble: 멀티모달 프롬프트 → explorable 3D(Gaussian splat + collision mesh)
관련 위키
Source: 원문 보기