한 줄 정의
세계 모델(World Model)은 물리적 및 개념적 환경의 인과 관계와 미래 상태 변화를 시뮬레이션하여 행동의 결과를 예측하고 계획을 수립할 수 있도록 돕는 인공지능 내부의 감각-운동 인지 지도이자 내부 작동 모델이다.
핵심 요지
- LLM의 관찰/체화 한계: 기존 거대 언어 모델(LLM)은 언어 텍스트의 다음 단어를 예측하는 기호 모방 엔진일 뿐, 시공간 물리 환경의 다음 상태(State)를 직접 시뮬레이션하는 내부 세계 모델이 결여되어 있다 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md).
- 자가 지도 학습 (Self-Supervised Learning): 지능의 본체는 사람이 일일이 데이터 라벨을 붙이는 지도 학습(아이싱)이나 단순 보상에 의존하는 강화 학습(체리)이 아니라, 가공되지 않은 세상 관찰을 통한 자가 지도 학습(스펀지 빵 시트)으로 구축된다 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
- 공동 임베딩 예측 아키텍처 (JEPA): 미래를 픽셀 단위로 직접 복원할 때 발생하는 노이즈/표현 붕괴(Representation Collapse)와 유령 현상(Blur)을 방지하기 위해, 무작위 픽셀 노이즈를 걷어내고 의미론적 추상 공간(Latent/Concept Space) 내에서 미래 상태를 예측한다 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md).
- 공간 지능(Spatial Intelligence): 페이페이 리(Fei-Fei Li)가 제시한 개념으로, 언어 이전에 존재하며 인간 지능의 주춧돌 역할을 하는 3D 시공간 인지 모델이다 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
- 체험과 감각-운동 루프의 필연성: 리처드 서튼(Richard Sutton)과 얀 르쿤(Yann LeCun)은 세상과의 직접적인 상호작용 피드백 없이 과거 텍스트 데이터만 동결하여 모방하는 현재의 LLM 접근법은 진정한 지능으로 나아가는 데 있어 “막다른 골목”에 처했다고 본다 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
상세
세계 모델은 인간이나 동물이 물리적 세상을 관찰하고 직접 부딪치며 형성하는 상식적인 시뮬레이터(예: 물체 추락, 충돌, 중력, 공간 물리) 역할을 수행한다.
1. 지능 데이터 밀도와 스케일의 패러독스
보통 4세 아동이 4년간 깨어 있는 동안 시각으로 받아들이는 원시 정보량은 인류가 디지털화한 모든 인터넷 텍스트 데이터 총량을 압도한다 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md). 뉴턴의 법칙을 텍스트로 서술하는 것과, 컵을 밀면 바닥으로 떨어져 물이 엎질러진다는 물리적 실제를 머릿속 시뮬레이터로 예측하는 것은 본질적으로 다르다. 스케일링 스쿨(Scaling School)이 계산 자원을 쏟아붓는 단순 모델 중심의 쓰라린 교훈에 기반해 모델 크기를 키우고 있으나, 현실 감각-운동 루프가 결여된 단순 텍스트 모방 엔진은 모라벡의 역설에 직면하게 된다.
2. JEPA 및 표현 붕괴(Representation Collapse) 방지 기법
픽셀 수준 비디오 예측은 미래 가능성의 유연한 평균값을 그리느라 영상이 뭉개지는 표현 붕괴(Blur) 현상을 겪는다. 얀 르쿤 교수가 제안한 JEPA는 의미 공간(Latent Space)에서 예측을 수행한다.
이 과정에서 모델이 모든 출력을 동일한 상수로 매핑하여 학습을 회피하는 ‘표현 붕괴’를 막기 위해 1990년대 시암 네트워크(Siamese Network)와 호레이스 바로우(Horace Barlow)의 이론에 기반한 바로우 트윈스(Barlow Twins), DINO 등의 비지도 정규화 기법이 적용된다 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
3. 주요 세계 모델 구현체 및 산업 적용
- V-JEPA 2: 100만 시간 이상의 무라벨 비디오 학습 후, 62시간 미만의 로봇 작동 데이터 연결만으로 미지의 환경에서 실제 로봇 팔 제어 및 물체 조작 성공 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md).
- AMI Labs (Yann LeCun): 2025년 11월 설립된 파리 기반 연구소로, 챗봇이 아닌 가스 터빈, 화학 생산 공정, 전력망, 당뇨병 환자 인체 대사 작용 시뮬레이션 등 복잡한 산업/생명 시스템 세계 모델을 개발 중 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md).
- World Labs Marble (Fei-Fei Li): 2025년 11월 공개된 3차원 공간 지능 생성 모델로, 단일 텍스트/이미지 프롬프트에서 자유롭게 탐색 가능한 3D 시공간 환경을 렌더링 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
- Google DeepMind Genie 3: 인터랙티브 가상 시뮬레이션 및 상호작용 환경을 생성하는 연구 모델 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
예시
1. 파이썬 기반 JEPA 잠재 공간 세계 모델 예측 루프 예시
다음은 물리 픽셀을 예측하는 대신 잠재 공간(Latent Space)에서 현재 관찰 상태 와 행동 를 결합하여 미래 잠재 상태 를 예측하는 JEPA 아키텍처의 파이썬 PyTorch 예시 코치이다:
import torch
import torch.nn as nn
class JEPAWorldModel(nn.Module):
def __init__(self, observation_dim=512, action_dim=64, latent_dim=128):
super().__init__()
# 관찰 인코더 (관찰 x_t -> 의미 잠재 공간 z_t)
self.encoder = nn.Sequential(
nn.Linear(observation_dim, 256),
nn.ReLU(),
nn.Linear(256, latent_dim)
)
# 잠재 상태 예측기 (z_t, action_t -> z_{t+1}_hat)
self.predictor = nn.Sequential(
nn.Linear(latent_dim + action_dim, 256),
nn.ReLU(),
nn.Linear(256, latent_dim)
)
def forward(self, obs_t, action_t):
# 픽셀 노이즈를 제거하고 고차원 의미 공간(Latent Space)으로 추상화
z_t = self.encoder(obs_t)
# 행동을 결합하여 미래의 핵심 상태(Idea)를 예측
latent_action_input = torch.cat([z_t, action_t], dim=-1)
predicted_z_next = self.predictor(latent_action_input)
return z_t, predicted_z_next
# 시뮬레이션 실행 예시: 로봇 조작 계획
model = JEPAWorldModel()
current_obs = torch.randn(1, 512) # 센서/시각 입력
planned_action = torch.randn(1, 64) # 관절 이동 명령
z_current, z_next_pred = model(current_obs, planned_action)
print(f"현재 상태 표현: {z_current.shape}, 예측된 미래 잠재 상태: {z_next_pred.shape}")2. 계층적 세계 모델(Hierarchical World Model) 시나리오
뉴욕 사무실에서 파리로 출장을 떠날 때 엉덩이 근육의 미세 수축을 계산하지 않고 ‘공항 이동 비행기 탑승 파리 도착’의 거시적 이정표를 먼저 수립하듯, 상위 노드에서 장기 계획을 짜고 하위 노드에서 실시간 물리 장애물 회피를 조율하는 상위-하위 이중 루프 구조이다 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md).
충돌
1. LLM VLA 기반 단기 우세 vs. 세계 모델의 근본성 대립
- 현상: 실용적 제어 능력 측면에서는 LLM 기반 비전-언어-행동 모델(VLA, 예: Physical Intelligence의 애호박 껍질 벗기기 및 쓰레기 봉투 묶기 로봇)이 세계 모델 기반 로봇(1분에 컵 하나 밀기)보다 압도적인 시연 성과를 내고 있다 (raw/당신의 고양이가 챗GPT보다 세상을 더 잘 이해하는 이유.md).
- 주장 충돌:
- 스케일링 진영: 데이터와 하드웨어를 때려 박는 물량공세가 우아한 알고리즘을 이긴다는 쓰라린 교훈을 근거로 LLM VLA 방식의 실용성을 지지한다.
- 세계 모델 진영 (르쿤, 서튼): LLM VLA 로봇의 성과는 과거 인간 행동의 기계적 흉내(Imitation)일 뿐 물리적 인과를 모르므로 구조적 한계에 부딪힐 것이라고 반박한다.
2. 쓰라린 교훈 저자 리처드 서튼의 파격적 견해 충돌
- 역설: 스케일링 진영이 성경처럼 인용하는 쓰라린 교훈의 저자 리처드 서튼(Richard Sutton) 본인이 2025년 말 “현 LLM은 세상과 직접 부딪쳐 학습하지 않는 모방 장치에 불과하므로 지능 발전의 막다른 골목(Dead End)“이라고 단언하며 스케일링 스쿨의 주장에 직접 충돌하는 입장을 표명했다 (raw/ChatGPT보다 세상을 더 잘 이해하는 당신의 고양이, 그리고 이것 때문에 메타를 그만둔 AI 대부 중 한 명-ko.md).