계획과 제어: TD-MPC와 메커니즘 비교
메커니즘 3: 둘을 잇는 가교, TD-MPC
TD-MPC(Temporal Difference Model Predictive Control)[Hansen et al., 2022]는 MPC의 여러 스텝 앞을 내다보는 계획 능력과, Actor-Critic의 TD(시간차) 학습 방식이 갖는 효율성을 동시에 지닙니다.
핵심 설계:
| 구성 요소 | 역할 |
|---|---|
| 잠재 일관성 손실(Latent Consistency Loss) | 암묵적 동역학 모델을 학습시킵니다. |
| TD(시간차) 타깃 | 벨만 방정식으로 Q함수(action-value function, 동작 가치 함수. |
| CEM 계획 | 매 결정 스텝마다 CEM으로 잠재 공간에서 최적의 동작 시퀀스를 탐색합니다 |
이 세 구성 요소는 함께 학습됩니다. 일관성 손실이 잠재 공간을 빚어내고, TD 타깃이 Q함수를 학습시키며, Q함수가 다시 CEM 탐색을 유도합니다.
stop-gradient의 역할: 일관성 손실 속의 sg(z_{t+1})은 그라디언트 정지를 뜻합니다. 만약 인코더 양쪽 모두가 그라디언트로 갱신될 수 있다면, 모델은 모든 상태를 하나의 점으로 매핑하는 "항등 함수"를 학습해버릴 수 있습니다. 이렇게 하면 일관성 손실은 0이 되지만 아무 의미가 없습니다. stop-gradient는 타깃 쪽을 고정시켜, 이런 모드 붕괴(mode collapse. 서로 다른 입력을 모두 같은 출력으로 매핑해 손실은 최소화되지만 아무 쓸모 없는 표현을 학습해버리는 퇴화 해)를 막아줍니다.
📖 벨만 방정식(Bellman Equation):
. 무한 스텝에 걸친 누적 보상 문제를 "한 스텝 보상 + 다음 스텝의 Q값"만 보면 되는 형태로 바꿔줍니다. 부트스트래핑(bootstrapping)은 모델 자신의 추정값(예: )을 학습 타깃으로 쓰는 것으로, "자기 자신으로 자기 자신을 예측"하는 셈입니다. TD 학습은 벨만 방정식으로 부트스트래핑을 수행하므로, 에피소드가 끝나기를 기다리지 않고도 매 스텝마다 학습이 이루어질 수 있습니다.
TD 학습은 벨만 방정식을 이용해 완전한 전개 대신 "현재 보상 + 다음 스텝 Q값 추정"으로 대체하며, 이로써 유효 계획 깊이가 "모델의 정확한 스텝 수"에서 "1스텝 + Q함수의 부트스트래핑"으로 줄어듭니다.
DreamerV3와의 비교:
| 차원 | DreamerV3 | TD-MPC2 |
|---|---|---|
| 월드모델 형태 | 명시적 생성(픽셀/관측을 재구성) | 암묵적(가치 예측의 정확성만 보장) |
| 계획 방식 | 잠재 공간 Actor-Critic | CEM + TD |
| 적용 가능한 과제 범위 | 풍부한 관측이 필요한 시각적으로 복잡한 과제 | 상태 관측 과제, 효율적인 연속 제어 |
| 해석 가능성 | 재구성 결과를 시각화할 수 있음 | 잠재 공간에 직접적인 의미가 없음 |
세 가지 계획 메커니즘 비교
| 차원 | CEM-MPC | Dreamer Actor-Critic | TD-MPC |
|---|---|---|---|
| 계획 방식 | 무작위 탐색 | 정책 그라디언트(미분 가능) | 무작위 탐색 + TD |
| 픽셀 재구성 필요 여부 | 불필요 | 필요 | 불필요 |
| 장기 계획 능력 | Critic의 부트스트래핑에 의존 | TD + MPC 결합 | |
| 연산 비용 | 높음(큰 | 중간(상상 전개) | 낮음~중간 |
| 고차원 동작 공간 | 효율 낮음 | 그라디언트로 직접 최적화 | Q함수가 탐색을 유도 |
| 모델 악용 위험 | 중간(근시안적) | 높음(정책이 모델의 허점을 파고들 수 있음) | 중간(TD가 누적 오차를 억제) |
| 전형적인 시나리오 | 단순한 연속 제어 | 시각적으로 복잡한 과제 | 효율적인 연속 제어 |
이 절의 핵심 정리
- 세 가지 학습 패러다임은 모델이 무엇을 식별할 수 있는지를 결정합니다. 순수 관측 데이터는 시각적 규칙성을 드러내고, 상호작용 데이터는 동작이 결과를 어떻게 바꾸는지를 드러내며, 가치 결합 학습은 어떤 예측 결과가 과제에 중요한지를 가르칩니다.
- 세 가지 계획 메커니즘은 모델을 의사결정에 어떻게 활용할지를 결정합니다. CEM이 가장 직관적이지만 고차원 공간에서는 효율이 낮고, Actor-Critic이 가장 우아하지만 모델 악용 위험이 있으며, TD-MPC가 이 둘 사이에서 가장 실용적인 균형을 잡습니다.
- Dreamer = 상호작용형 패러다임 + RSSM + 잠재 Actor-Critic이며, 이 커리큘럼의 핵심 참조 시스템입니다.
- TD-MPC = 동작 조건화 잠재 동역학 + CEM + TD입니다. 여기서는 두 계획 메커니즘을 잇는 하이브리드 비교 대상으로 쓰이며, P04는 이와 별개로 RSSM 백본을 Transformer로 교체하는 문제를 다룹니다.
다음 단계
이제 P03: Dreamer 에이전트 학습을 완료하는 데 필요한 개념적 도구를 모두 갖췄습니다. 인코더, RSSM, Actor, Critic으로 이루어진 완전한 루프를 실행해본 뒤, 백본 선택으로 이어서 RSSM을 Transformer 및 Diffusion 대안과 비교해보세요. 이 순서를 따르면 각 아키텍처 선택이 이름만 접한 대상이 아니라 여러분이 실제로 관찰한 병목에 대한 답이 됩니다.
더 읽을거리
이번 강의에서 다룬 핵심 논문을 등장 순서대로 정리했습니다.
기초 아키텍처
- Ha & Schmidhuber (2018): World Models: V/M/C 세 모듈 프레임워크와 꿈속 학습을 다룬 원 논문
- Hafner et al. (2019): PlaNet / RSSM: 결정론적 + 확률적 이중 경로 잠재 동역학 모델
- Hafner et al. (2019/2020/2023/2025): Dreamer V1/V2/V3/V4: RSSM과 잠재 Actor-Critic 시리즈. V4는 arxiv 2509.24527 참고
Transformer 아키텍처
- Micheli et al. (2022): IRIS: VQ-VAE 이산화 + GPT 자기회귀 월드모델, Atari 100k 1.046 HNS
- Zhang et al. (2023): STORM: 범주형 VAE + 단일 토큰 Transformer, 126.7% HNS, 4.3시간 학습
Diffusion 아키텍처
- Alonso et al. (2024): Diamond: 확산 월드모델, Atari에서 실제 게임 프레임보다 낮은 FVD를 최초로 달성
계획 메커니즘
- Schrittwieser et al. (2020): MuZero: 암묵적 월드모델 + MCTS, 바둑과 Atari에서 인간을 뛰어넘는 성능
- Hansen et al. (2022): TD-MPC, TD-MPC2 (2024): CEM + TD 하이브리드 계획
JEPA 시리즈
- Assran et al. (2023): I-JEPA, Bardes et al. (2024): V-JEPA: 픽셀 재구성 없는 의미 공간 예측
Genie / 상호작용형 생성
- Bruce et al. (2024): Genie: 주석 없는 비디오에서 잠재 동작을 자동으로 발견, 110억 파라미터
RWM / 로봇 배포
- Li et al. (2026): RWM-U: 오프라인 MBRL + 앙상블 불확실성, 사족보행 로봇과 인간형 로봇에서 검증
- NeurIPS 2025: Self-Forcing: 학습 중 자기 예측 피드백을 도입해 teacher forcing 격차를 완화
WAM / 공동 학습
- Bi et al. (2025): Motus: 통일된 잠재 동작 월드모델, 이종 비디오 데이터로부터의 서로 다른 신체 형태 간 전이
- NVIDIA (2026): WAM: 사전학습된 비디오 모델을 제로샷 정책으로 활용
- NVIDIA (2025): Cosmos: 범용 물리 AI 파운데이션 모델, 가중치까지 공개된 오픈소스
- Hu et al. (2023): GAIA-1: 자율주행용 생성형 월드모델, 비디오·텍스트·동작 공동 모델링