Skip to content

계획과 제어: TD-MPC와 메커니즘 비교

메커니즘 3: 둘을 잇는 가교, TD-MPC

TD-MPC(Temporal Difference Model Predictive Control)[Hansen et al., 2022]는 MPC의 여러 스텝 앞을 내다보는 계획 능력과, Actor-Critic의 TD(시간차) 학습 방식이 갖는 효율성을 동시에 지닙니다.

핵심 설계:

구성 요소역할
잠재 일관성 손실(Latent Consistency Loss)암묵적 동역학 모델을 학습시킵니다. z^t+1=f(zt,at)가 인코더 출력 sg(zt+1)과 일치해야 합니다
TD(시간차) 타깃벨만 방정식으로 Q함수(action-value function, 동작 가치 함수. Q(s,a)는 "상태 s에서 동작 a를 실행한 뒤 계속 그 정책을 따랐을 때 얻을 수 있는 기대 누적 할인 보상"을 나타냅니다)를 갱신합니다. Q(zt,at)=rt+γQ(zt+1,π(zt+1))이며, γ(할인율)는 미래 보상을 지수적으로 감소시킵니다
CEM 계획매 결정 스텝마다 CEM으로 잠재 공간에서 최적의 동작 시퀀스를 탐색합니다

이 세 구성 요소는 함께 학습됩니다. 일관성 손실이 잠재 공간을 빚어내고, TD 타깃이 Q함수를 학습시키며, Q함수가 다시 CEM 탐색을 유도합니다.

stop-gradient의 역할: 일관성 손실 속의 sg(z_{t+1})은 그라디언트 정지를 뜻합니다. 만약 인코더 양쪽 모두가 그라디언트로 갱신될 수 있다면, 모델은 모든 상태를 하나의 점으로 매핑하는 "항등 함수"를 학습해버릴 수 있습니다. 이렇게 하면 일관성 손실은 0이 되지만 아무 의미가 없습니다. stop-gradient는 타깃 쪽을 고정시켜, 이런 모드 붕괴(mode collapse. 서로 다른 입력을 모두 같은 출력으로 매핑해 손실은 최소화되지만 아무 쓸모 없는 표현을 학습해버리는 퇴화 해)를 막아줍니다.

📖 벨만 방정식(Bellman Equation): Q(st,at)=rt+γmaxaQ(st+1,a). 무한 스텝에 걸친 누적 보상 문제를 "한 스텝 보상 + 다음 스텝의 Q값"만 보면 되는 형태로 바꿔줍니다. 부트스트래핑(bootstrapping)은 모델 자신의 추정값(예: Q(st+1,a))을 학습 타깃으로 쓰는 것으로, "자기 자신으로 자기 자신을 예측"하는 셈입니다. TD 학습은 벨만 방정식으로 부트스트래핑을 수행하므로, 에피소드가 끝나기를 기다리지 않고도 매 스텝마다 학습이 이루어질 수 있습니다.

TD 학습은 벨만 방정식을 이용해 완전한 전개 대신 "현재 보상 + 다음 스텝 Q값 추정"으로 대체하며, 이로써 유효 계획 깊이가 "모델의 정확한 스텝 수"에서 "1스텝 + Q함수의 부트스트래핑"으로 줄어듭니다.

DreamerV3와의 비교:

차원DreamerV3TD-MPC2
월드모델 형태명시적 생성(픽셀/관측을 재구성)암묵적(가치 예측의 정확성만 보장)
계획 방식잠재 공간 Actor-CriticCEM + TD
적용 가능한 과제 범위풍부한 관측이 필요한 시각적으로 복잡한 과제상태 관측 과제, 효율적인 연속 제어
해석 가능성재구성 결과를 시각화할 수 있음잠재 공간에 직접적인 의미가 없음

세 가지 계획 메커니즘 비교

차원CEM-MPCDreamer Actor-CriticTD-MPC
계획 방식무작위 탐색정책 그라디언트(미분 가능)무작위 탐색 + TD
픽셀 재구성 필요 여부불필요필요불필요
장기 계획 능력H에 의해 제한됨Critic의 부트스트래핑에 의존TD + MPC 결합
연산 비용높음(큰 N)중간(상상 전개)낮음~중간
고차원 동작 공간효율 낮음그라디언트로 직접 최적화Q함수가 탐색을 유도
모델 악용 위험중간(근시안적)높음(정책이 모델의 허점을 파고들 수 있음)중간(TD가 누적 오차를 억제)
전형적인 시나리오단순한 연속 제어시각적으로 복잡한 과제효율적인 연속 제어

이 절의 핵심 정리

  • 세 가지 학습 패러다임은 모델이 무엇을 식별할 수 있는지를 결정합니다. 순수 관측 데이터는 시각적 규칙성을 드러내고, 상호작용 데이터는 동작이 결과를 어떻게 바꾸는지를 드러내며, 가치 결합 학습은 어떤 예측 결과가 과제에 중요한지를 가르칩니다.
  • 세 가지 계획 메커니즘은 모델을 의사결정에 어떻게 활용할지를 결정합니다. CEM이 가장 직관적이지만 고차원 공간에서는 효율이 낮고, Actor-Critic이 가장 우아하지만 모델 악용 위험이 있으며, TD-MPC가 이 둘 사이에서 가장 실용적인 균형을 잡습니다.
  • Dreamer = 상호작용형 패러다임 + RSSM + 잠재 Actor-Critic이며, 이 커리큘럼의 핵심 참조 시스템입니다.
  • TD-MPC = 동작 조건화 잠재 동역학 + CEM + TD입니다. 여기서는 두 계획 메커니즘을 잇는 하이브리드 비교 대상으로 쓰이며, P04는 이와 별개로 RSSM 백본을 Transformer로 교체하는 문제를 다룹니다.

다음 단계

이제 P03: Dreamer 에이전트 학습을 완료하는 데 필요한 개념적 도구를 모두 갖췄습니다. 인코더, RSSM, Actor, Critic으로 이루어진 완전한 루프를 실행해본 뒤, 백본 선택으로 이어서 RSSM을 Transformer 및 Diffusion 대안과 비교해보세요. 이 순서를 따르면 각 아키텍처 선택이 이름만 접한 대상이 아니라 여러분이 실제로 관찰한 병목에 대한 답이 됩니다.

더 읽을거리

이번 강의에서 다룬 핵심 논문을 등장 순서대로 정리했습니다.

기초 아키텍처

Transformer 아키텍처

Diffusion 아키텍처

계획 메커니즘

JEPA 시리즈

Genie / 상호작용형 생성

RWM / 로봇 배포

WAM / 공동 학습

  • Bi et al. (2025): Motus: 통일된 잠재 동작 월드모델, 이종 비디오 데이터로부터의 서로 다른 신체 형태 간 전이
  • NVIDIA (2026): WAM: 사전학습된 비디오 모델을 제로샷 정책으로 활용
  • NVIDIA (2025): Cosmos: 범용 물리 AI 파운데이션 모델, 가중치까지 공개된 오픈소스
  • Hu et al. (2023): GAIA-1: 자율주행용 생성형 월드모델, 비디오·텍스트·동작 공동 모델링