선택적 사례 연구: LS-Imagine
이 강의의 모든 계획 메커니즘은 월드모델이 한 번에 한 스텝씩 앞으로 나아간다는 가정 하나를 공유합니다. CEM-MPC는 전체 동작 시퀀스를 한 스텝씩 샘플링하고, Dreamer의 Actor-Critic은
LS-Imagine(Li, Wang, Wang et al., ICLR 2025 Oral)은 이 근시안 문제를 정면으로 다룹니다. 상상 호라이즌을 한 스텝씩 늘려가는 방식이 아니라, 월드모델이 때때로 점프할 수 있게 하는 방식으로 말입니다.
핵심 발상: 두 종류의 상태 전환
LS-Imagine은 하나가 아니라 두 개의 전환 분기를 가진 월드모델을 학습시킵니다.
- 즉시 전환: 이 강의 전반에서 써온 평범한 한 스텝 예측입니다.
. - 점프식 전환: 중간 상태를 완전히 건너뛰고, 단 한 번의 상상 스텝만으로 멀리 떨어진 과제 관련 미래 상태
로 곧장 뛰어넘습니다.
점프 예측기가 현재 상태를 바탕으로 어떤 분기를 쓸지 결정합니다. 목표가 멀리 있고 희미하게만 암시될 때, 점프는 에이전트가 중간의 모든 스텝을 굴리지 않고도 "목표 근처에 도착하는" 상황을 상상할 수 있게 해주어, 롤아웃을 깊게 만들지 않고도 실질적인 상상 호라이즌을 넓혀줍니다.
닭이 먼저냐 달걀이 먼저냐 문제: 어포던스 맵
목표를 향해 점프하도록 점프 예측기를 학습시키려면, 현재 프레임만 보고도 어느 영역으로 점프할 가치가 있는지 알아야 합니다. 하지만 에이전트가 드문드문 떨어진 목표에 이미 도달한 실제 궤적은 존재하지 않아, 여기서 학습할 데이터가 없습니다.
LS-Imagine의 답은 어포던스 맵이라는 합성 탐색 신호입니다. 주어진 관측에 대해 슬라이딩 윈도우가 이미지를 훑고 지나가며, 각 윈도우 위치에서 그 영역을 잘라내 확대해, 에이전트가 그 patch 쪽으로 이동했을 때 보게 될 모습을 시뮬레이션합니다. 사전학습된 비디오-텍스트 정렬 모델인 MineCLIP(Fan et al., 2022, CLIP 스타일 모델로 CLIP 자체는 L01 참고, 마인크래프트 플레이 비디오와 그에 대응하는 해설로 사전학습됨)이 각 시뮬레이션된 접근이 과제의 언어 설명(예: "나무 베기")과 얼마나 잘 맞는지 점수를 매깁니다. 이 윈도우별 점수들을 이어붙이면 이미지 전체에 대한 히트맵, 즉 어느 영역으로 향할 가치가 있는지를 표시하는 어포던스 맵이 만들어집니다. 이를 조밀하게 계산하는 것은 비용이 크기 때문에, 더 작은 네트워크를 학습시켜 단일 프레임과 언어 지시만으로 이를 직접 근사하게 하며, 그 덕분에 실제 학습과 추론의 매 스텝에서 실행할 수 있습니다.
어포던스 맵은 두 가지 역할을 겸합니다.
- 내재적 보상이 되어, 에이전트가 고가치 영역을 시야 중심으로 옮기도록 유도합니다.
- 그 집중도(고가치 영역이 한곳에 얼마나 날카롭게 뭉쳐 있는지)가 점프 예측기가 즉시 전환과 점프식 전환 중 무엇이 적절한지 판단하는 신호가 됩니다. 뾰족하게 솟은 맵은 멀리 있는 목표로 점프할 가치가 있다는 뜻입니다.
이 강의에서 중요한 이유
LS-Imagine은 지금까지 다룬 모든 계획 메커니즘을 관통하는 한계, 즉 고정된 깊이로 한 스텝씩 상상하는 방식은 보상이 드물고 멀리 있을 때 충분히 멀리 내다볼 수 없다는 한계에 대한 구체적인 답입니다. 그 해법, 즉 학습된 관련성 신호로 구동되는 대안 전환 분기는 더 일반적인 패턴의 한 사례로 기억해둘 만합니다. 하나의 메커니즘이 단거리 추론과 장거리 추론을 모두 잘 아우르지 못할 때, 모델이 두 개의 전문화된 분기 중에서 고르게 하는 편이 하나의 분기에게 두 가지 역할을 다 떠맡기는 것보다 나을 수 있다는 패턴입니다.
물을 찾거나 광석을 캐는 것처럼 목표가 드물고 멀리 있는 마인크래프트 과제에서, LS-Imagine은 DreamerV3와 기존의 모델 프리·비디오 사전학습 베이스라인들을 큰 격차로 앞섭니다. 이 격차는 목표가 가장 드문 과제에서 특히 크게 벌어지는데, 이는 점프 메커니즘이 단순히 용량을 더한 게 아니라 설계된 대로 작동하고 있다는 증거입니다.
더 읽을거리
- Li, Wang, Wang et al. (2025): LS-Imagine: 전체 방법론, 어포던스 맵 계산, 마인크래프트 벤치마크 결과. 프로젝트 페이지와 코드
- Fan et al. (2022): MineCLIP: 어포던스 맵을 계산하는 데 쓰이는 CLIP 스타일 비디오-텍스트 정렬 모델
- Hafner et al. (2022): Director: 점프식 전환 대신 관리자/실행자 하위 목표를 통해 같은 장기 근시안 문제를 다루는 계층적 Dreamer 확장으로, LS-Imagine의 베이스라인 중 하나