Skip to content

选读案例:LS-Imagine

本讲介绍的每一种规划机制都共享一个假设:世界模型一步一步向前展开。CEM-MPC 逐步采样完整动作序列,Dreamer 的 Actor-Critic 一步一步地想象 H 步之后的转移,TD-MPC 通过贝尔曼方程一步一步地自举。当有价值的奖励就在附近时,这套做法效果很好。但在 Minecraft 这样的任务里就会失效:一个有用的结果(找到村庄、挖到矿脉)可能在几百步之外,而且附近几乎没有奖励信号能提示方向。只会想象几步之内的智能体是短视的:它只能优化眼前能看到的东西,对更远处真正有回报的行为视而不见。

LS-ImagineLi, Wang, Wang et al., ICLR 2025 Oral)直接针对这种短视问题,不是靠把逐步想象的步数拉长,而是让世界模型偶尔可以"跳跃"。

核心思路:两种状态转换

LS-Imagine 训练的世界模型有两个转换分支,而不是一个:

  • 即时转换:本讲此前介绍的普通单步预测,s^t+1=f(st,at)
  • 跳跃式转换:在单次想象步骤中直接跳到一个与任务相关、但距离较远的未来状态 s^t+H,绕过中间的所有状态。

一个跳跃预测器根据当前状态判断应该使用哪个分支。当目标距离较远、且只有模糊的迹象指向它时,跳跃能让智能体直接想象"抵达目标附近",而不需要逐步展开所有中间状态,从而在不加深单步展开深度的情况下扩展有效的想象范围。

先有鸡还是先有蛋:功用性图

要训练跳跃预测器学会朝目标跳跃,首先需要知道从当前画面出发,哪些区域值得跳过去。但现实中并不存在智能体已经抵达这种稀疏远期目标的真实轨迹可供学习。

LS-Imagine 的解法是构造一种合成的探索信号,称为功用性图(Affordance Map)。对给定的观测图像,用一个滑动窗口扫描全图。在每个窗口位置,裁剪并放大该区域,以模拟智能体朝这块区域移动时会看到的画面。一个预训练的视频-文本对齐模型 MineCLIPFan et al., 2022,一个 CLIP 风格的模型,CLIP 见 L01,专门在 Minecraft 游戏视频与解说文本上预训练)给每个模拟出的接近过程打分,衡量它与任务的语言描述(比如"砍一棵树")的匹配程度。把所有窗口位置的得分拼接起来,就得到一张覆盖全图的热力图,也就是功用性图,标出哪些区域值得朝其前进。由于逐窗口密集计算的开销很大,LS-Imagine 额外训练了一个更小的网络,直接从单帧画面加语言指令来近似这张图,使其能够在训练和推理的每一步都实时运行。

功用性图身兼两职:

  • 作为一种内在奖励,激励智能体不断把高价值区域移向视野中心。
  • 它的集中程度(高价值区域聚集得有多紧)成为跳跃预测器判断该用即时转换还是跳跃式转换的依据:图像越尖锐地聚集在一处,就越值得朝那里跳跃。

为什么这对本课程重要

LS-Imagine 是对贯穿本讲所有规划机制的一个共同局限给出的具体回应:当奖励稀疏且距离遥远时,固定深度、逐步展开的想象看不了那么远。它的解法,即由一个学习出的相关性信号驱动的备用转换分支,体现了一个更普遍、值得记住的模式:当单一机制无法同时兼顾近距离和远距离推理时,让模型在两个各有专长的分支之间做选择,往往比强迫一个分支包办两件事更有效。

在目标稀疏、距离遥远的 Minecraft 任务(找水、挖矿)上,LS-Imagine 大幅超过 DreamerV3 以及此前的无模型和视频预训练基线,且优势在目标最稀疏的任务上最为明显,这说明跳跃机制确实在起设计中预期的作用,而不只是单纯增加了模型容量。

延伸阅读