观察、状态与信念
看一张小球位于桌面中央的照片,你无法判断它下一刻会向左还是向右。两段完全不同的运动轨迹可以产生同一张照片。单帧告诉了我们小球在哪里,却没有告诉我们它的速度、刚才是否发生碰撞,也没有告诉我们画面外是否有人正在推动它。
这个例子揭示了世界模型的第一个建模问题:模型接收的是观察,但需要推断的是足以预测未来的状态。
读完本页,你应该能够区分观察、环境状态和信念状态,解释为什么记忆是状态估计的一部分,并把经典的“预测与校正”循环对应到 RSSM 的先验与后验。
同一观察可以通向不同未来
环境在时刻
这两个分布分别描述“世界怎样变化”和“世界怎样被看见”。观察可能比状态的数值维度更高,例如图像包含成千上万个像素,但它仍可能缺少预测所需的变量。因此,高维不等于完整。
| 变量 | 含义 | 在像素控制任务中的例子 |
|---|---|---|
| 环境的隐藏状态 | 位置、速度、接触状态 | |
| 传感器提供的观察 | 一帧 RGB 图像 | |
| 智能体施加的动作 | 向左或向右推动 | |
| 模型压缩后的历史记忆 | 最近运动趋势与碰撞线索 |
如果给定
信念状态是对隐藏世界的估计
在部分可观测环境中,智能体不能直接得到
信念状态带来三个直接收益:
- 补足隐藏变量:从连续观察中估计速度、方向和接触。
- 携带不确定性:区分“我知道它在哪里”和“两个位置都有可能”。
- 支持决策:规划器可以避开不确定性高且代价昂贵的动作,也可以主动收集信息。
预测与校正
状态估计反复执行两个步骤。首先,模型根据上一步信念和动作预测当前状态:
然后,新观察到来,模型用它校正预测:
预测步回答“按照已有动力学,现在大概到了哪里”。校正步回答“看到新证据后,哪些可能状态更可信”。卡尔曼滤波、粒子滤波和现代循环状态空间模型实现细节不同,但都在处理这个共同问题。
从信念状态到 RSSM
RSSM 不会显式存储环境的真实状态,也不会精确计算上面的贝叶斯积分。它用神经网络学习一个近似版本:
- 确定性隐藏状态
汇总过去的状态、动作与观察信息。 - 先验
在不看当前观察时预测潜在状态。 - 后验
用当前观察校正这次预测。
因此,后面看到“先验用于想象、后验用于训练”时,不应把它当成一条孤立的网络技巧。它是预测与校正循环在深度世界模型中的实现。
需要注意的是,拼接最近
对 P01 和 P02 的影响
P01 训练的 VAE 只能保证潜在变量有助于重建当前观察。它不自动保证潜在变量包含速度,也不保证它是适合预测的状态。检查 P01 时,除了看重建图,还要问:位置、运动方向和任务相关变量能否从潜在表示中稳定读出?
P02 的 RSSM 接手时间维度。它必须用历史记忆补足单帧缺失的信息,并学习在没有新观察时继续预测。P01 回答“这一帧怎样编码”,P02 才开始回答“隐藏世界现在处于什么状态,以及下一步会怎样”。
回到照片,闭合这个循环
上面出现的每一个概念,信念分布、预测-校正循环、RSSM 的先验与后验,都是在回答这一页开头提出的同一个问题:只看这张小球的静止照片,还缺什么信息,模型又该怎样把它找回来。接下来的两页会回到同一张照片,分别说明这些缺失的信息在编码时可能在哪里被丢掉,又该如何仅凭历史让动力学模型把它重新构造出来。
检查理解
- 两张像素完全相同的图像,为什么可能对应不同的环境状态?请给出一个隐藏变量。
- 在 RSSM 中,
、先验和后验分别对应状态估计循环中的什么角色? - 设计一个小测试,判断 P01 的潜在表示是否保留了物体速度,而不只保留了位置。