Skip to content

观察、状态与信念

看一张小球位于桌面中央的照片,你无法判断它下一刻会向左还是向右。两段完全不同的运动轨迹可以产生同一张照片。单帧告诉了我们小球在哪里,却没有告诉我们它的速度、刚才是否发生碰撞,也没有告诉我们画面外是否有人正在推动它。

这个例子揭示了世界模型的第一个建模问题:模型接收的是观察,但需要推断的是足以预测未来的状态。

读完本页,你应该能够区分观察、环境状态和信念状态,解释为什么记忆是状态估计的一部分,并把经典的“预测与校正”循环对应到 RSSM 的先验与后验。

同一观察可以通向不同未来

环境在时刻 t 的完整状态记为 st。它可能包含物体位置、速度、质量、接触关系,以及智能体无法直接看到的其他变量。智能体真正收到的是观察 ot,例如一张图像或一组传感器读数。动作 at 改变环境状态,环境状态再产生下一次观察:

st+1penv(st+1st,at),otpobs(otst)

这两个分布分别描述“世界怎样变化”和“世界怎样被看见”。观察可能比状态的数值维度更高,例如图像包含成千上万个像素,但它仍可能缺少预测所需的变量。因此,高维不等于完整。

变量含义在像素控制任务中的例子
st环境的隐藏状态位置、速度、接触状态
ot传感器提供的观察一帧 RGB 图像
at智能体施加的动作向左或向右推动
ht模型压缩后的历史记忆最近运动趋势与碰撞线索

如果给定 stat 后,更早的历史不再改善对 st+1 的预测,那么 st 满足马尔可夫性质。原始观察通常不满足这个条件。只看一帧图像,速度仍然未知。

信念状态是对隐藏世界的估计

在部分可观测环境中,智能体不能直接得到 st,只能根据观察和动作历史维护一个信念状态:

bt(s)=p(st=so1:t,a1:t1)

bt 不是某个确定答案,而是模型对当前可能状态的概率判断。同一张静止画面既可能来自向左运动的小球,也可能来自向右运动的小球。历史越充分,这个分布通常越集中。传感器含噪或物体被遮挡时,保留分布比只保留一个点估计更诚实。

信念状态带来三个直接收益:

  1. 补足隐藏变量:从连续观察中估计速度、方向和接触。
  2. 携带不确定性:区分“我知道它在哪里”和“两个位置都有可能”。
  3. 支持决策:规划器可以避开不确定性高且代价昂贵的动作,也可以主动收集信息。

预测与校正

状态估计反复执行两个步骤。首先,模型根据上一步信念和动作预测当前状态:

bt(st)=p(stst1,at1)bt1(st1)dst1

然后,新观察到来,模型用它校正预测:

bt(st)p(otst)bt(st)

预测步回答“按照已有动力学,现在大概到了哪里”。校正步回答“看到新证据后,哪些可能状态更可信”。卡尔曼滤波、粒子滤波和现代循环状态空间模型实现细节不同,但都在处理这个共同问题。

从信念状态到 RSSM

RSSM 不会显式存储环境的真实状态,也不会精确计算上面的贝叶斯积分。它用神经网络学习一个近似版本:

  • 确定性隐藏状态 ht 汇总过去的状态、动作与观察信息。
  • 先验 p(ztht) 在不看当前观察时预测潜在状态。
  • 后验 q(ztht,ot) 用当前观察校正这次预测。

因此,后面看到“先验用于想象、后验用于训练”时,不应把它当成一条孤立的网络技巧。它是预测与校正循环在深度世界模型中的实现。

需要注意的是,拼接最近 K 帧只能给模型更多证据,不能自动保证得到马尔可夫状态。判断表示是否充分,仍要测试:给定该表示和动作后,更早的历史是否还能显著改善未来预测。

对 P01 和 P02 的影响

P01 训练的 VAE 只能保证潜在变量有助于重建当前观察。它不自动保证潜在变量包含速度,也不保证它是适合预测的状态。检查 P01 时,除了看重建图,还要问:位置、运动方向和任务相关变量能否从潜在表示中稳定读出?

P02 的 RSSM 接手时间维度。它必须用历史记忆补足单帧缺失的信息,并学习在没有新观察时继续预测。P01 回答“这一帧怎样编码”,P02 才开始回答“隐藏世界现在处于什么状态,以及下一步会怎样”。

回到照片,闭合这个循环

上面出现的每一个概念,信念分布、预测-校正循环、RSSM 的先验与后验,都是在回答这一页开头提出的同一个问题:只看这张小球的静止照片,还缺什么信息,模型又该怎样把它找回来。接下来的两页会回到同一张照片,分别说明这些缺失的信息在编码时可能在哪里被丢掉,又该如何仅凭历史让动力学模型把它重新构造出来。

检查理解

  1. 两张像素完全相同的图像,为什么可能对应不同的环境状态?请给出一个隐藏变量。
  2. 在 RSSM 中,ht、先验和后验分别对应状态估计循环中的什么角色?
  3. 设计一个小测试,判断 P01 的潜在表示是否保留了物体速度,而不只保留了位置。