Skip to content

与模型名称无关的诊断框架

世界模型是一组连接观测、潜在状态、预测未来、任务信号与动作的接口。评估只有先问哪个接口失效,再问应该报告什么指标,才具有跨模型迁移能力。

六个诊断问题

层级核心问题应收集的证据总回报可能掩盖的故障
表示潜在状态是否保留任务需要区分的信息?探针准确率、潜在方差与秩、扰动测试表示崩塌或被无关因素主导
单步动力学转移是否预测了动作的即时效果?留出转移、奖励与终止误差。相反动作测试忽略动作的预测
长时程 rollout当预测继续作为输入时,误差是否仍受控?误差随时程变化曲线、自由 rollout、身份与几何跟踪teacher-forcing 差距与漂移
任务信号奖励、价值与 continuation 估计是否对真实结果校准?奖励相关性、价值误差、校准曲线、分布外切片视觉准确但对决策无用的未来
规划器或策略预测价值是否改善了真实动作选择?搜索增益、规划效率、真实与想象回报差距、漏洞利用测试优化模型缺陷
部署闭环感知、时序、控制、不确定性与安全假设能否离开数据集后成立?延迟、人工介入、迁移、不确定性覆盖、约束违反学习模型模块之外的故障

没有单一指标能覆盖全部六层。FID 与 PSNR 能说明观测预测,却几乎不能说明动作因果。episode return 检验完整闭环,却无法定位故障。因此,有用的评估套件必须同时包含局部测试与端到端测试。

按依赖顺序诊断

  1. 验证表示的多样性与任务相关性。
  2. 在留出数据上测试单步转移,包括只改变动作的干预测试。
  3. 运行自由 rollout,并绘制误差随时程变化的曲线。
  4. 用真实结果检验奖励、价值与终止预测。
  5. 比较规划前后的动作排序,再到真实环境验证所选动作。
  6. 在部署分布偏移下测量校准、延迟、安全约束与人工介入。

在第一处失效层停下来。下游分数仍可记录,但在上游缺陷得到控制前,不应据此选择修复方案。

三种评估情形

  • 同分布轨迹用于验证基本实现是否正确。
  • 策略偏移轨迹由更新或优化更强的策略采集,用于揭示模型漏洞利用与 replay 过期。
  • 机制偏移轨迹改变物体组合、动力学参数、延迟或动作幅度,用于检验因果泛化。

每种情形都应按 rollout 时程与不确定性分层报告。否则,平均值会掩盖模型只在常见单步转移上可靠,却在罕见长时程情形中不安全。

最小评估记录

保存模型检查点、数据集或环境版本、数据采集策略版本、随机种子、时程、动作分布、指标实现与逐 episode 原始结果。缺少这些字段时,分数无法复现,也无法归因到组件变化。

后续页面是这套框架的应用实例:Dreamer 强调表示与任务信号,TD-MPC 强调潜在一致性与规划效率,MuZero 强调价值与搜索,STORM 强调自由运行的自回归 rollout,Diamond 强调物理一致性与动作条件保真度。