与模型名称无关的诊断框架
世界模型是一组连接观测、潜在状态、预测未来、任务信号与动作的接口。评估只有先问哪个接口失效,再问应该报告什么指标,才具有跨模型迁移能力。
六个诊断问题
| 层级 | 核心问题 | 应收集的证据 | 总回报可能掩盖的故障 |
|---|---|---|---|
| 表示 | 潜在状态是否保留任务需要区分的信息? | 探针准确率、潜在方差与秩、扰动测试 | 表示崩塌或被无关因素主导 |
| 单步动力学 | 转移是否预测了动作的即时效果? | 留出转移、奖励与终止误差。相反动作测试 | 忽略动作的预测 |
| 长时程 rollout | 当预测继续作为输入时,误差是否仍受控? | 误差随时程变化曲线、自由 rollout、身份与几何跟踪 | teacher-forcing 差距与漂移 |
| 任务信号 | 奖励、价值与 continuation 估计是否对真实结果校准? | 奖励相关性、价值误差、校准曲线、分布外切片 | 视觉准确但对决策无用的未来 |
| 规划器或策略 | 预测价值是否改善了真实动作选择? | 搜索增益、规划效率、真实与想象回报差距、漏洞利用测试 | 优化模型缺陷 |
| 部署闭环 | 感知、时序、控制、不确定性与安全假设能否离开数据集后成立? | 延迟、人工介入、迁移、不确定性覆盖、约束违反 | 学习模型模块之外的故障 |
没有单一指标能覆盖全部六层。FID 与 PSNR 能说明观测预测,却几乎不能说明动作因果。episode return 检验完整闭环,却无法定位故障。因此,有用的评估套件必须同时包含局部测试与端到端测试。
按依赖顺序诊断
- 验证表示的多样性与任务相关性。
- 在留出数据上测试单步转移,包括只改变动作的干预测试。
- 运行自由 rollout,并绘制误差随时程变化的曲线。
- 用真实结果检验奖励、价值与终止预测。
- 比较规划前后的动作排序,再到真实环境验证所选动作。
- 在部署分布偏移下测量校准、延迟、安全约束与人工介入。
在第一处失效层停下来。下游分数仍可记录,但在上游缺陷得到控制前,不应据此选择修复方案。
三种评估情形
- 同分布轨迹用于验证基本实现是否正确。
- 策略偏移轨迹由更新或优化更强的策略采集,用于揭示模型漏洞利用与 replay 过期。
- 机制偏移轨迹改变物体组合、动力学参数、延迟或动作幅度,用于检验因果泛化。
每种情形都应按 rollout 时程与不确定性分层报告。否则,平均值会掩盖模型只在常见单步转移上可靠,却在罕见长时程情形中不安全。
最小评估记录
保存模型检查点、数据集或环境版本、数据采集策略版本、随机种子、时程、动作分布、指标实现与逐 episode 原始结果。缺少这些字段时,分数无法复现,也无法归因到组件变化。
后续页面是这套框架的应用实例:Dreamer 强调表示与任务信号,TD-MPC 强调潜在一致性与规划效率,MuZero 强调价值与搜索,STORM 强调自由运行的自回归 rollout,Diamond 强调物理一致性与动作条件保真度。