真实部署评测:超越论文指标
前面五个模型的指标框架都是在受控实验室环境下设计的,你有干净的数据集、可重复的仿真环境、充足的计算资源来反复运行对照实验。但当世界模型进入真实部署时,一切都会变得更加复杂。
为什么论文指标不够
FID(Fréchet Inception Distance,图像特征分布距离,越低越好)、FVD(Fréchet Video Distance,视频序列动态质量,越低越好)、PSNR(Peak Signal-to-Noise Ratio,峰值信噪比,越高越好)告诉你模型"预测准不准",但它们回答不了以下问题:
- Policy 在世界模型里学到的动作,能不能在真实机器人上被硬件执行?
- 传感器延迟和异步性会不会让世界模型的时序假设失效?
- 当世界模型在某个状态下不确定时,系统能不能识别出来并安全地请求人工接管?
真实部署里,world model 只是长链条中的一环:
完整控制链依次经过六个环节:传感器输入状态估计,状态估计输入世界模型,世界模型输入规划器/策略,策略输入低层控制器,低层控制器驱动执行器。论文指标只衡量"世界模型"这一个盒子的质量,其他任何环节失效都会导致系统整体失效。
链条中任何一个环节的失效都会导致系统失效,而论文指标只衡量了"world model"这一个盒子的输入输出质量,不衡量整个链条的可靠性。
真实部署应该记录和评估什么
动力学质量
- one-step prediction error:短期动力学是否准确
- multi-step rollout error:长程是否漂移(5/10/20 步)
- contact event accuracy:是否正确预测接触、滑动、掉落、卡住
不确定性与可靠性
- uncertainty calibration:高不确定是否真的对应高误差,用 Expected Calibration Error (ECE) 衡量。
📖 校准(calibration):模型预测"我有 80% 把握"时,真实准确率是否也接近 80%?校准好的模型,置信度 = 实际准确率。ECE = 按置信度分桶后,各桶内置信度与实际准确率差值的加权均值,越低越好。
策略迁移
- policy transfer gap:模型里学到的策略迁移到真机后的累计奖励损失(sim-to-real gap)
人机协作
- intervention rate:每小时需要多少次人工接管
- failure recovery rate:失败中间态能否恢复
系统性能
- latency:从观测到动作是否满足控制频率(real-time factor: sim_speed / real_speed ≥ 1)
数据与计算预算:一种部署约束
以上讨论都假定模型本身是可训练出来的,而这本身就是一个值得记录的系统级约束。三个因素决定世界模型能否达到任务所需的规模:
- 数据混合比例:训练数据通常混合多种来源,成本和覆盖面差异很大:被动采集的视频(便宜、量大,但无动作标签)、带动作标签的视频或遥操作演示(昂贵、精确)、仿真 rollout(便宜且可无限重复,但存在 sim-to-real gap)、真实机器人轨迹(最贴近真实,但最稀缺)。混合比例是需要刻意权衡的设计决策,而非事后补充:仿真数据占比过高,模型可能从未见过真实传感器噪声。带动作标签的数据占比过低,动作条件监督会不足。
- Tokenizer 吞吐量:对 L03“骨干选择”中的 Transformer 和 diffusion 骨干网络而言,视频 tokenizer 的编解码速度既决定了训练迭代速度的硬性下限,如果 tokenizer 在推理时也要运行,还会决定闭环控制的延迟。压缩得越激进,训练越快,但丢失的视觉细节也越多,这正是 L02 中 VAE 编码器"重建质量 vs. 压缩率"权衡在系统规模上的重演。
- 计算分配:在固定计算预算下,花在 tokenizer 或编码器上的参数量,就是没有花在动力学模型或策略上的参数量,反之亦然。不存在普遍正确的分配方式。正确的分配取决于本讲前面介绍的诊断层级中,当前哪个组件的误差占主导。如果表示层诊断显示信息丢失,就该多投入编码器。如果长程 rollout 是瓶颈,就该多投入动力学模型。
这些数字都不会出现在 benchmark 排行榜上,但一个无法在自身数据和计算预算内被重新训练的系统,部署后就无法保持更新,这使其成为一个部署问题,而非纯粹的学术问题。