思想基石
第一块基石:Craik 的微型模型(1943)
英国心理学家 Kenneth Craik 在二战期间写下了一本薄薄的书《The Nature of Explanation》[1]。他提出了一个超前于时代的想法:
"如果有机体在颅骨内携带了一个外部现实的'小尺度模型',它就能在应对紧急情况之前预先试验各种可能性。"
Craik 认为,大脑不是被动接收刺激、被动输出反应的黑盒,而是主动维护一个内部模拟器。这个模拟器可以"快进"未来、"回放"过去,让生物在真实代价发生之前就筛选出最佳行动。
感知输入内部模型,内部模型生成预测并引导决策,预测误差反过来修正模型。
遗憾的是,Craik 在 1945 年的一次自行车事故中去世,年仅 31 岁。他的思想沉寂了数十年,直到认知科学和神经科学的兴起,才重新被人们发现。
大脑的预言机制:预测编码(1990s)
1990 年代,神经科学家开始用**预测编码**(Predictive Coding)来解释大脑的工作方式。
核心思路出人意料地简单:
大脑不是在"看"世界,而是在预测世界,然后只处理"预测错了的部分"。
视觉皮层并不是老老实实地把每一个像素从眼睛传到大脑,那太耗能了。相反,大脑高层持续向低层"下发预测",低层只需要把预测与实际感官信号的误差往上传。
如果你走进一个熟悉的房间,大脑几乎不需要处理任何信息,因为一切都在预期之内。但如果椅子换了个位置,那个"错位"的信号会立刻被放大、引起注意。
这个机制解释了为什么我们对变化如此敏感,对熟悉的背景又如此健忘,预测准确的部分被压缩掉了,只有误差才值得关注。
控制理论的洞见:内模原理(1960s)
几乎同一时期,控制工程领域也独立发现了类似的思想。1960 年代,内模原理(Internal Model Principle)被正式提出:
要实现对某个系统的完美控制,控制器内部必须包含该系统的一个模型。
这听起来像是工程术语,但直觉极其清晰:自动驾驶汽车要在弯道上保持车道,它的控制算法必须"知道"车辆在弯道上的动力学行为,不是靠反应,而是靠预判。
这条原理在机器人、航天器、经济模型中无处不在,也成为后来强化学习中"基于模型的方法"的理论根基。想控制某件事,先得理解它,内模原理把这句常识变成了数学上的必要条件。
质疑者的回应,与 2025 年的一个证明
并非所有人都认同这个方向。1991 年,机器人学家 Rodney Brooks 在《Intelligence without Representation》中提出了相反的主张:"世界本身就是自己最好的模型"。他的观点是,智能体根本不需要携带环境的内部模型,只要靠感知与行动之间紧密的反射回路就能表现出智能行为,让真实世界本身充当一张永远最新的地图。这不仅仅是一种哲学立场,几十年来,model-free 智能体确实在没有人为它内置任何显式世界模型的情况下,在多样化任务上展现出了泛化能力,这让 Brooks 的质疑很难被轻易驳倒。
2025 年,Google DeepMind 的研究者用一个证明而不是又一轮论战回答了这个问题。在《General Agents Need World Models》一文中,Richens、Abel、Bellot 与 Everitt 证明:任何能够泛化到广泛目标范围的智能体,必然已经隐式学到了一个能预测其所处环境的模型,并且这个模型总能仅从智能体的行为中被还原出来,完全不需要窥探它的内部结构。Craik 在 1943 年的直觉,原来不只是一个关于大脑的比喻,而是一条关于现代学习型智能体的定理。
📖 给感兴趣读者的证明细节:论文将环境形式化为一个转移函数为
的受控马尔可夫过程,并考虑一个有界的目标条件智能体,即在深度不超过 的复合目标上,其失败率相对最优策略最多为 。核心结果是:这样一个智能体的策略本身就唯一确定了一个世界模型 ,其误差上界为 。随着智能体越来越胜任( )或需要处理更长时程的目标( 增大),可还原出的世界模型也会越来越精确:学到一个足够通用的策略,在信息论意义上等价于学到一个精确的世界模型。论文还给出了一个提取算法:只需用一对"非此即彼"的目标去询问智能体,例如"在 次尝试内达成状态"对比"超过 次尝试才达成",观察智能体更偏好哪一个,就能读出其隐含的转移概率。这个结果只对规划多步时程的智能体成立,一个只优化即时奖励的短视智能体原则上可以不学习世界模型,因为它从不需要预测长期后果。它也并未推翻 Brooks,而是为其主张划定了边界:只面对短时程目标的智能体确实可以不依赖丰富的内部模型,但任何能泛化到广泛长时程目标的智能体都无法回避构建一个。
对这门课程的实际启示是:当后面某一讲展示某个系统在某个基准上取得胜利、却看不到任何人为设计的显式世界模型时,正确的问题不是"它有没有世界模型",而是"它藏在哪里"。现在已知,一个足够胜任的目标导向策略,包括由 LLM 产生的策略,都会编码一个可被还原出来的环境模拟,哪怕从来没有人专门训练它去做这件事。
一个容易混淆的问题:广义 vs 狭义世界模型
在真正进入历史叙事之前,有一个概念边界必须先说清楚,因为后面的每一个例子都会涉及它:"世界模型"这个词,在不同语境下指的不是同一件事。
广义世界模型:只要能预测,就能叫
广义地说,任何能预测"接下来会发生什么"的模型,都可以被称为世界模型。
- 语言模型预测下一个 token(语言模型处理文本的基本单元,可以是一个词、一个字或一个子词片段),属于广义世界模型
- 视频生成模型预测下一帧,属于广义世界模型
- 天气预报模型预测明天气温,属于广义世界模型
按照这个定义,Veo、Sora、Genie、Cosmos 都可以放进"世界模型"这把大伞下。它们确实在某种意义上学到了世界的统计规律:光影如何变化,物体如何运动,场景如何演进。
狭义世界模型:必须是 action-conditioned
但在机器人学和强化学习(Reinforcement Learning, RL)的语境里,"世界模型"有更严格的含义:它必须以动作为条件。
不只是"下一帧长什么样",而是"我做了这个动作之后,世界会怎么变"。用公式表达:
📖 下标约定:公式中的下标
t表示时间步(time step),是一个离散的计数器:t=0是第一步,t=1是第二步,以此类推。读作"时刻 t 的观测"(observation), 读作"时刻 t 的动作"(action), 读作"下一时刻的观测"。这套下标记法贯穿整个课程:凡是带 t下标的变量,都指该时间步的值;带t+1的,指下一步的值。
这里 a_t 是智能体在时刻 t 执行的动作。这一个条件的存在,让世界模型从"旁观者"变成了"参与者",它不仅能告诉你世界会怎样,还能告诉你你的选择会带来什么后果。
广义世界模型是个预言家,告诉你"未来会发生什么";狭义世界模型是个顾问,告诉你"如果你这么做,未来会发生什么"。机器人需要顾问,不只是预言家。
三个实用分类问题
面对一个具体的模型,可以用三个问题快速判断它属于哪种世界模型:
| 分类维度 | 选项 | 代表系统 |
|---|---|---|
| 预测什么? | 像素 / 原始帧 | 视频扩散模型 |
| latent 向量(网络内部低维压缩表示) | Dreamer(一种在潜在空间训练策略的强化学习系统,详见 L02–L03)、RSSM(Dreamer 的动力学核心,详见 L02) | |
| 结构化状态(不含像素,只保留决策所需信息) | MuZero、TD-MPC | |
| 动作本身(从视频自动推断的 latent action) | Genie | |
| 是否接受动作? | 不接受 → 被动视频预测 | Veo |
| 接受给定动作 → 可控仿真 | Dreamer、世界模型机器人 | |
| 自己学动作 → latent action | Genie | |
| 服务什么目的? | 生成内容(视频、图像) | Veo |
| 评估策略 / 反事实仿真 | 自动驾驶测试 | |
| 在梦境中训练 policy | Dreamer、Ha&Schmidhuber | |
| 理解物理、迁移知识 | JEPA、基础世界模型 |
这门课程聚焦的是狭义世界模型,action-conditioned、可以用于规划和 policy 学习的动力学模型。
