Skip to content

选读前沿:空间 3D/4D 世界模型

架构六:空间 3D/4D 世界模型

代表系统:NeRF (2020)、3D Gaussian Splatting (2023)、4D Gaussian Splatting 及动态场景扩展 (2024+)

JEPA 改变的是预测什么:从像素变成语义表示。空间 3D/4D 模型改变的是预测发生在哪里:状态不再是一个扁平潜向量或 2D 像素网格,而是显式的 3D 场景几何表示,预测直接作用在这个几何结构上。

扁平潜向量会丢失什么

前面讲过的 RSSM、Transformer、Diffusion 骨干网络都把观测当作 2D 图像(或图像序列),压缩成一个向量或 token 网格。这对由 2D 视觉模式定义的控制任务(比如 Atari、DMControl)效果很好,但对一类特定失效模式效果较差:物体恒存性(object permanence,一个物体被短暂遮挡、移出画面或从新角度观察时,仍应被理解为存在且保持原位置)和多视角一致性(同一个真实场景从不同相机位置观测,解码出的结构应当几何一致)。2D 潜向量没有显式的"物体在 3D 空间中的位置"概念,因此没有任何机制强迫模型的预测遵守"被遮挡的物体并未消失"这条物理约束。

空间世界模型的解法是让潜状态本身拥有真实的 3D 结构。

核心机制:直接表示几何结构

📖 相机几何基础相机位姿(camera pose)指定相机在 3D 空间中的位置和朝向,通常用一个旋转矩阵和一个平移向量表示。深度(depth)是相机到场景中每个点的距离,每个像素对应一个深度值。给定某像素的深度和相机位姿,就能把该像素反投影为一个 3D 点。点云(point cloud)是这样一组 3D 点的集合,点与点之间没有连接关系。这些量让系统可以在"从这个视角看场景是什么样"和"这个点在世界中的位置"之间转换,而这是扁平潜向量若不隐式学习这种关系就做不到的。

两种代表性方法把 3D 结构显式化并使其可学习:

NeRF(Neural Radiance Fields,神经辐射场,Mildenhall et al., 2020)把场景表示为一个连续函数:给定一个 3D 点和观察方向,神经网络输出颜色和密度。从某个相机位姿渲染图像的做法是:为每个像素投射一条穿过场景的射线,沿射线采样若干点,再对这些点预测的颜色和密度做积分,这个过程称为体渲染(volume rendering)。场景表示 Θ 就是网络权重,渲染公式为 I=Renderer(Θ,c),其中 c 是相机位姿,与 L01 九宫格表中出现的公式相同。NeRF 的代价很高:渲染一张图像需要对每条射线上的多个采样点分别做网络前向计算。

3D Gaussian Splatting(3D 高斯泼溅,Kerbl et al., 2023)用一组显式的 3D 高斯代替隐式神经函数,每个高斯有位置、协方差(形状与朝向)、颜色和不透明度。渲染时把这些高斯投影到图像平面并混合,比体渲染便宜得多,能做到实时渲染速率。由于高斯集合是显式、可编辑的,而非不透明的网络权重,原则上可以对单个物体做操作或跨时间追踪。

从 3D 到 4D:加入时间维度

静态的 NeRF 或静态高斯场景回答的是"这个场景长什么样",这在 L01 的分类体系中只是 L1 压缩能力,还不是动力学模型。4D 扩展加入了时间或状态维度:每个高斯(或辐射场本身)被允许随时间形变,条件是观测到的轨迹,或在动作条件设定下,条件是智能体的动作。这产生了场景流(scene flow),是光流在 3D 空间中的对应物:一个逐点的速度场,描述场景各部分在帧间如何运动。向前预测场景流,就是 L02 中动力学预测 zt+1=Predictor(zt) 在 3D/4D 世界模型中的版本,区别只在于被向前滚动的表示是显式 3D 几何,而非抽象向量。

📖 通过多视角一致性获得物体恒存性:3D 表示天然在视角之间共享,因为它是同一份底层几何,只是被不同相机位姿渲染成不同结果。如果模型维护的是一个一致的 3D/4D 状态,而非逐帧独立预测,那么一个被移动相机短暂移出视野的物体,在重新出现时不需要被"重新发现"。这是相对于逐帧 2D 预测的一个结构性优势:后者没有任何机制强迫遮挡前后的两帧保持一致(L03“骨干选择”中提到 Diamond 逐帧扩散过程存在物体持续性弱点,同样的问题适用于任何纯 2D 逐帧预测器)。

学习范式:以观察型为主。大多数 NeRF 和 3DGS 训练是从多视角图像或视频中重建静态或被动观测到的动态场景,不需要动作标签。机器人和自动驾驶研究中存在动作条件的 4D 世界模型(预测场景在给定机器人或车辆动作后如何形变),但成熟度不及“骨干选择”中介绍的 2D 动作条件骨干网络。

适用场景:自动驾驶感知与预测(鸟瞰图占据栅格预测是完整 4D 场景建模的一个粗粒度、体素化的近亲)、精确 3D 物体位姿至关重要的机器人操作,以及任何把多视角一致性或物体恒存性当作首要需求而非附带收益的场景。

局限:表示和渲染显式 3D 几何比扁平潜向量消耗更多计算和内存,训练通常需要多视角数据(同一场景的多个相机角度)或精确的相机位姿标注,二者都比单视角视频更难大规模采集。相对于被动重建,动作条件的 4D 动力学预测仍是一个活跃的研究问题,而非已解决的组件。

接下来:Genie

空间 3D/4D 模型改变了表示的几何结构,但训练大多仍是观察型的。下一页回到 2D 设定,追问一个不同的问题:模型能否纯粹从无标注视频中发现动作本身,既没有 3D 结构,也没有任何动作标签?

延伸阅读