跳到主要内容

查看 Markdown

页面正文已转为 Markdown。交互图形可通过文末链接在原网页查看。

1. 什么是具身智能

1.1 定义​

具身智能(Embodied AI)是指将人工智能技术集成到具有物理实体(如机器人、智能汽车等)的系统之中,让 AI 通过“身体”的感知、决策与行动闭环与真实物理世界进行动态交互。

这个定义里有三个关键词:

  • 身体:智能体有传感器和执行器,既能观察环境,也能改变环境。身体通常是真实的机器人;在研究和训练中,也可以是仿真里的虚拟机器人。
  • 交互:智能体的动作会改变环境,环境的变化又决定它下一步看到什么。
  • 闭环:感知、决策、行动持续循环,而不是看一眼、给出一个答案就结束。

1.2 感知—决策—行动闭环​

以机器人踢足球为例,目标是把球踢进球门,同时保持身体平衡:

具身智能 · 信息与动作的闭环

从观察世界,到改变世界

点选一个环节,查看它的输入、处理与输出。

持续循环

机器人内部

外部环境

感知与理解

世界和自己,现在是什么状态?

输入
相机图像、关节角度与身体姿态。
处理
识别足球、球门和守门员,估计它们相对机器人的位置。
输出
场景与身体的状态估计。

在足球场上看见足球在前方,守门员挡住了球门右侧。

按信息流理解系统;真实机器人中的各环节以不同频率持续运行。

这个循环不会只转一圈。踢球的整个过程中,机器人一直在重复它,而且各环节的节奏不同:识别球和球门的视觉模块每秒可能更新几十次,关节控制器每秒可能更新几百到上千次。

下面的 3D 演示可以旋转视角、调整播放速度,逐步观察这个闭环:

机器人足球 · 3D 闭环演示

让机器人把球踢进球门

射门机器人守门员

正在准备 3D 球场…

新的观测,再次进入感知

感知摄像头捕捉场上信息,识别足球、球门和守门员的位置。
可播放或点击阶段逐步查看。移动守门员会重新开始演示,观察射门方向如何变化。动作已简化,用来理解闭环。

“感知、决策、行动”是按功能理解系统的方式。实际系统可以由多个模块分工协作,也可以用一个模型同时承担几种功能。

1.3 有了身体,问题就变了​

许多 AI 系统处理的是已经采集好的数据:输入一张图片,输出一个标签;输入一段文字,输出一段回答。具身智能体则要在环境中行动,这带来几个根本差别:

对比项处理静态数据的 AI具身智能
数据从哪里来已采集的数据集,模型被动接收自己的动作决定下一刻看到什么
输出是什么标签、文字或图像作用于物理世界的动作
出错的后果通常可以重新生成可能摔倒、打碎物体或发生碰撞,而且难以撤销
时间要求可以离线计算,慢一点也能接受必须在控制周期内给出动作,否则机器人会失稳或错过时机
数据规模互联网上有海量文本和图像机器人交互数据需要专门采集,成本高、规模小

这些差别解释了为什么大模型在对话和写作上进步很快,让机器人稳定地叠衣服、做家务却仍然困难。第 5 章 会逐一讨论这些难题。

莫拉维克悖论​

1988 年,机器人学家汉斯·莫拉维克(Hans Moravec)指出:让计算机在智力测验或西洋跳棋上达到成人水平相对容易,让它具备一岁孩子的感知和行动能力却非常困难,甚至不可能。这个现象后来被称为莫拉维克悖论(Moravec's paradox)。

莫拉维克的解释是:感知和运动能力经过了极其漫长的进化,已经高度优化,人做起来毫不费力,也意识不到其中的难度;抽象推理出现得晚得多,反而更容易写成明确的规则。对具身智能来说,这意味着“看起来简单”的动作往往最难,比如拿起一只从没见过的杯子,或者在湿滑的地面上保持平衡。

1.4 身体决定了能学什么​

同一个算法,放在不同的身体上,能做的事情可能完全不同:

  • 传感器决定观测:只有顶部相机时,机械臂可能看不清夹爪附近的细节;加装腕部相机后,近距离操作会更容易。
  • 执行器决定动作:平行夹爪适合抓取形状规则的物体;转笔、拧瓶盖这类手内操作需要灵巧手。
  • 形态决定能去哪里:轮式底盘在平地上高效,却上不了楼梯;足式机器人能跨越台阶,控制也更复杂。

因此,讨论一个具身智能方法时,要先说清楚它用在什么身体上。第 4 章 介绍常见的机器人载体。

1.5 具身智能与机器人学​

机器人是具身智能最重要的载体。两个领域高度重叠,侧重点不同:

  • 机器人学研究机器人的设计、建模、感知、规划与控制,提供运动学、动力学、状态估计和控制理论等基础。
  • 具身智能强调智能、身体与环境之间的协同,关注智能体怎样通过交互学会完成任务,并在新物体、新环境和新指令下泛化。

今天的具身智能研究,通常把机器人学的建模与控制方法,和机器学习的数据驱动方法结合起来。本站的 理论基础 同时覆盖这两类知识。

除了机器人,自动驾驶汽车、无人机,以及在仿真环境中学习导航和操作的虚拟智能体,也常被纳入具身智能的研究范围。本站以机器人为主线。

小结​

  • 具身智能研究智能体怎样依托身体,在感知、决策与行动的闭环中与环境交互,完成任务。
  • 与处理静态数据的 AI 相比,具身智能要主动获取信息,承担动作的物理后果,满足实时要求,还要面对数据稀缺。
  • 身体决定了观测、动作和能到达的环境。讨论方法时,先说明它用在什么身体上。

继续阅读​

参考​

  1. NVIDIA:什么是具身智能?
  2. Hans Moravec. Mind Children: The Future of Robot and Human Intelligence. Harvard University Press, 1988.