章节目录
本页目录
2. 发展脉络
具身智能不是突然出现的新概念。它的核心思想可以追溯到早期的人工智能与机器人研究;今天的热度,来自深度强化学习、大规模仿真和大模型的共同推动。本章围绕一个问题梳理这段历史:机器人的能力从哪里来。
四个时期概览
| 时期 | 时间 | 核心方法 | 代表工作 |
|---|---|---|---|
| 规则编程时期 | 1960s–1990s | 人写规则:先是符号推理,后来行为主义改用反应式规则,并提出“具身”观点 | Shakey、A*、STRIPS、包容式架构 |
| 模型控制时期 | 1990s–2010s | 用物理模型和概率模型估计状态、规划路径、控制运动 | SLAM、Stanley、ZMP、MPC、ROS |
| 深度强化学习时期 | 2012–2021 | 在仿真或真实环境中试错,学会控制策略;深度学习同时提升了感知 | 端到端视觉运动策略、QT-Opt、灵巧手转魔方、ANYmal、legged_gym |
| 大模型时期 | 2022 年至今 | 预训练大模型带来语言理解和通用能力,和底层控制分工协作 | SayCan、RT-2、Open X-Embodiment、π0 |
时期划分的是这个时期出现的主要能力来源,不代表前一时期的方法就过时了。今天的机器人仍然大量使用规划与控制;足式运动控制仍以深度强化学习为主,VLA 也开始用强化学习从部署经验中继续提升能力。
2.1 规则编程时期(1960s–1990s)
这一时期,机器人的能力来自人写的规则:先是用符号和逻辑做推理,后来行为主义改用直接对环境作出反应的规则,并提出了“具身”这个观点。
符号推理:感知—规划—行动
1966 年到 1972 年,斯坦福研究院(SRI)研制了 Shakey,它被认为是第一台能对自身行动进行推理的移动机器人。Shakey 用相机和测距传感器感知环境,把环境表示成符号,再用规划器搜索动作序列。为 Shakey 发展出的 A* 搜索算法和 STRIPS 规划器,至今仍是路径规划和任务规划的基础。
这种“先感知、建立世界模型、再规划、最后执行”的流程,被称为感知—规划—行动(Sense–Plan–Act)范式。它的问题在于:环境一变,世界模型就要重建;规划很慢,机器人常常要停下来“想”很久;符号化的世界模型也很难描述真实世界的全部细节。
行为主义与“具身”观点
1980 年代,麻省理工学院的罗德尼·布鲁克斯(Rodney Brooks)提出了不同的思路。他设计的包容式架构(subsumption architecture)不建立完整的世界模型,而是把行为分成多层:底层负责避障这类反射式行为,上层在需要时抑制或调用下层。机器人直接对传感器信号作出反应,在真实环境中更快,也更稳健。
布鲁克斯主张,智能可以直接来自智能体与真实世界的交互,与其在机器人内部维护一份世界模型,不如把“世界本身当作最好的模型”。同一时期,研究者还发现身体形态本身就能承担一部分“计算”:被动动力学行走机器人没有电机和控制器,仅靠腿的结构和重力,就能沿缓坡稳定地走下去。
从此,“具身”(embodiment)成为人工智能与认知科学的重要主题:智能不只存在于算法中,也依赖身体和环境。
不过,无论是符号推理还是反应式行为,规则都要由人来设计,机器人很难应对设计者没有预料到的情况。
2.2 模型控制时期(1990s–2010s)
这一时期,机器人的能力来自对世界的数学建模:用概率模型描述传感器噪声和环境的不确定性,用物理模型描述机器人怎样运动。这里的“模型”指物理模型和概率模型,和后文“大模型时期”的大模型不是一回事。
真实传感器有噪声,环境也不完全可知。1990 年代起,概率方法成为机器人学的主流:卡尔曼滤波、粒子滤波用于估计机器人的状态;同时定位与建图(SLAM)让机器人在未知环境中一边建图、一边确定自己的位置。2005 年,斯坦福大学的自动驾驶汽车 Stanley 在 DARPA 大挑战赛中自主驶完约 212 公里的沙漠赛道并获胜,展示了概率感知与规划的实力。
控制方面,基于模型的方法不断成熟:零力矩点(ZMP)方法支撑了本田 ASIMO 等人形机器人的步行;模型预测控制(MPC)和全身控制让足式机器人能够奔跑、跳跃并抵抗扰动。2007 年开始开发的机器人操作系统 ROS,为机器人软件提供了通用的通信机制和工具链,大大降低了搭建系统的门槛。
这一时期的系统以模块化为主:感知、定位、规划、控制分别开发,接口清晰,在结构化环境中表现可靠。它的代价是每个模块都需要大量人工设计和精确建模,遇到新物体、新环境或难以建模的接触时难以适应。
2.3 深度强化学习时期(2012–2021)
2012 年前后,深度学习在图像识别上取得突破,机器人的感知能力随之大幅提升。更重要的变化发生在控制上:深度强化学习让机器人在仿真或真实环境中反复试错,自己学会控制策略,不再需要人写出每一条规则或建立精确的模型。
- 端到端视觉运动策略:2016 年,Levine 等人用一个神经网络直接把相机图像映射为机械臂的电机力矩,完成拧瓶盖、把衣架挂上横杆等任务。
- 在真实世界中学抓取:Google 用最多 14 台机械臂,在两个月里采集了 80 多万次抓取尝试,训练出能抓取新物体的模型;QT-Opt 进一步把深度强化学习用于基于视觉的抓取,在 58 万多次真实抓取数据上训练后,对没见过的物体达到 96% 的抓取成功率。
- 仿真训练、真机部署:OpenAI 在仿真中用强化学习训练机械手,借助域随机化把策略迁移到真实的灵巧手上,完成手内转动方块(2018)和单手还原魔方(2019);苏黎世联邦理工学院在 ANYmal 四足机器人上部署仿真训练的策略,实现了敏捷运动和复杂地形行走(2019–2020);2021 年的 legged_gym 借助 GPU 并行仿真,把平地行走策略的训练时间缩短到几分钟。
- 具身仿真平台与任务:AI2-THOR、Habitat 等仿真平台,以及点目标导航(PointNav)、物体目标导航(ObjectNav)、视觉语言导航(VLN)等任务,让研究者可以在虚拟的室内场景中大规模训练和评测导航智能体。
这一时期的核心转变是从人工设计每个模块,转向让机器人从数据和交互中学习。代价是对数据和算力的需求大增,奖励函数难以设计,仿真与真实之间存在差距,而且学到的策略往往只适用于训练时的任务和机器人。
2.4 大模型时期(2022 年至今)
2022 年以后,大语言模型和视觉语言模型的进展迅速进入机器人领域。机器人的能力越来越多地来自在海量数据上预训练的大模型,它们带来了语言理解、常识和跨任务的通用能力:
- 用语言模型做规划:SayCan(2022)让大语言模型把“我把饮料洒了,能帮忙吗?”这样的请求分解为机器人会执行的技能序列;Code as Policies(2022)让语言模型直接写出控制机器人的代码。
- 机器人 Transformer 与 VLA:RT-1(2022)用约 13 万条真实演示训练 Transformer 策略;RT-2(2023)把视觉语言模型训练成视觉-语言-动作模型(VLA),让机器人能理解训练数据中没有出现过的指令。
- 数据共享:Open X-Embodiment(2023)汇集了 22 种机器人的 100 多万条轨迹,推动跨机器人训练。
- 低成本模仿学习:ALOHA 与 ACT(2023)、Diffusion Policy(2023)表明,用几十到几百条示教数据就能学会精细的双臂操作,大幅降低了研究门槛。
- 开源与通用策略:OpenVLA(2024)等开源模型让社区能够复现和微调 VLA;π0(2024)、π0.5(2025)等模型用流匹配生成连续动作,并在陌生的家庭环境中完成收拾厨房、卧室等长时序任务。
- 世界模型:Genie、Cosmos、V-JEPA 2 等模型学习预测环境随动作怎样变化,用于规划、生成训练数据和评测策略。
在这类系统中,大模型通常负责理解任务、做出决策,底层控制器负责快速、稳定地执行,也就是常说的“大脑”与“小脑”分工。与此同时,GPU 并行仿真可以同时运行数千个环境,人形机器人等新平台不断出现,具身智能成为人工智能研究和产业中最受关注的方向之一。2022 年以来 VLA 的技术演进,详见 从 LLM 到机器人策略。
2.5 历史留下的线索
回顾这段历史,可以看到几条贯穿始终的线索:
- 模块化与端到端的取舍一直存在。从感知—规划—行动与行为主义之争,到模块化系统与端到端学习,再到今天层次式与单体式 VLA 的讨论,核心问题都是:系统应该拆成哪些部分,各部分之间传递什么信息。
- 能力的来源从人转向数据。从人写规则、人建模型,到从交互和海量数据中学习,数据的规模、质量和多样性逐渐成为效果的上限。
- 仿真一直是关键工具。从验证算法,到并行训练强化学习策略,再到用世界模型生成数据,仿真的角色不断扩展,仿真与真实之间的差距也始终存在。
- 身体的作用没有消失。同一个模型在不同机器人上表现不同,跨机体(cross-embodiment)学习仍是研究热点。
理论基础 按决策、控制、感知和工程模块整理了这些方法的学习入口。
小结
- 规则编程时期,机器人的能力来自人写的规则:先是符号推理与感知—规划—行动范式,后来行为主义强调智能来自身体与环境的交互,提出了“具身”观点。
- 模型控制时期,机器人用物理模型和概率模型做估计、规划与控制,模块化系统变得可靠,ROS 降低了系统搭建门槛。
- 深度强化学习时期,机器人通过试错学会控制策略;大模型时期,语言、视觉与动作进一步结合起来。
继续阅读
- 3. 机器人的技能:怎样定义一个机器人任务。
- 从 LLM 到机器人策略:2022 年以来 VLA 的技术演进。
- 世界模型:世界模型的三条技术路线与四种用法。
参考
- Nils J. Nilsson (ed.). Shakey the Robot. SRI International Technical Note 323, 1984.
- Rodney A. Brooks. A Robust Layered Control System for a Mobile Robot. IEEE Journal on Robotics and Automation, 1986.
- Rodney A. Brooks. Elephants Don't Play Chess. Robotics and Autonomous Systems, 1990.
- Rodney A. Brooks. Intelligence without Representation. Artificial Intelligence, 1991.
- Tad McGeer. Passive Dynamic Walking. The International Journal of Robotics Research, 1990.
- Sebastian Thrun et al. Stanley: The Robot that Won the DARPA Grand Challenge. Journal of Field Robotics, 2006.
- Sebastian Thrun, Wolfram Burgard, Dieter Fox. Probabilistic Robotics. MIT Press, 2005.
- Sergey Levine et al. End-to-End Training of Deep Visuomotor Policies. JMLR, 2016.
- Sergey Levine et al. Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection. 2016.
- Dmitry Kalashnikov et al. QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. 2018.
- OpenAI. Learning Dexterous In-Hand Manipulation. 2018;Solving Rubik's Cube with a Robot Hand. 2019.
- Jemin Hwangbo et al. Learning Agile and Dynamic Motor Skills for Legged Robots. 2019.
- Joonho Lee et al. Learning Quadrupedal Locomotion over Challenging Terrain. 2020.
- Nikita Rudin et al. Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning. 2021.
- Manolis Savva et al. Habitat: A Platform for Embodied AI Research. 2019.
- Michael Ahn et al. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. 2022.
- Jacky Liang et al. Code as Policies: Language Model Programs for Embodied Control. 2022.
- Anthony Brohan et al. RT-1: Robotics Transformer for Real-World Control at Scale. 2022.
- Anthony Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. 2023.
- Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. 2023.
- Tony Z. Zhao et al. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. 2023.
- Cheng Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. 2023.
- Moo Jin Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model. 2024.
- Physical Intelligence. π0: A Vision-Language-Action Flow Model for General Robot Control. 2024;π0.5: a Vision-Language-Action Model with Open-World Generalization. 2025.
- Jake Bruce et al. Genie: Generative Interactive Environments. 2024.
- NVIDIA. Cosmos World Foundation Model Platform for Physical AI. 2025.
- Mido Assran et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. 2025.