跳到主要内容

查看 Markdown

页面正文已转为 Markdown。交互图形可通过文末链接在原网页查看。

2. 发展脉络

具身智能不是突然出现的新概念。它的核心思想可以追溯到早期的人工智能与机器人研究;今天的热度,来自深度强化学习、大规模仿真和大模型的共同推动。本章围绕一个问题梳理这段历史:机器人的能力从哪里来。

四个时期概览​

时期时间核心方法代表工作
规则编程时期1960s–1990s人写规则:先是符号推理,后来行为主义改用反应式规则,并提出“具身”观点Shakey、A*、STRIPS、包容式架构
模型控制时期1990s–2010s用物理模型和概率模型估计状态、规划路径、控制运动SLAM、Stanley、ZMP、MPC、ROS
深度强化学习时期2012–2021在仿真或真实环境中试错,学会控制策略;深度学习同时提升了感知端到端视觉运动策略、QT-Opt、灵巧手转魔方、ANYmal、legged_gym
大模型时期2022 年至今预训练大模型带来语言理解和通用能力,和底层控制分工协作SayCan、RT-2、Open X-Embodiment、π0

时期划分的是这个时期出现的主要能力来源,不代表前一时期的方法就过时了。今天的机器人仍然大量使用规划与控制;足式运动控制仍以深度强化学习为主,VLA 也开始用强化学习从部署经验中继续提升能力。

2.1 规则编程时期(1960s–1990s)​

这一时期,机器人的能力来自人写的规则:先是用符号和逻辑做推理,后来行为主义改用直接对环境作出反应的规则,并提出了“具身”这个观点。

符号推理:感知—规划—行动​

1966 年到 1972 年,斯坦福研究院(SRI)研制了 Shakey,它被认为是第一台能对自身行动进行推理的移动机器人。Shakey 用相机和测距传感器感知环境,把环境表示成符号,再用规划器搜索动作序列。为 Shakey 发展出的 A* 搜索算法和 STRIPS 规划器,至今仍是路径规划和任务规划的基础。

这种“先感知、建立世界模型、再规划、最后执行”的流程,被称为感知—规划—行动(Sense–Plan–Act)范式。它的问题在于:环境一变,世界模型就要重建;规划很慢,机器人常常要停下来“想”很久;符号化的世界模型也很难描述真实世界的全部细节。

行为主义与“具身”观点​

1980 年代,麻省理工学院的罗德尼·布鲁克斯(Rodney Brooks)提出了不同的思路。他设计的包容式架构(subsumption architecture)不建立完整的世界模型,而是把行为分成多层:底层负责避障这类反射式行为,上层在需要时抑制或调用下层。机器人直接对传感器信号作出反应,在真实环境中更快,也更稳健。

布鲁克斯主张,智能可以直接来自智能体与真实世界的交互,与其在机器人内部维护一份世界模型,不如把“世界本身当作最好的模型”。同一时期,研究者还发现身体形态本身就能承担一部分“计算”:被动动力学行走机器人没有电机和控制器,仅靠腿的结构和重力,就能沿缓坡稳定地走下去。

从此,“具身”(embodiment)成为人工智能与认知科学的重要主题:智能不只存在于算法中,也依赖身体和环境。

不过,无论是符号推理还是反应式行为,规则都要由人来设计,机器人很难应对设计者没有预料到的情况。

2.2 模型控制时期(1990s–2010s)​

这一时期,机器人的能力来自对世界的数学建模:用概率模型描述传感器噪声和环境的不确定性,用物理模型描述机器人怎样运动。这里的“模型”指物理模型和概率模型,和后文“大模型时期”的大模型不是一回事。

真实传感器有噪声,环境也不完全可知。1990 年代起,概率方法成为机器人学的主流:卡尔曼滤波、粒子滤波用于估计机器人的状态;同时定位与建图(SLAM)让机器人在未知环境中一边建图、一边确定自己的位置。2005 年,斯坦福大学的自动驾驶汽车 Stanley 在 DARPA 大挑战赛中自主驶完约 212 公里的沙漠赛道并获胜,展示了概率感知与规划的实力。

控制方面,基于模型的方法不断成熟:零力矩点(ZMP)方法支撑了本田 ASIMO 等人形机器人的步行;模型预测控制(MPC)和全身控制让足式机器人能够奔跑、跳跃并抵抗扰动。2007 年开始开发的机器人操作系统 ROS,为机器人软件提供了通用的通信机制和工具链,大大降低了搭建系统的门槛。

这一时期的系统以模块化为主:感知、定位、规划、控制分别开发,接口清晰,在结构化环境中表现可靠。它的代价是每个模块都需要大量人工设计和精确建模,遇到新物体、新环境或难以建模的接触时难以适应。

2.3 深度强化学习时期(2012–2021)​

2012 年前后,深度学习在图像识别上取得突破,机器人的感知能力随之大幅提升。更重要的变化发生在控制上:深度强化学习让机器人在仿真或真实环境中反复试错,自己学会控制策略,不再需要人写出每一条规则或建立精确的模型。

  • 端到端视觉运动策略:2016 年,Levine 等人用一个神经网络直接把相机图像映射为机械臂的电机力矩,完成拧瓶盖、把衣架挂上横杆等任务。
  • 在真实世界中学抓取:Google 用最多 14 台机械臂,在两个月里采集了 80 多万次抓取尝试,训练出能抓取新物体的模型;QT-Opt 进一步把深度强化学习用于基于视觉的抓取,在 58 万多次真实抓取数据上训练后,对没见过的物体达到 96% 的抓取成功率。
  • 仿真训练、真机部署:OpenAI 在仿真中用强化学习训练机械手,借助域随机化把策略迁移到真实的灵巧手上,完成手内转动方块(2018)和单手还原魔方(2019);苏黎世联邦理工学院在 ANYmal 四足机器人上部署仿真训练的策略,实现了敏捷运动和复杂地形行走(2019–2020);2021 年的 legged_gym 借助 GPU 并行仿真,把平地行走策略的训练时间缩短到几分钟。
  • 具身仿真平台与任务:AI2-THOR、Habitat 等仿真平台,以及点目标导航(PointNav)、物体目标导航(ObjectNav)、视觉语言导航(VLN)等任务,让研究者可以在虚拟的室内场景中大规模训练和评测导航智能体。

这一时期的核心转变是从人工设计每个模块,转向让机器人从数据和交互中学习。代价是对数据和算力的需求大增,奖励函数难以设计,仿真与真实之间存在差距,而且学到的策略往往只适用于训练时的任务和机器人。

2.4 大模型时期(2022 年至今)​

2022 年以后,大语言模型和视觉语言模型的进展迅速进入机器人领域。机器人的能力越来越多地来自在海量数据上预训练的大模型,它们带来了语言理解、常识和跨任务的通用能力:

  • 用语言模型做规划:SayCan(2022)让大语言模型把“我把饮料洒了,能帮忙吗?”这样的请求分解为机器人会执行的技能序列;Code as Policies(2022)让语言模型直接写出控制机器人的代码。
  • 机器人 Transformer 与 VLA:RT-1(2022)用约 13 万条真实演示训练 Transformer 策略;RT-2(2023)把视觉语言模型训练成视觉-语言-动作模型(VLA),让机器人能理解训练数据中没有出现过的指令。
  • 数据共享:Open X-Embodiment(2023)汇集了 22 种机器人的 100 多万条轨迹,推动跨机器人训练。
  • 低成本模仿学习:ALOHA 与 ACT(2023)、Diffusion Policy(2023)表明,用几十到几百条示教数据就能学会精细的双臂操作,大幅降低了研究门槛。
  • 开源与通用策略:OpenVLA(2024)等开源模型让社区能够复现和微调 VLA;π0(2024)、π0.5(2025)等模型用流匹配生成连续动作,并在陌生的家庭环境中完成收拾厨房、卧室等长时序任务。
  • 世界模型:Genie、Cosmos、V-JEPA 2 等模型学习预测环境随动作怎样变化,用于规划、生成训练数据和评测策略。

在这类系统中,大模型通常负责理解任务、做出决策,底层控制器负责快速、稳定地执行,也就是常说的“大脑”与“小脑”分工。与此同时,GPU 并行仿真可以同时运行数千个环境,人形机器人等新平台不断出现,具身智能成为人工智能研究和产业中最受关注的方向之一。2022 年以来 VLA 的技术演进,详见 从 LLM 到机器人策略。

2.5 历史留下的线索​

回顾这段历史,可以看到几条贯穿始终的线索:

  1. 模块化与端到端的取舍一直存在。从感知—规划—行动与行为主义之争,到模块化系统与端到端学习,再到今天层次式与单体式 VLA 的讨论,核心问题都是:系统应该拆成哪些部分,各部分之间传递什么信息。
  2. 能力的来源从人转向数据。从人写规则、人建模型,到从交互和海量数据中学习,数据的规模、质量和多样性逐渐成为效果的上限。
  3. 仿真一直是关键工具。从验证算法,到并行训练强化学习策略,再到用世界模型生成数据,仿真的角色不断扩展,仿真与真实之间的差距也始终存在。
  4. 身体的作用没有消失。同一个模型在不同机器人上表现不同,跨机体(cross-embodiment)学习仍是研究热点。

理论基础 按决策、控制、感知和工程模块整理了这些方法的学习入口。

小结​

  • 规则编程时期,机器人的能力来自人写的规则:先是符号推理与感知—规划—行动范式,后来行为主义强调智能来自身体与环境的交互,提出了“具身”观点。
  • 模型控制时期,机器人用物理模型和概率模型做估计、规划与控制,模块化系统变得可靠,ROS 降低了系统搭建门槛。
  • 深度强化学习时期,机器人通过试错学会控制策略;大模型时期,语言、视觉与动作进一步结合起来。

继续阅读​

参考​

  1. Nils J. Nilsson (ed.). Shakey the Robot. SRI International Technical Note 323, 1984.
  2. Rodney A. Brooks. A Robust Layered Control System for a Mobile Robot. IEEE Journal on Robotics and Automation, 1986.
  3. Rodney A. Brooks. Elephants Don't Play Chess. Robotics and Autonomous Systems, 1990.
  4. Rodney A. Brooks. Intelligence without Representation. Artificial Intelligence, 1991.
  5. Tad McGeer. Passive Dynamic Walking. The International Journal of Robotics Research, 1990.
  6. Sebastian Thrun et al. Stanley: The Robot that Won the DARPA Grand Challenge. Journal of Field Robotics, 2006.
  7. Sebastian Thrun, Wolfram Burgard, Dieter Fox. Probabilistic Robotics. MIT Press, 2005.
  8. Sergey Levine et al. End-to-End Training of Deep Visuomotor Policies. JMLR, 2016.
  9. Sergey Levine et al. Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection. 2016.
  10. Dmitry Kalashnikov et al. QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. 2018.
  11. OpenAI. Learning Dexterous In-Hand Manipulation. 2018;Solving Rubik's Cube with a Robot Hand. 2019.
  12. Jemin Hwangbo et al. Learning Agile and Dynamic Motor Skills for Legged Robots. 2019.
  13. Joonho Lee et al. Learning Quadrupedal Locomotion over Challenging Terrain. 2020.
  14. Nikita Rudin et al. Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning. 2021.
  15. Manolis Savva et al. Habitat: A Platform for Embodied AI Research. 2019.
  16. Michael Ahn et al. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. 2022.
  17. Jacky Liang et al. Code as Policies: Language Model Programs for Embodied Control. 2022.
  18. Anthony Brohan et al. RT-1: Robotics Transformer for Real-World Control at Scale. 2022.
  19. Anthony Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. 2023.
  20. Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. 2023.
  21. Tony Z. Zhao et al. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. 2023.
  22. Cheng Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. 2023.
  23. Moo Jin Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model. 2024.
  24. Physical Intelligence. π0: A Vision-Language-Action Flow Model for General Robot Control. 2024;π0.5: a Vision-Language-Action Model with Open-World Generalization. 2025.
  25. Jake Bruce et al. Genie: Generative Interactive Environments. 2024.
  26. NVIDIA. Cosmos World Foundation Model Platform for Physical AI. 2025.
  27. Mido Assran et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. 2025.