跳到主要内容

查看 Markdown

页面正文已转为 Markdown。交互图形可通过文末链接在原网页查看。

5. 核心挑战

前几章介绍了具身智能的概念、发展脉络,以及机器人的技能与身体形态。本章讨论尚未解决好的问题,它们也是许多研究工作的出发点。了解这些挑战,有助于判断一项成果真正解决了什么,以及它的适用范围。

5.1 数据:少、贵、难以复用​

大模型可以利用互联网上的海量文本和图像,机器人数据却要通过遥操作、示教或自主交互专门采集。例如,RT-1 的约 13 万条演示由 13 台机器人在 17 个月里采集完成。

数据还很难直接复用:不同机器人的传感器、动作空间和控制频率不同,一台机械臂的数据未必能直接训练另一台机械臂。数据质量同样关键:观测与动作是否在时间上对齐,动作的单位和坐标系是否一致,示教是否流畅,都会影响训练结果。

常见应对:汇集多种机器人的跨机体数据集,例如 Open X-Embodiment;用仿真批量生成数据;从人类视频中学习;用世界模型生成训练数据;设计更高效的遥操作与数据采集工具。

站内学习:具身数据集、LeRobot 中文课程讲义。

5.2 仿真到真实的差距​

仿真训练安全、便宜,可以并行运行,但仿真与真实世界之间总有差距:摩擦和接触的建模不准确,电机的响应与延迟不同,传感器的噪声、标定误差和时间戳偏差也难以完全模拟。仿真里表现很好的策略,到了真机上可能抖动、打滑,甚至摔倒。

常见应对:域随机化(在训练时随机改变质量、摩擦、延迟等参数,让策略适应一个范围);系统辨识与执行器建模(让仿真更接近真机);教师—学生训练(先用仿真中的特权信息训练教师策略,再蒸馏给只用机载传感器的学生策略);在真机上少量微调;做好传感器标定与时间同步。

站内学习:传感器标定与 sim2real。

5.3 泛化​

在训练场景中表现好,不等于能处理新物体、新环境、新指令或新机器人。一个在实验室桌面上学会抓杯子的策略,换了杯子的颜色、桌面的光照或相机的位置,成功率可能明显下降。

常见应对:采集更多样的数据;利用预训练视觉语言模型的语义知识,例如 RT-2 能理解训练数据中没有出现过的指令;跨机体训练;在训练中加入视觉与物理参数的随机化。

评测时,要区分复现与泛化:在训练用的任务和环境中测试,只能说明方法学会了这些任务;在新物体、新环境中测试,才能说明它的泛化能力。

5.4 长时序任务与误差累积​

叠衣服、收拾房间这类任务需要几十甚至上百个步骤。每一步的小误差都会累积;一旦机器人进入示教数据中没有出现过的状态,策略可能越错越远,这种现象称为分布偏移(distribution shift)。

常见应对:一次预测一段动作,减少决策次数,例如 ACT 的动作分块;把长任务分解为子任务,由高层规划器调度;检测失败并尝试恢复;从部署经验中继续学习。

站内学习:ACT 动作分块、π0.6 在线学习。

5.5 实时性与算力​

大模型推理可能需要几十到几百毫秒,而底层控制周期通常只有几毫秒到几十毫秒。机器人上的算力、功耗和散热也有限,无法随意部署大模型。

常见应对:分层设计,让较慢的大模型负责高层决策,较快的控制器负责底层执行;动作分块与异步执行,让机器人在等待下一次推理时继续平稳地执行已有计划;模型压缩与端侧加速。

站内学习:RTC 实时执行。

5.6 安全与可靠性​

机器人的错误会带来物理后果:碰撞、夹伤、摔倒或损坏物品。从数据中学到的策略很难给出安全保证,失败时也难以解释原因。真实应用还要求机器人在长时间运行中保持稳定,而不只是在演示视频里成功几次。

常见应对:限制关节速度、力矩和工作空间;检测碰撞和异常;保留传统控制器作为安全兜底;在仿真中充分验证后再上真机;真机实验时保证有人监护,随时可以急停。

站内学习:SO-101 + LeRobot 真机教程 介绍了硬件连通与安全测试的步骤。

5.7 评测​

同一个任务,成功的定义、初始条件、物体摆放和试验次数不同,结论就可能不同。真机评测耗时费力,环境难以完全复现;只报告最好的一次结果,会高估方法的能力。

常见应对:使用公开的仿真基准,例如 LIBERO;完整报告实验条件、成功条件和试验次数;分别报告训练分布内与分布外的结果;用世界模型或仿真器辅助评测,减少对真机时间的占用。

5.8 这些挑战彼此相连​

这些挑战并不孤立:真实数据少,于是转向仿真,又带来仿真到真实的差距;想要泛化,就需要更多样的数据;长时序任务既考验泛化,也受实时性限制;而所有改进都需要可靠的评测来证明。阅读一项新成果时,可以问:它主要解决了哪个挑战?代价是什么?在什么条件下验证的?

小结​

  • 数据稀缺、仿真到真实的差距和泛化,是具身智能最核心的几个难题。
  • 长时序任务、实时性与算力、安全与可靠性,决定了方法能否走出实验室。
  • 可靠的评测是判断进展的前提:看清成功条件、试验次数和测试分布。

下一步​

接下来可以阅读 6. 技术栈,从知识模块进入后续教程;7. 就业岗位介绍各方向的工作职责与面试准备。也可以按自己的目标继续:

  • 补齐具体原理:进入 理论基础。
  • 搭建完整系统或验证一个方法:进入 项目实战,选择分章项目或独立实验。
  • 查找论文、数据和代码:浏览 领域资源。