章节目录
本页目录
3. 机器人的技能
想要学习并研究具身智能,需要先把任务定义清楚。如何合理地建模任务、确定目标与评价指标,往往比模型选择与优化更为关键。本章先介绍怎样定义任务,再认识四类常见的机器人技能。
3.1 先定义任务
在选择方法之前,先明确:希望机器人学会什么技能?在什么环境和约束下完成任务?使用哪些传感器,输入的观测与输出的动作分别是什么?如何判断任务完成,并用成功率、完成时间等指标评价表现?
同样需要审视任务设定是否合理,以及能否通过调整设定改善问题。例如,当顶部相机对环境的观测不够充分时,可以考虑加装腕部相机,补充近距离视角。传感器配置的改变也意味着观测条件发生了变化,实验中应明确记录,并在一致的设定下比较方法。
3.2 把任务写成可以学习的问题
把任务交给算法之前,需要把它写成明确的输入、输出和目标。常用的描述方式是:在每个时刻
动作作用于环境,环境随之变化,机器人得到新的观测,循环继续。强化学习还会定义奖励
下表用两个任务说明这些要素:
| 要素 | 含义 | 机械臂拿杯子 | 四足向前走 |
|---|---|---|---|
| 观测 | 机器人能获得的信息 | 相机图像、关节角、夹爪开度 | 关节角与角速度、IMU 测得的姿态与角速度、速度指令 |
| 状态 | 描述世界的完整信息,往往无法直接观测 | 杯子的真实位姿、质量与摩擦 | 地面摩擦、足端接触、机身真实速度 |
| 动作 | 策略的输出 | 末端位姿增量或关节目标,以及夹爪开合 | 12 个关节的目标角度 |
| 目标 | 要完成什么 | 把杯子放进指定区域 | 按给定速度向前行走 |
| 成功条件 | 怎样算完成 | 杯子放对位置,保持直立,手臂不碰撞 | 跟上目标速度,保持平衡,并减少滑倒 |
| 控制频率 | 多久输出一次动作 | 从几赫兹到几十赫兹不等 | 例如 50 Hz 策略,底层关节控制更快 |
有三点值得注意:
- 观测往往只反映部分状态。相机看不到杯子有多重,机器人只能在抓起之后,通过受力和运动推断。这种情况称为部分可观测。策略常常利用历史观测,或者增加传感器来弥补。
- 动作的定义影响学习难度。关节目标还是末端位姿,绝对量还是增量,位置控制还是力矩控制,各有利弊。
- 比较方法时要统一设定。不同方法使用的观测、动作、控制频率和成功条件不同,结果就不能直接比较。
3.3 四类常见技能
对机器人技能的研究,可以先从四类常见任务入手:抓取(Grasping)、操作(Manipulation)、运动(Locomotion)和导航(Navigation)。抓取与操作关注改变物体的状态,运动与导航关注移动机器人自身。每类技能都配有一段可以逐步播放的 3D 演示。
抓取
核心问题:怎样把一个物体拿稳?
抓取(Grasping)是末端执行器与物体建立一组接触,使物体的运动受到约束、能够随末端一起运动,并在预期扰动下不滑脱的过程及其结果。
通俗来讲,就是让机器人用夹爪、灵巧手或吸盘把物体拿稳,为后续移动和操作做好准备。例如,把桌面上的小方块放进指定盒子时,需要先夹住并提起它;其中,建立并保持稳定夹持是抓取,后续还要完成搬运、放置和松开,才构成完整的拾取与放置操作。
3D 技能示意
拿稳,再提起
观察物体确定方块的位置与朝向,选择两侧的夹持区域。
典型的抓取检测(grasp detection)以点云或 RGB-D 图像为输入,为平行夹爪预测抓取位姿:三维位置、三维朝向(6-DoF)与夹爪开度,再结合可达性和碰撞检查执行。
几何与力学方法分析形封闭(form closure)、力封闭(force closure)等条件;数据驱动方法学习抓取质量或直接生成抓取位姿。代表项目包括 Dex-Net、作为数据集与评测基准的 GraspNet-1Billion,以及 AnyGrasp。解析模型也可以用于生成学习所需的数据。
抓取可以先规划再执行,也可以通过视觉、力觉或触觉持续修正;例如 AnyGrasp 支持抓取位姿跟踪。受控工位中的规则刚体抓取已有较成熟方案,灵巧手、透明或柔性物体、严重遮挡与复杂堆叠仍对可靠性提出挑战。
操作
核心问题:怎样通过接触改变物体状态?
操作(Manipulation)是机器人通过施加力或运动,有目的地改变物体的位置、姿态、形状或其他任务相关状态的过程。
通俗来讲,就是让机器人通过推、拉、搬、转等动作,把物体变成任务要求的状态。例如,机器人先抓住抽屉把手,再沿导轨向外拉,直到抽屉打开到指定位置。
3D 技能示意
抓住把手,把抽屉拉开
靠近把手观察把手与滑轨方向,将夹爪移动到把手附近。
操作的含义比抓取更广,抓取是其中一个子问题。典型的稳定抓取通常希望维持末端与物体的接触关系,让物体随末端一起运动;操作则允许接触点和接触方式随任务需要反复变化,例如在手内转动物体时换指、滚动或重新抓取。接触点是否固定,并不是抓取与操作的绝对分界。
操作的范围包括抓取、搬运、推、拨、翻转、手内操作(in-hand manipulation),也包括叠衣服、整理绳索、开门和抽屉、使用工具、双臂协作与长时序任务。推物体或踢足球属于不需要先抓住物体的非抓取式操作。
复杂操作常需要根据图像、本体感知,以及可选的语言目标,持续决定下一步动作。模仿学习(IL)与视觉语言动作模型(VLA)是重要研究路线:ACT 预测动作片段,Diffusion Policy 结合动作生成与滚动执行,π0、OpenVLA 则探索多任务的视觉语言动作策略。
难点包括丰富且易变化的接触(contact-rich)、无法直接观测的状态、同一目标对应多种合理动作,以及误差在长序列中的累积。闭环反馈对复杂操作很重要,抓取同样可以使用闭环。判断能力时,应区分固定任务复现与新物体、新环境下的泛化。
运动
核心问题:怎样让身体稳定地移动?
运动(Locomotion)是机器人通过腿、轮等机构与环境的相互作用,实现自身移动,并协调身体姿态与运动稳定性的过程。
通俗来讲,就是解决机器人“身体怎么动起来、怎样动得稳”。例如,四足机器人迈上台阶时,需要协调抬腿、落脚和重心转移,避免绊倒或失去平衡。要让它进一步自主选择路线并到达门口,还需要与导航配合。
3D 技能示意
保持平衡,迈上台阶
准备支撑四足落地支撑身体,准备向前移动。
足式机器人需要处理步态、平衡、台阶、斜坡和跌倒恢复;轮式机器人也属于这一范畴,需要应对转向约束、打滑和不平地形。全身协调控制还可以把移动与操作连接起来。
观测常包括关节位置与速度、惯性测量单元(IMU)提供的姿态和角速度,以及可选的深度图或高程图。策略可输出关节目标,再由底层控制器跟踪,也可以直接输出力矩。步态策略的更新频率与关节伺服频率需要分开看。
模型预测控制(MPC)和仿真到真实的强化学习(sim-to-real RL)都是常见路线。Learning to Walk in Minutes 用 Isaac Gym 中的大规模并行仿真训练 ANYmal;域随机化帮助应对现实差异,教师—学生训练可把带有额外信息的技能迁移到机载观测。Robot Parkour 等工作进一步研究依靠视觉选择与执行越障技能。
四足机器人在多种已验证场景中已有很强的运动能力;极端地形、低摩擦接触、长期可靠性,以及人形机器人和负载变化下的全身协调,仍需要针对具体条件验证。
导航
核心问题:去哪里、走哪条路、何时停下?
导航(Navigation)是机器人依据目标、环境观测和自身状态,决定并调整移动方向或路径,避开障碍并到达目标位置或区域的过程。
通俗来讲,就是解决“我在哪里、要去哪里、应该怎么走”。例如,机器人从房间一端出发,绕过地上的障碍物,到达门口的指定区域。
3D 技能示意
绕开障碍,到达目标
定位与目标确定当前位置、目标位置,以及场地中障碍物的位置。
导航决定“去哪、走哪条路”,运动负责“身体怎样把这段路走出来”。在常见的分层系统中,导航给出路径、航点或期望速度,运动控制再协调步态、落脚点、关节或轮速,将指令落实到身体上。例如,四足机器人去门口时,导航选择绕过纸箱、经过台阶的路线;运动控制负责上台阶时怎样抬腿、落脚和保持平衡。
两者需要持续配合:规划路线时,要考虑机器人能否通过狭窄通道、跨过台阶;执行中若出现打滑或受阻,新的状态反馈又会促使系统调整速度或重新规划。这个分工可以由独立模块实现,也可以通过联合规划或学习策略协调。
导航涉及定位、建图、路径规划与避障。经典系统通常组合定位 / SLAM、全局规划(如 A*)与局部规划或控制(如 DWA、MPC),Nav2 是一个包含这些环节的导航框架;已知地图与受控环境中已有成熟的工程方案。
具身导航任务还可以按目标形式区分:PointNav 前往指定坐标,ObjectNav 寻找某类物体,ImageNav 寻找图像对应的地点或物体,VLN 按自然语言指令行进。输入可包含 RGB-D、激光雷达、里程计和目标描述,输出可以是速度指令,也可以是前进、转向、停止等离散动作。
部分仿真基准简化了底层移动;真实部署还要处理定位误差、打滑、动态障碍和执行失败。比较结果时要同时看任务定义、传感器、成功条件与路径效率,不能把某个 PointNav 基准的高成功率推广到所有导航任务。
3.4 放在一起看
频率描述的是某一层的更新速度。下面列出具体系统的示例;策略推理、动作执行、仿真步进与关节伺服频率应分别核对。
| 技能 | 典型输入 | 典型输出 | 时间尺度示例 | 常见方法 | 进展与边界 |
|---|---|---|---|---|---|
| 抓取 | 点云 / RGB-D;也可加入力觉、触觉 | 抓取位姿、夹爪开度或接触参数 | 按任务触发,或连续更新抓取目标 | 几何与力学分析、监督学习 | 受控工位较成熟;复杂物体与接触仍有挑战 |
| 操作 | 图像、本体感知;可加入语言、力觉与触觉 | 末端或关节动作、动作片段 | ACT 示例:50 Hz 动作执行 | 规划与控制、IL、RL、VLA | 任务间差异大;通用、长时序操作仍有挑战 |
| 运动 | 关节状态、IMU;可加入地形感知 | 关节目标、力矩或足端目标 | 50 Hz 策略 / 200 Hz 仿真控制(按 legged_gym 基础配置折算) | MPC、全身控制、sim-to-real RL | 多种四足场景已验证;复杂地形与全身协同仍有挑战 |
| 导航 | 视觉 / 激光雷达、位姿估计、目标描述 | 路径、航点、速度或离散动作 | 高层按需更新;Nav2 局部控制默认 20 Hz | 定位 / SLAM、规划与控制、学习方法 | 已知地图较成熟;开放环境与语义目标仍有挑战 |
3.5 组合起来,完成真实任务
真实任务往往需要组合多种技能:
- 移动操作(Mobile manipulation):把移动与操作连接起来,通常需要导航找到工作位置,再协调底盘和机械臂完成任务。例如“去厨房,把杯子拿回来”。
- 运动与操作协同(Loco-manipulation):强调移动、平衡与接触操作之间的耦合,例如四足带臂搬运物体,或人形机器人一边保持平衡一边开门。ALMA 是足式全身操作的一个例子。
人形机器人执行日常任务时,可能同时涉及这四类能力;具体能做到什么,取决于硬件、感知、控制与训练,而不只取决于外形。
小结
- 研究具身智能先要定义任务:技能、环境与约束、观测与动作、成功条件与评价指标。
- 抓取与操作改变物体的状态,运动与导航移动机器人自身;四类技能的输入、输出和时间尺度差别很大。
- 真实任务常常组合多种技能,比较方法时要在一致的设定下进行。
继续阅读
- 4. 具身智能的载体:不同的身体怎样影响可以研究的技能。
- 马尔可夫决策过程:把决策问题写成数学形式。
- 项目实战:按机器人载体与任务选择实践方向。