跳到主要内容

查看 Markdown

页面正文已转为 Markdown。交互图形可通过文末链接在原网页查看。

3. 机器人的技能

想要学习并研究具身智能,需要先把任务定义清楚。如何合理地建模任务、确定目标与评价指标,往往比模型选择与优化更为关键。本章先介绍怎样定义任务,再认识四类常见的机器人技能。

3.1 先定义任务​

在选择方法之前,先明确:希望机器人学会什么技能?在什么环境和约束下完成任务?使用哪些传感器,输入的观测与输出的动作分别是什么?如何判断任务完成,并用成功率、完成时间等指标评价表现?

同样需要审视任务设定是否合理,以及能否通过调整设定改善问题。例如,当顶部相机对环境的观测不够充分时,可以考虑加装腕部相机,补充近距离视角。传感器配置的改变也意味着观测条件发生了变化,实验中应明确记录,并在一致的设定下比较方法。

3.2 把任务写成可以学习的问题​

把任务交给算法之前,需要把它写成明确的输入、输出和目标。常用的描述方式是:在每个时刻 ,机器人获得观测 ,策略 根据观测和任务目标 (例如一条语言指令)输出动作 :

动作作用于环境,环境随之变化,机器人得到新的观测,循环继续。强化学习还会定义奖励 ,衡量每一步做得好不好;奖励、回报与价值函数的正式定义见 马尔可夫决策过程。

下表用两个任务说明这些要素:

要素含义机械臂拿杯子四足向前走
观测 机器人能获得的信息相机图像、关节角、夹爪开度关节角与角速度、IMU 测得的姿态与角速度、速度指令
状态描述世界的完整信息,往往无法直接观测杯子的真实位姿、质量与摩擦地面摩擦、足端接触、机身真实速度
动作 策略的输出末端位姿增量或关节目标,以及夹爪开合12 个关节的目标角度
目标 要完成什么把杯子放进指定区域按给定速度向前行走
成功条件怎样算完成杯子放对位置,保持直立,手臂不碰撞跟上目标速度,保持平衡,并减少滑倒
控制频率多久输出一次动作从几赫兹到几十赫兹不等例如 50 Hz 策略,底层关节控制更快

有三点值得注意:

  • 观测往往只反映部分状态。相机看不到杯子有多重,机器人只能在抓起之后,通过受力和运动推断。这种情况称为部分可观测。策略常常利用历史观测,或者增加传感器来弥补。
  • 动作的定义影响学习难度。关节目标还是末端位姿,绝对量还是增量,位置控制还是力矩控制,各有利弊。
  • 比较方法时要统一设定。不同方法使用的观测、动作、控制频率和成功条件不同,结果就不能直接比较。

3.3 四类常见技能​

对机器人技能的研究,可以先从四类常见任务入手:抓取(Grasping)、操作(Manipulation)、运动(Locomotion)和导航(Navigation)。抓取与操作关注改变物体的状态,运动与导航关注移动机器人自身。每类技能都配有一段可以逐步播放的 3D 演示。

抓取​

核心问题:怎样把一个物体拿稳?

抓取(Grasping)是末端执行器与物体建立一组接触,使物体的运动受到约束、能够随末端一起运动,并在预期扰动下不滑脱的过程及其结果。

通俗来讲,就是让机器人用夹爪、灵巧手或吸盘把物体拿稳,为后续移动和操作做好准备。例如,把桌面上的小方块放进指定盒子时,需要先夹住并提起它;其中,建立并保持稳定夹持是抓取,后续还要完成搬运、放置和松开,才构成完整的拾取与放置操作。

3D 技能示意

拿稳,再提起

正在准备 3D 场景…机械臂用平行夹爪对准橙色方块,闭合夹爪,再将方块提离桌面。

观察物体确定方块的位置与朝向,选择两侧的夹持区域。

看夹爪与物体之间的关系:从尚未接触,到稳定夹持。可拖动进度条或点击阶段逐步查看。动作已简化,用于理解技能。

典型的抓取检测(grasp detection)以点云或 RGB-D 图像为输入,为平行夹爪预测抓取位姿:三维位置、三维朝向(6-DoF)与夹爪开度,再结合可达性和碰撞检查执行。

几何与力学方法分析形封闭(form closure)、力封闭(force closure)等条件;数据驱动方法学习抓取质量或直接生成抓取位姿。代表项目包括 Dex-Net、作为数据集与评测基准的 GraspNet-1Billion,以及 AnyGrasp。解析模型也可以用于生成学习所需的数据。

抓取可以先规划再执行,也可以通过视觉、力觉或触觉持续修正;例如 AnyGrasp 支持抓取位姿跟踪。受控工位中的规则刚体抓取已有较成熟方案,灵巧手、透明或柔性物体、严重遮挡与复杂堆叠仍对可靠性提出挑战。

操作​

核心问题:怎样通过接触改变物体状态?

操作(Manipulation)是机器人通过施加力或运动,有目的地改变物体的位置、姿态、形状或其他任务相关状态的过程。

通俗来讲,就是让机器人通过推、拉、搬、转等动作,把物体变成任务要求的状态。例如,机器人先抓住抽屉把手,再沿导轨向外拉,直到抽屉打开到指定位置。

3D 技能示意

抓住把手,把抽屉拉开

正在准备 3D 场景…机械臂夹住抽屉把手,持续保持接触,沿滑轨方向拉开抽屉。

靠近把手观察把手与滑轨方向,将夹爪移动到把手附近。

抓住只是开始。操作还要持续改变抽屉的状态。可拖动进度条或点击阶段逐步查看。动作已简化,用于理解技能。

操作的含义比抓取更广,抓取是其中一个子问题。典型的稳定抓取通常希望维持末端与物体的接触关系,让物体随末端一起运动;操作则允许接触点和接触方式随任务需要反复变化,例如在手内转动物体时换指、滚动或重新抓取。接触点是否固定,并不是抓取与操作的绝对分界。

操作的范围包括抓取、搬运、推、拨、翻转、手内操作(in-hand manipulation),也包括叠衣服、整理绳索、开门和抽屉、使用工具、双臂协作与长时序任务。推物体或踢足球属于不需要先抓住物体的非抓取式操作。

复杂操作常需要根据图像、本体感知,以及可选的语言目标,持续决定下一步动作。模仿学习(IL)与视觉语言动作模型(VLA)是重要研究路线:ACT 预测动作片段,Diffusion Policy 结合动作生成与滚动执行,π0、OpenVLA 则探索多任务的视觉语言动作策略。

难点包括丰富且易变化的接触(contact-rich)、无法直接观测的状态、同一目标对应多种合理动作,以及误差在长序列中的累积。闭环反馈对复杂操作很重要,抓取同样可以使用闭环。判断能力时,应区分固定任务复现与新物体、新环境下的泛化。

运动​

核心问题:怎样让身体稳定地移动?

运动(Locomotion)是机器人通过腿、轮等机构与环境的相互作用,实现自身移动,并协调身体姿态与运动稳定性的过程。

通俗来讲,就是解决机器人“身体怎么动起来、怎样动得稳”。例如,四足机器人迈上台阶时,需要协调抬腿、落脚和重心转移,避免绊倒或失去平衡。要让它进一步自主选择路线并到达门口,还需要与导航配合。

3D 技能示意

保持平衡,迈上台阶

正在准备 3D 场景…四足机器人交替抬腿、落脚和支撑,逐步登上三级台阶。

准备支撑四足落地支撑身体,准备向前移动。

看身体怎么移动:协调落脚位置、关节与重心。可拖动进度条或点击阶段逐步查看。动作已简化,用于理解技能。

足式机器人需要处理步态、平衡、台阶、斜坡和跌倒恢复;轮式机器人也属于这一范畴,需要应对转向约束、打滑和不平地形。全身协调控制还可以把移动与操作连接起来。

观测常包括关节位置与速度、惯性测量单元(IMU)提供的姿态和角速度,以及可选的深度图或高程图。策略可输出关节目标,再由底层控制器跟踪,也可以直接输出力矩。步态策略的更新频率与关节伺服频率需要分开看。

模型预测控制(MPC)和仿真到真实的强化学习(sim-to-real RL)都是常见路线。Learning to Walk in Minutes 用 Isaac Gym 中的大规模并行仿真训练 ANYmal;域随机化帮助应对现实差异,教师—学生训练可把带有额外信息的技能迁移到机载观测。Robot Parkour 等工作进一步研究依靠视觉选择与执行越障技能。

四足机器人在多种已验证场景中已有很强的运动能力;极端地形、低摩擦接触、长期可靠性,以及人形机器人和负载变化下的全身协调,仍需要针对具体条件验证。

核心问题:去哪里、走哪条路、何时停下?

导航(Navigation)是机器人依据目标、环境观测和自身状态,决定并调整移动方向或路径,避开障碍并到达目标位置或区域的过程。

通俗来讲,就是解决“我在哪里、要去哪里、应该怎么走”。例如,机器人从房间一端出发,绕过地上的障碍物,到达门口的指定区域。

3D 技能示意

绕开障碍,到达目标

正在准备 3D 场景…轮式机器人从起点出发,沿规划路径绕过两个障碍物,到达终点后停下。

定位与目标确定当前位置、目标位置,以及场地中障碍物的位置。

看目标与路线:决定去哪里、如何绕行、何时停止。可拖动进度条或点击阶段逐步查看。动作已简化,用于理解技能。

导航决定“去哪、走哪条路”,运动负责“身体怎样把这段路走出来”。在常见的分层系统中,导航给出路径、航点或期望速度,运动控制再协调步态、落脚点、关节或轮速,将指令落实到身体上。例如,四足机器人去门口时,导航选择绕过纸箱、经过台阶的路线;运动控制负责上台阶时怎样抬腿、落脚和保持平衡。

两者需要持续配合:规划路线时,要考虑机器人能否通过狭窄通道、跨过台阶;执行中若出现打滑或受阻,新的状态反馈又会促使系统调整速度或重新规划。这个分工可以由独立模块实现,也可以通过联合规划或学习策略协调。

导航涉及定位、建图、路径规划与避障。经典系统通常组合定位 / SLAM、全局规划(如 A*)与局部规划或控制(如 DWA、MPC),Nav2 是一个包含这些环节的导航框架;已知地图与受控环境中已有成熟的工程方案。

具身导航任务还可以按目标形式区分:PointNav 前往指定坐标,ObjectNav 寻找某类物体,ImageNav 寻找图像对应的地点或物体,VLN 按自然语言指令行进。输入可包含 RGB-D、激光雷达、里程计和目标描述,输出可以是速度指令,也可以是前进、转向、停止等离散动作。

部分仿真基准简化了底层移动;真实部署还要处理定位误差、打滑、动态障碍和执行失败。比较结果时要同时看任务定义、传感器、成功条件与路径效率,不能把某个 PointNav 基准的高成功率推广到所有导航任务。

3.4 放在一起看​

频率描述的是某一层的更新速度。下面列出具体系统的示例;策略推理、动作执行、仿真步进与关节伺服频率应分别核对。

技能典型输入典型输出时间尺度示例常见方法进展与边界
抓取点云 / RGB-D;也可加入力觉、触觉抓取位姿、夹爪开度或接触参数按任务触发,或连续更新抓取目标几何与力学分析、监督学习受控工位较成熟;复杂物体与接触仍有挑战
操作图像、本体感知;可加入语言、力觉与触觉末端或关节动作、动作片段ACT 示例:50 Hz 动作执行规划与控制、IL、RL、VLA任务间差异大;通用、长时序操作仍有挑战
运动关节状态、IMU;可加入地形感知关节目标、力矩或足端目标50 Hz 策略 / 200 Hz 仿真控制(按 legged_gym 基础配置折算)MPC、全身控制、sim-to-real RL多种四足场景已验证;复杂地形与全身协同仍有挑战
导航视觉 / 激光雷达、位姿估计、目标描述路径、航点、速度或离散动作高层按需更新;Nav2 局部控制默认 20 Hz定位 / SLAM、规划与控制、学习方法已知地图较成熟;开放环境与语义目标仍有挑战

3.5 组合起来,完成真实任务​

真实任务往往需要组合多种技能:

  • 移动操作(Mobile manipulation):把移动与操作连接起来,通常需要导航找到工作位置,再协调底盘和机械臂完成任务。例如“去厨房,把杯子拿回来”。
  • 运动与操作协同(Loco-manipulation):强调移动、平衡与接触操作之间的耦合,例如四足带臂搬运物体,或人形机器人一边保持平衡一边开门。ALMA 是足式全身操作的一个例子。

人形机器人执行日常任务时,可能同时涉及这四类能力;具体能做到什么,取决于硬件、感知、控制与训练,而不只取决于外形。

小结​

  • 研究具身智能先要定义任务:技能、环境与约束、观测与动作、成功条件与评价指标。
  • 抓取与操作改变物体的状态,运动与导航移动机器人自身;四类技能的输入、输出和时间尺度差别很大。
  • 真实任务常常组合多种技能,比较方法时要在一致的设定下进行。

继续阅读​

参考​

  1. Modern Robotics:抓取与操作
  2. Modern Robotics:轮式机器人与移动操作
  3. Habitat:ObjectNav 与 ImageNav 任务及评测
  4. VLN-CE:连续环境中的视觉语言导航