⚠️ Alpha 内测版本:课程内容尚未完成,可能发生变更,欢迎通过 Issue 提交反馈。
跳到正文

L08 · 演示数据获取方法

L08 第一篇: 本文比较机器人演示数据从哪里来。你可以返回 本讲导览,也可以继续学习 脚本化专家

演示数据需要被生产出来

机器人学习中的 demonstration,是一个任务行为随时间展开的示例。它通常需要连接 observation、action、任务上下文和结果,但采集设备或生成过程最初提供的信号可能完全不同: 遥操作得到的是控制器命令,拖动示教得到的是人在物理引导下产生的机器人运动,而一段 人类视频甚至可能不包含任何机器人动作。

因此,首先要问的不是“哪种方法能得到最好的数据集”,而是:

这种方法直接产生什么信号?采集成本是什么?它还要经过哪些转换,才能用于机器人学习?

下面六类路线彼此互补,并不是只能六选一。

六类演示数据来源分别经过各自的适配器,才汇入任务、观察、动作和结果接口。

课程自制示意图。右侧的共同接口只是通往 L09 的概念衔接,并不表示这些来源原生具有同一 schema。

先比较原始信号,再讨论格式

路线谁或什么产生行为?直接得到的信号必要的适配
遥操作人通过主从臂、手持设备、VR 或其他控制器操作机器人交互设备命令、机器人状态和传感器观察标定控制映射,对齐命令与观察的时钟
拖动示教人直接引导机器人运动关节或末端轨迹,以及可用的传感器读数把柔顺示教运动转成安全、可回放的动作表示
脚本化专家程序根据任务状态选择目标和运动基元可复现的命令、仿真状态、任务标识和可计算结果明确阶段逻辑、失败处理与 recorder hook
特权学习专家学习型控制器使用仿真专有状态或 reward 执行动作teacher action 和仿真特权状态限制 student 可见 observation,并进行蒸馏或重新采集可执行动作
自动扩增系统变换并重放 seed demonstration在新物体、位姿或场景下生成的候选轨迹重新执行候选轨迹,剔除物理无效或任务失败的 episode
人类视频迁移人在普通或带有采集设备的视频中执行任务图像,以及估计得到的手、身体或物体运动恢复几何、做 embodiment mapping、推导机器人动作并检查可执行性

这样的区分可以避免一个常见错误:相机视频、笛卡尔空间主手轨迹和 9 维关节命令都可能在 描述“同一个任务”,但只有先定义表示与时间对齐,才能把它们放进共同的训练接口。

六类获取路线

遥操作:直接引入人的任务经验

遥操作让人通过某种交互设备进入控制闭环。主从遥操臂可以建立直观的关节空间或笛卡尔空间 对应关系;键盘或游戏手柄不需要专用机械设备,适合发出离散或增量式命令;VR、动作追踪与 手持接口则无需同构机械主手,也能更直接地追踪操作者。全身接口还可以同时覆盖移动底盘和 双臂动作。ALOHA 与 GELLO 是低成本硬件路线的代表,Mobile ALOHA 则把这种思路扩展到 移动双臂任务。

四类常见遥操作接口分别通过标定、映射和安全检查把操作者输入连接到机器人机械臂,并将机器人状态反馈给操作者。

课程自制示意图。四个面板比较的是代表性接口直接产生的命令及其所需映射,并不是控制质量 排名;真实系统也可以组合多种接口。

它的主要优势是行为与真实任务直接相关:操作者能根据接触作出反应、修正小失误,并在真实 环境中展示任务策略。代价是操作者时间、设备标定、疲劳和技能差异,还要检查同步质量与 失败演示。更好的交互设备能改善采集体验,却不会自动消除这些数据质量问题。

当任务需要人的判断和接触过程中的在线恢复,或者少量高价值演示可以为后续采集提供 seed 时,遥操作通常是合适的起点。

拖动示教:直接引导机器人本体

拖动示教允许人推动一台柔顺或可回驱的机器人走过目标轨迹。教师与学习者使用同一机器人 本体,因此从任务想法得到少量 robot-native trajectory 的路径很短。

实际操作时,机器人会先进入厂商支持的手动引导、重力补偿或柔顺控制模式。示教者握住 机械臂或末端执行器,引导它完成期望运动;这并不是在制动锁止或刚性位置控制下强行拉扯 机械臂。

拖动示教先开启安全的手动引导模式,再由人直接移动目标机器人,并记录机器人原生运动轨迹。

课程自制示意图。与遥操作不同,人直接引导目标机器人本体。关节状态和末端位姿由这台 机器人直接产生;夹爪开合或模式切换仍可能需要按钮、脚踏开关或额外标注。

这种直观性也带来约束:机器人必须能够安全地被物理引导;示教过程未必能复现自主运行所需 的力和速度;大量、多样 episode 仍然需要持续人工投入。它适合在有限工位内快速教授轨迹, 却不是通往互联网规模数据的通用方案。

脚本化专家:直接编码任务结构

脚本化专家把已知任务状态转换成一系列目标和运动基元。在仿真中,它容易复现、便于插入 诊断,并且写好以后可以低成本重复运行。每个阶段都能附带标签,每个 episode 也能通过程序化 成功判据检查。

脚本化专家读取已知任务状态,执行显式阶段程序,向机器人发送命令,并保留经过结果检查的演示。

课程自制示意图。选择阶段、子目标、运动基元和转换规则的是程序,而不是逐步发命令的人, 也不是预先训练得到的策略。图中阶段名称特意保持通用; 脚本化专家正文会展示这种模式在抓取放置任务中的 一种具体实现。

它的局限来自所依赖的知识:脚本可能需要物体位姿、任务特定抓取 profile,或部署策略无法 看到的仿真状态。适用于结构化抓取放置的规则,遇到视觉歧义、柔性物体、未建模接触或 长时程恢复时可能很脆弱。

当任务几何和成功条件都很明确,并且需要一个清楚、可复现的起点时,脚本化专家很合适。 这正是 L08 当前任务的条件。

特权学习专家:自动获得更丰富的行为

强化学习或 model-based teacher 可以使用仿真状态、reward 和大量并行试验,学到难以用固定 状态机逐条编写的行为。训练完成后,它可以在受控变化下自动生成许多 rollout。

特权学习专家使用仿真专有状态和奖励学习行为,生成并验证 rollout,再把教师动作与部署可用观察整理成演示数据。

课程自制示意图。“特权”表示教师可以使用部署时不可获得的精确仿真信号;“学习”表示它的 行为来自优化,而不是手写阶段程序。导出的演示会把实际执行的教师动作与 student 真正能够 获得的 observation 配对。

自动化并不等于没有成本:reward 和环境设计、训练算力、teacher 验证与分布覆盖都会变成 采集流程的一部分。如果 teacher 能看到特权状态,它的动作可以监督 student,但 student 最终仍要依靠部署时真正可见的 observation 行动。

当固定脚本过于脆弱,而仿真又能提供可靠状态、目标和可重复试验时,这条路线更有吸引力。

自动扩增:放大可信 seed

MimicGen 一类系统会把成功演示的片段变换到新的场景配置,再在仿真中执行生成轨迹,从而 得到更多 episode。这里的关键是“执行”:经过几何变换的轨迹只是候选项,只有重新经历接触 并通过任务结果检查后,才能成为演示数据。

自动扩增从可信 seed 出发,生成经过变换的候选轨迹,在物理环境中逐条重放,并只保留通过结果检查的轨迹。

课程自制示意图。变换负责扩大规模,物理重放和结果过滤负责保留有效性。只复制或扭曲一条 轨迹,并不能让结果自动成为成功演示。

自动扩增能增加物体位姿与场景覆盖,而不必要求人类示范每一种组合。它的覆盖仍受 seed demonstration、变换假设和可复用任务片段限制。质量较差的 seed 或无效变换,同样可以高效 放大失败。

当少量演示已经覆盖任务结构,并且环境支持自动重放与结果检查时,这种方法最有价值。

人类视频迁移:行为广泛,但控制信号间接

普通人类视频覆盖的物体、环境和任务语义非常丰富。UMI、EgoMimic 等工作探索了带设备的 第一视角采集:通过估计轨迹,或使用能够与机器人末端运动建立关系的接口,缩小人类行为与 机器人动作之间的距离。

人类视频迁移提取与任务相关的手、物体、接触事件或可选骨架信息,将其映射到机器人本体,再通过实际执行验证候选动作。

课程自制示意图。完整人体骨架是一种可能的中间表示,尤其适用于人形机器人或全身任务; 桌面操作通常更直接地使用手或手腕运动、物体轨迹、接触事件和物体相对几何。

但 embodiment gap 仍然存在。像素不会直接给出机器人关节命令、夹爪力、时序或无碰撞 路径;视角、尺度、遮挡、手部形态和接触都会影响转换。因此,retarget 后的动作还要检查 机器人可达性与物理执行,才能成为机器人演示。

人类视频尤其适合提供任务多样性、表征学习信号和高层动作建议。要把这些信息落实到具体 机器人与控制接口,robot-native data 仍然重要。

优点、局限与适用场景

路线主要优点主要局限更适合的场景
遥操作保留人的任务策略与真实环境中的在线恢复依赖设备映射和人工采集成本复杂、接触丰富的真实任务
拖动示教直观地产生 robot-native trajectory受硬件和数据规模限制有限工位内的快速示教
脚本化专家可复现、可解释、可自动检查依赖任务特定假设与特权状态结构化仿真任务
特权学习专家在更丰富变化下自动生成行为需要训练 teacher、设计 reward 并处理 transfer gap大规模仿真采集
自动扩增从少量 seed 扩大覆盖受 seed 质量和变换有效性限制结构相近、可重放检查的任务
人类视频迁移任务和场景多样性丰富缺少机器人动作与物理对应关系语义先验与跨本体研究

成本和质量都不是一个数字。例如,一条遥操作 episode 会消耗较多人工时间,但可能包含有 价值的失败恢复;一条脚本演示可以低成本重复,却会继承相同的任务假设。怎样比较它们,取决 于下一阶段的学习器真正需要什么。

近期方向是组合路线,而不是选出唯一赢家

近期系统越来越倾向于组合多种获取路线,而不是用一种方法完全取代其他方法。

混合式演示数据管线把高价值人工 seed、自动扩展、异构数据和质量门禁组合起来。

课程自制示意图,依据文末论文与项目所代表的技术方向整理;它不是时间线或性能排名。

下面三类进展让这种组合更有价值:

  1. 降低人工采集门槛。 低成本主手、移动或双臂系统、便携末端接口和沉浸式控制,目标 都是让有用行为不再局限于一套固定实验室设备。
  2. 扩展并汇聚数据。 仿真专家与 seed-based generation 可以批量产生受控 episode; DROID、Open X-Embodiment 等项目则说明,跨场景、机构、任务或机器人本体汇聚数据时, 必须明确 normalization 与 metadata。
  3. 利用更广的视觉经验。 第一视角及其他人类视频能增加任务和场景多样性,但从视觉行为 落到可控制动作,仍需要 robot-native execution 与结果检查。

一种实际的混合管线可以先采集少量高质量人工演示,再在仿真中扩展适合复用的部分,通过 任务判据剔除失败,最后与更广泛的机器人数据组合。人类视频可以帮助表征或任务理解,但不应 被错误标成 joint-level supervision。

本讲只讨论数据从哪里来。L09 将定义具体的时间与存储合同,L12 再说明策略怎样使用准备好的 数据集。

从任务出发选择路线

面对任何候选来源,都可以依次询问:

  1. 原始信号: 它提供机器人动作、实测状态、图像、物体运动,还是只展示任务过程?
  2. 采集环境: 数据来自目标机器人、其他本体、仿真,还是人类活动?
  3. 规模与覆盖: 每增加一种任务变化,需要付出多少人工、硬件、仿真或训练成本?
  4. 物理有效性: 动作是否已经在机器人或仿真器中执行,还是仍需 retarget 和重放?
  5. 任务结果: success 能否自动标注,还是需要人工或其他模型判断?
  6. 适配器: 正式记录前,还需要怎样的标定、动作转换、同步或过滤?

这些问题会自然导向 L08 的选择。banana-to-bowl 任务具有已知物体位姿、配置好的 Franka、 可用的 IK 与 path planning,以及可计算的 containment 结果。脚本化专家因此能够提供一个 小而透明的起点,让我们在 L09 批量记录 episode 之前先看清每个阶段。

检查问题

  1. 为什么 RGB 视频不能直接等同于机器人动作轨迹?
  2. 当前仿真任务中,哪条路线最容易得到明确的自动 success label?哪些任务假设支持它?
  3. 为什么自动扩增后的候选轨迹必须重放,不能只因为几何变换成功就直接接受?
  4. 跨本体汇聚增加了什么能力?哪些差异仍需要 normalization?
  5. 举出一个更适合先用遥操作而不是脚本化专家的任务,并说明取舍。

小结

  • 演示数据来源首先在原始信号上不同,而不只是文件格式不同。
  • 人类引导的方法能够提供任务判断与失败恢复,但需要设备、标定和人工采集投入。
  • 脚本和仿真中的学习型专家能扩展可重复行为,却依赖任务结构、特权状态和可靠结果检查。
  • 自动扩增只有经过物理重放与成功过滤,才能真正放大 seed demonstration。
  • 人类视频扩大任务覆盖,但还需 embodiment mapping 与机器人执行证据。
  • 当前数据策略越来越倾向于组合这些优势。L08 选择脚本化专家,是因为当前任务结构明确、 状态可观测、结果可自动检查。

继续学习脚本化抓取放置专家

参考资料