L08 · 演示数据获取方法
演示数据需要被生产出来
机器人学习中的 demonstration,是一个任务行为随时间展开的示例。它通常需要连接 observation、action、任务上下文和结果,但采集设备或生成过程最初提供的信号可能完全不同: 遥操作得到的是控制器命令,拖动示教得到的是人在物理引导下产生的机器人运动,而一段 人类视频甚至可能不包含任何机器人动作。
因此,首先要问的不是“哪种方法能得到最好的数据集”,而是:
这种方法直接产生什么信号?采集成本是什么?它还要经过哪些转换,才能用于机器人学习?
下面六类路线彼此互补,并不是只能六选一。
课程自制示意图。右侧的共同接口只是通往 L09 的概念衔接,并不表示这些来源原生具有同一 schema。
先比较原始信号,再讨论格式
| 路线 | 谁或什么产生行为? | 直接得到的信号 | 必要的适配 |
|---|---|---|---|
| 遥操作 | 人通过主从臂、手持设备、VR 或其他控制器操作机器人 | 交互设备命令、机器人状态和传感器观察 | 标定控制映射,对齐命令与观察的时钟 |
| 拖动示教 | 人直接引导机器人运动 | 关节或末端轨迹,以及可用的传感器读数 | 把柔顺示教运动转成安全、可回放的动作表示 |
| 脚本化专家 | 程序根据任务状态选择目标和运动基元 | 可复现的命令、仿真状态、任务标识和可计算结果 | 明确阶段逻辑、失败处理与 recorder hook |
| 特权学习专家 | 学习型控制器使用仿真专有状态或 reward 执行动作 | teacher action 和仿真特权状态 | 限制 student 可见 observation,并进行蒸馏或重新采集可执行动作 |
| 自动扩增 | 系统变换并重放 seed demonstration | 在新物体、位姿或场景下生成的候选轨迹 | 重新执行候选轨迹,剔除物理无效或任务失败的 episode |
| 人类视频迁移 | 人在普通或带有采集设备的视频中执行任务 | 图像,以及估计得到的手、身体或物体运动 | 恢复几何、做 embodiment mapping、推导机器人动作并检查可执行性 |
这样的区分可以避免一个常见错误:相机视频、笛卡尔空间主手轨迹和 9 维关节命令都可能在 描述“同一个任务”,但只有先定义表示与时间对齐,才能把它们放进共同的训练接口。
六类获取路线
遥操作:直接引入人的任务经验
遥操作让人通过某种交互设备进入控制闭环。主从遥操臂可以建立直观的关节空间或笛卡尔空间 对应关系;键盘或游戏手柄不需要专用机械设备,适合发出离散或增量式命令;VR、动作追踪与 手持接口则无需同构机械主手,也能更直接地追踪操作者。全身接口还可以同时覆盖移动底盘和 双臂动作。ALOHA 与 GELLO 是低成本硬件路线的代表,Mobile ALOHA 则把这种思路扩展到 移动双臂任务。
课程自制示意图。四个面板比较的是代表性接口直接产生的命令及其所需映射,并不是控制质量 排名;真实系统也可以组合多种接口。
它的主要优势是行为与真实任务直接相关:操作者能根据接触作出反应、修正小失误,并在真实 环境中展示任务策略。代价是操作者时间、设备标定、疲劳和技能差异,还要检查同步质量与 失败演示。更好的交互设备能改善采集体验,却不会自动消除这些数据质量问题。
当任务需要人的判断和接触过程中的在线恢复,或者少量高价值演示可以为后续采集提供 seed 时,遥操作通常是合适的起点。
拖动示教:直接引导机器人本体
拖动示教允许人推动一台柔顺或可回驱的机器人走过目标轨迹。教师与学习者使用同一机器人 本体,因此从任务想法得到少量 robot-native trajectory 的路径很短。
实际操作时,机器人会先进入厂商支持的手动引导、重力补偿或柔顺控制模式。示教者握住 机械臂或末端执行器,引导它完成期望运动;这并不是在制动锁止或刚性位置控制下强行拉扯 机械臂。
课程自制示意图。与遥操作不同,人直接引导目标机器人本体。关节状态和末端位姿由这台 机器人直接产生;夹爪开合或模式切换仍可能需要按钮、脚踏开关或额外标注。
这种直观性也带来约束:机器人必须能够安全地被物理引导;示教过程未必能复现自主运行所需 的力和速度;大量、多样 episode 仍然需要持续人工投入。它适合在有限工位内快速教授轨迹, 却不是通往互联网规模数据的通用方案。
脚本化专家:直接编码任务结构
脚本化专家把已知任务状态转换成一系列目标和运动基元。在仿真中,它容易复现、便于插入 诊断,并且写好以后可以低成本重复运行。每个阶段都能附带标签,每个 episode 也能通过程序化 成功判据检查。
课程自制示意图。选择阶段、子目标、运动基元和转换规则的是程序,而不是逐步发命令的人, 也不是预先训练得到的策略。图中阶段名称特意保持通用; 脚本化专家正文会展示这种模式在抓取放置任务中的 一种具体实现。
它的局限来自所依赖的知识:脚本可能需要物体位姿、任务特定抓取 profile,或部署策略无法 看到的仿真状态。适用于结构化抓取放置的规则,遇到视觉歧义、柔性物体、未建模接触或 长时程恢复时可能很脆弱。
当任务几何和成功条件都很明确,并且需要一个清楚、可复现的起点时,脚本化专家很合适。 这正是 L08 当前任务的条件。
特权学习专家:自动获得更丰富的行为
强化学习或 model-based teacher 可以使用仿真状态、reward 和大量并行试验,学到难以用固定 状态机逐条编写的行为。训练完成后,它可以在受控变化下自动生成许多 rollout。
课程自制示意图。“特权”表示教师可以使用部署时不可获得的精确仿真信号;“学习”表示它的 行为来自优化,而不是手写阶段程序。导出的演示会把实际执行的教师动作与 student 真正能够 获得的 observation 配对。
自动化并不等于没有成本:reward 和环境设计、训练算力、teacher 验证与分布覆盖都会变成 采集流程的一部分。如果 teacher 能看到特权状态,它的动作可以监督 student,但 student 最终仍要依靠部署时真正可见的 observation 行动。
当固定脚本过于脆弱,而仿真又能提供可靠状态、目标和可重复试验时,这条路线更有吸引力。
自动扩增:放大可信 seed
MimicGen 一类系统会把成功演示的片段变换到新的场景配置,再在仿真中执行生成轨迹,从而 得到更多 episode。这里的关键是“执行”:经过几何变换的轨迹只是候选项,只有重新经历接触 并通过任务结果检查后,才能成为演示数据。
课程自制示意图。变换负责扩大规模,物理重放和结果过滤负责保留有效性。只复制或扭曲一条 轨迹,并不能让结果自动成为成功演示。
自动扩增能增加物体位姿与场景覆盖,而不必要求人类示范每一种组合。它的覆盖仍受 seed demonstration、变换假设和可复用任务片段限制。质量较差的 seed 或无效变换,同样可以高效 放大失败。
当少量演示已经覆盖任务结构,并且环境支持自动重放与结果检查时,这种方法最有价值。
人类视频迁移:行为广泛,但控制信号间接
普通人类视频覆盖的物体、环境和任务语义非常丰富。UMI、EgoMimic 等工作探索了带设备的 第一视角采集:通过估计轨迹,或使用能够与机器人末端运动建立关系的接口,缩小人类行为与 机器人动作之间的距离。
课程自制示意图。完整人体骨架是一种可能的中间表示,尤其适用于人形机器人或全身任务; 桌面操作通常更直接地使用手或手腕运动、物体轨迹、接触事件和物体相对几何。
但 embodiment gap 仍然存在。像素不会直接给出机器人关节命令、夹爪力、时序或无碰撞 路径;视角、尺度、遮挡、手部形态和接触都会影响转换。因此,retarget 后的动作还要检查 机器人可达性与物理执行,才能成为机器人演示。
人类视频尤其适合提供任务多样性、表征学习信号和高层动作建议。要把这些信息落实到具体 机器人与控制接口,robot-native data 仍然重要。
优点、局限与适用场景
| 路线 | 主要优点 | 主要局限 | 更适合的场景 |
|---|---|---|---|
| 遥操作 | 保留人的任务策略与真实环境中的在线恢复 | 依赖设备映射和人工采集成本 | 复杂、接触丰富的真实任务 |
| 拖动示教 | 直观地产生 robot-native trajectory | 受硬件和数据规模限制 | 有限工位内的快速示教 |
| 脚本化专家 | 可复现、可解释、可自动检查 | 依赖任务特定假设与特权状态 | 结构化仿真任务 |
| 特权学习专家 | 在更丰富变化下自动生成行为 | 需要训练 teacher、设计 reward 并处理 transfer gap | 大规模仿真采集 |
| 自动扩增 | 从少量 seed 扩大覆盖 | 受 seed 质量和变换有效性限制 | 结构相近、可重放检查的任务 |
| 人类视频迁移 | 任务和场景多样性丰富 | 缺少机器人动作与物理对应关系 | 语义先验与跨本体研究 |
成本和质量都不是一个数字。例如,一条遥操作 episode 会消耗较多人工时间,但可能包含有 价值的失败恢复;一条脚本演示可以低成本重复,却会继承相同的任务假设。怎样比较它们,取决 于下一阶段的学习器真正需要什么。
近期方向是组合路线,而不是选出唯一赢家
近期系统越来越倾向于组合多种获取路线,而不是用一种方法完全取代其他方法。
课程自制示意图,依据文末论文与项目所代表的技术方向整理;它不是时间线或性能排名。
下面三类进展让这种组合更有价值:
- 降低人工采集门槛。 低成本主手、移动或双臂系统、便携末端接口和沉浸式控制,目标 都是让有用行为不再局限于一套固定实验室设备。
- 扩展并汇聚数据。 仿真专家与 seed-based generation 可以批量产生受控 episode; DROID、Open X-Embodiment 等项目则说明,跨场景、机构、任务或机器人本体汇聚数据时, 必须明确 normalization 与 metadata。
- 利用更广的视觉经验。 第一视角及其他人类视频能增加任务和场景多样性,但从视觉行为 落到可控制动作,仍需要 robot-native execution 与结果检查。
一种实际的混合管线可以先采集少量高质量人工演示,再在仿真中扩展适合复用的部分,通过 任务判据剔除失败,最后与更广泛的机器人数据组合。人类视频可以帮助表征或任务理解,但不应 被错误标成 joint-level supervision。
本讲只讨论数据从哪里来。L09 将定义具体的时间与存储合同,L12 再说明策略怎样使用准备好的 数据集。
从任务出发选择路线
面对任何候选来源,都可以依次询问:
- 原始信号: 它提供机器人动作、实测状态、图像、物体运动,还是只展示任务过程?
- 采集环境: 数据来自目标机器人、其他本体、仿真,还是人类活动?
- 规模与覆盖: 每增加一种任务变化,需要付出多少人工、硬件、仿真或训练成本?
- 物理有效性: 动作是否已经在机器人或仿真器中执行,还是仍需 retarget 和重放?
- 任务结果: success 能否自动标注,还是需要人工或其他模型判断?
- 适配器: 正式记录前,还需要怎样的标定、动作转换、同步或过滤?
这些问题会自然导向 L08 的选择。banana-to-bowl 任务具有已知物体位姿、配置好的 Franka、 可用的 IK 与 path planning,以及可计算的 containment 结果。脚本化专家因此能够提供一个 小而透明的起点,让我们在 L09 批量记录 episode 之前先看清每个阶段。
检查问题
- 为什么 RGB 视频不能直接等同于机器人动作轨迹?
- 当前仿真任务中,哪条路线最容易得到明确的自动 success label?哪些任务假设支持它?
- 为什么自动扩增后的候选轨迹必须重放,不能只因为几何变换成功就直接接受?
- 跨本体汇聚增加了什么能力?哪些差异仍需要 normalization?
- 举出一个更适合先用遥操作而不是脚本化专家的任务,并说明取舍。
小结
- 演示数据来源首先在原始信号上不同,而不只是文件格式不同。
- 人类引导的方法能够提供任务判断与失败恢复,但需要设备、标定和人工采集投入。
- 脚本和仿真中的学习型专家能扩展可重复行为,却依赖任务结构、特权状态和可靠结果检查。
- 自动扩增只有经过物理重放与成功过滤,才能真正放大 seed demonstration。
- 人类视频扩大任务覆盖,但还需 embodiment mapping 与机器人执行证据。
- 当前数据策略越来越倾向于组合这些优势。L08 选择脚本化专家,是因为当前任务结构明确、 状态可观测、结果可自动检查。
继续学习脚本化抓取放置专家。
参考资料
- Argall et al., “A Survey of Robot Learning from Demonstration”, Robotics and Autonomous Systems, 2009——Learning from Demonstration 的基础术语与接口。
- Zhao et al., “Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware”, 2023——ALOHA 与低成本双臂遥操作。
- Wu et al., “GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators”, 2023。
- Fu et al., “Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation”, 2024。
- Chi et al., “Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots”, 2024。
- Khazatsky et al., “DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset”, 2024。
- Open X-Embodiment Collaboration, “Open X-Embodiment: Robotic Learning Datasets and RT-X Models”, 2023。
- Mandlekar et al., “MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations”, 2023。
- Kareer et al., “EgoMimic: Scaling Imitation Learning via Egocentric Video”, 2024。