Pupper VLA|视觉-语言-动作智能
这个方向把 Pupper 从“能走”推进到“能理解任务并行动”。最终 Demo 可以从一个清晰、可验证的目标开始:
找到红色的球并走过去。
系统需要从视觉输入中定位目标,理解自然语言指令,选择并调用运动技能,再根据执行结果判断任务是否完成。
实验目标
- 建立相机输入与场景感知接口;
- 将自然语言指令转换为结构化任务;
- 设计稳定、可约束的 Action 或 Skill 接口;
- 串联 Vision-Language 理解、任务决策与 Pupper 执行;
- 在 AMD 平台上验证端到端推理与完整 Demo。
实验主线
| 模块 | 内容 | 阶段产出 |
|---|---|---|
| 01 实验介绍 | 定义任务场景、成功条件与失败类型 | Demo 验收标准 |
| 02 视觉输入 | 获取相机图像并统一时间戳、坐标与预处理 | 稳定的视觉输入 |
| 03 自然语言指令 | 解析目标、属性、动作与约束 | 结构化任务描述 |
| 04 Vision-Language 理解 | 识别目标及其与机器人的空间关系 | 目标与场景状态 |
| 05 Action / Skill 接口 | 封装移动、转向、停止、观察与状态查询 | 可调用技能集合 |
| 06 VLA Pipeline | 串联感知、规划、执行和反馈 | 可观测的任务流程 |
| 07 Pupper 执行 | 将高层动作转换为底层运动命令 | 机器人执行记录 |
| 08 AMD 平台实验 | 记录推理环境、延迟、资源占用与结果 | 可复现实验记录 |
| 09 完整 Demo | 在多目标、遮挡或指令变化下完成任务 | 视频、轨迹与结果报告 |
Skill 接口设计
VLA 层不应直接生成每个关节的控制量。更稳妥的边界是让它调用经过验证的机器人技能,例如:
| Skill | 作用 | 关键约束 |
|---|---|---|
observe | 获取目标与场景状态 | 返回置信度与时间戳 |
walk | 按速度或目标方向移动 | 限制速度、持续时间与可行区域 |
turn | 调整朝向 | 限制角速度与转角 |
stop | 安全停止 | 任何异常都可以触发 |
get_state | 查询位姿、执行状态和错误信息 | 为重规划提供反馈 |
这种分层让视觉语言模型负责任务理解与技能选择,让已经验证的运动策略负责实时控制,也便于定位失败发生在感知、决策还是执行阶段。
复用已有能力
本方向不会重新讲解 Pupper 搭建、运动学或底层控制。开始前请先完成 《从零到一搭建四足机器人》,或准备等价的模型与技能接口。视觉和语言部分可以分别复用教程中的 视觉感知 与 语言控制 能力;运动执行优先使用 Pupper Locomotion 训练得到的策略。
完成标准
- 指令、视觉输入、模型输出、技能调用和执行结果能够完整记录;
- Demo 的成功条件可以客观判断,例如目标距离进入阈值且机器人安全停止;
- 每个 Skill 都有参数范围、超时、异常返回和安全停止机制;
- 至少测试目标缺失、识别置信度不足或运动执行失败等异常场景;
- AMD 平台实验记录包含推理延迟、资源占用、成功率和典型失败案例。
完成基础 Demo 后,可以逐步增加颜色与物体类别、组合指令、动态目标和多轮反馈,但每次扩展都应保留可独立验证的成功条件。