跳到主要内容

Pupper VLA|视觉-语言-动作智能

这个方向把 Pupper 从“能走”推进到“能理解任务并行动”。最终 Demo 可以从一个清晰、可验证的目标开始:

找到红色的球并走过去。

系统需要从视觉输入中定位目标,理解自然语言指令,选择并调用运动技能,再根据执行结果判断任务是否完成。

实验目标

  • 建立相机输入与场景感知接口;
  • 将自然语言指令转换为结构化任务;
  • 设计稳定、可约束的 Action 或 Skill 接口;
  • 串联 Vision-Language 理解、任务决策与 Pupper 执行;
  • 在 AMD 平台上验证端到端推理与完整 Demo。

实验主线

模块内容阶段产出
01 实验介绍定义任务场景、成功条件与失败类型Demo 验收标准
02 视觉输入获取相机图像并统一时间戳、坐标与预处理稳定的视觉输入
03 自然语言指令解析目标、属性、动作与约束结构化任务描述
04 Vision-Language 理解识别目标及其与机器人的空间关系目标与场景状态
05 Action / Skill 接口封装移动、转向、停止、观察与状态查询可调用技能集合
06 VLA Pipeline串联感知、规划、执行和反馈可观测的任务流程
07 Pupper 执行将高层动作转换为底层运动命令机器人执行记录
08 AMD 平台实验记录推理环境、延迟、资源占用与结果可复现实验记录
09 完整 Demo在多目标、遮挡或指令变化下完成任务视频、轨迹与结果报告

Skill 接口设计

VLA 层不应直接生成每个关节的控制量。更稳妥的边界是让它调用经过验证的机器人技能,例如:

Skill作用关键约束
observe获取目标与场景状态返回置信度与时间戳
walk按速度或目标方向移动限制速度、持续时间与可行区域
turn调整朝向限制角速度与转角
stop安全停止任何异常都可以触发
get_state查询位姿、执行状态和错误信息为重规划提供反馈

这种分层让视觉语言模型负责任务理解与技能选择,让已经验证的运动策略负责实时控制,也便于定位失败发生在感知、决策还是执行阶段。

复用已有能力

本方向不会重新讲解 Pupper 搭建、运动学或底层控制。开始前请先完成 《从零到一搭建四足机器人》,或准备等价的模型与技能接口。视觉和语言部分可以分别复用教程中的 视觉感知语言控制 能力;运动执行优先使用 Pupper Locomotion 训练得到的策略。

完成标准

  • 指令、视觉输入、模型输出、技能调用和执行结果能够完整记录;
  • Demo 的成功条件可以客观判断,例如目标距离进入阈值且机器人安全停止;
  • 每个 Skill 都有参数范围、超时、异常返回和安全停止机制;
  • 至少测试目标缺失、识别置信度不足或运动执行失败等异常场景;
  • AMD 平台实验记录包含推理延迟、资源占用、成功率和典型失败案例。

完成基础 Demo 后,可以逐步增加颜色与物体类别、组合指令、动态目标和多轮反馈,但每次扩展都应保留可独立验证的成功条件。