跳到主要内容

查看 Markdown

页面正文已转为 Markdown。交互图形可通过文末链接在原网页查看。

6. 技术栈

这一章是后续课程的导读。先认识各个技术模块解决什么问题,再进入理论基础学习原理,通过项目实战把方法运行起来。可以从感兴趣的方向开始,遇到前置知识再回头补齐。

6.1 大模型算法​

大模型方向可以先认识 VLM、VLA 和世界模型。以“把红色杯子放到盘子里”为例,VLM 帮助理解图像与指令,VLA 根据观测生成动作,世界模型用于预测动作可能带来的变化。这些能力可以在一个系统中配合使用。

VLM:理解图像与语言​

视觉语言模型(Vision-Language Model)把图像和文本放到同一个模型中处理,支持描述、问答、目标理解和任务推理。学习时先了解图像怎样变成视觉特征、语言模型怎样处理序列,再理解两种信息怎样融合。

主要模块包括 Transformer、语言模型、视觉编码器、图文对齐和多模态融合。例如,模型需要把指令中的“红色杯子”与画面中的对象联系起来,才能为后续行动提供语义信息。

继续学习:多模态大模型基础 → 视觉编码器与对齐 → 多模态融合与 VLM。

VLA:从理解走向动作​

视觉语言动作模型(Vision-Language-Action Model)根据图像、语言指令和机器人状态等信息生成动作。输出可以是关节或末端执行器的控制目标,也可以是一段连续动作序列。

学习重点包括动作表示、模仿学习、动作分块、扩散或流匹配生成,以及模型输出怎样接入机器人控制循环。OpenVLA、π0 等工作提供了不同的实现路线;后训练则研究怎样利用交互结果继续改进策略。

继续学习:从 VLM 到 VLA → VLA 系列导读 → OpenVLA / π0。

动手实践:π₀.₅ + RECAP 复现,学习数据准备、价值模型、策略微调与仿真评测的流程。

世界模型:预测行动的后果​

世界模型学习环境怎样随时间和动作变化。在机器人任务中,可以用当前观测和候选动作预测未来状态、图像或隐空间表征,再利用预测结果做规划、策略学习或评测。

学习重点包括动作条件预测、隐空间动力学、视频预测,以及多步预测误差。要理解预测结果怎样帮助选动作,也要检查模型在新场景中是否可信。

继续学习:世界模型导读 → 世界模型综述与技术路线。当前站内以概念、方法与研究综述为主。

刚开始学习时,可以按“多模态基础 → VLM → VLA”的顺序建立理解,再结合规划或策略学习了解世界模型。

6.2 操作算法​

操作算法研究怎样让机器人与物体交互。可以沿着“确定目标 → 规划动作 → 接触物体 → 完成任务”的过程学习。

  • 运动学与规划:正向运动学从关节角计算末端位姿,逆向运动学反求关节配置;运动规划进一步处理路径与碰撞约束。先学坐标变换与运动学,再学 MoveIt 2。
  • 模仿学习与动作生成:从示教中的观测和动作学习策略。ACT 用动作分块预测一段动作,Diffusion Policy 用扩散过程生成动作序列。可从模仿学习进入 ACT 与 Diffusion Policy。
  • 接触与力控:物体接触会引入力与形变,需要理解位置跟踪、柔顺性和接触力的关系,继续阅读阻抗控制与力控。

动手实践:MoveIt 2 仿真项目连接规划与执行;ACT 双臂训练走通数据、训练和评测。ACT 是学习型操作的入门实验,原始方法不依赖语言指令。

6.3 运控算法​

运控算法让关节和身体稳定地执行动作。先理解误差反馈与运动学,再分别学习基于模型的控制和通过交互训练的策略。

  • 反馈控制:根据目标与当前状态的误差调整控制量,认识 PID / PD、采样频率、限幅和稳定性。入口是闭环与 PID。
  • 模型控制:用动力学模型预测运动,理解 LQR、轨迹跟踪和 MPC 怎样选择控制量、处理约束。可以沿控制器导览逐章学习。
  • 强化学习控制:定义观测、动作和奖励,让策略在环境中反复试验。先学 MDP 与 PPO,再了解奖励设计、域随机化与 sim2real。

动手实践:从零搭建四足机器人串起 PD、运动学与步态;MicroDuck RL展示仿真中的策略训练与动作评测。

导航可以按“感知环境 → 估计位置 → 规划路径 → 执行与避障”的顺序理解。每一步都依赖一致的坐标系和可信的传感器数据。

  • 感知与标定:认识相机、激光和 IMU 等传感器,学习内外参、时间同步与坐标投影。入口是传感器标定和传感器投影。
  • 定位与建图:状态估计融合观测来估计运动,SLAM 同时估计自身位置并构建地图。可以先学 ODO、时间戳与状态估计,理解漂移与数据对齐。
  • 路径规划与导航执行:在地图中搜索路径,根据障碍和运动约束生成可执行指令。Nav2 等工具把规划、控制与恢复行为组织起来;视觉语言导航还会结合自然语言目标与语义信息。

当前可先完成标定、状态估计与 tf2 的学习。建图导航实战和视觉语言导航实战仍待补充。

6.5 仿真工程​

仿真为算法提供可重复的实验环境。学习时从一个最小场景开始,再加入机器人、传感器、控制器和训练任务。

  • 机器人与场景描述:理解关节、连杆、惯量、碰撞体和执行器怎样组成模型,学习 URDF 与 MJCF。
  • 物理与传感器仿真:认识时间步、接触、摩擦和传感器配置怎样影响结果,通过 MuJoCo 或 Isaac Sim 学习环境搭建。
  • 训练环境与评测:将观测、动作、奖励和重置条件组织成统一接口,理解并行训练、域随机化与重复评测。先从 Gymnasium 的环境接口入手。

动手实践:MuJoCo 仿真入门创建并运行一个环境,再结合 MicroDuck RL阅读完整训练流程。

6.6 数据工程​

机器人学习需要把传感器观测、动作和任务信息组织成连续轨迹。数据工程关注这些记录能否被正确采集、检查、存储和用于训练。

  • 遥操作与采集:理解操作者输入怎样映射成机器人动作,同时记录图像、关节状态和时间戳。
  • 数据组织与质量:认识一条轨迹的起止、任务标签、动作单位、控制频率和标定信息,检查掉帧、错位与异常动作。
  • 训练数据准备:学习归一化、训练 / 验证划分、数据版本和批量读取,理解数据分布怎样影响策略。

继续学习:具身数据集帮助理解数据说明;LeRobot 课程介绍机器人学习工具链。

动手实践:SO-101 真机教程连接设备、控制与数据流程;ACT 双臂训练展示示教数据怎样进入训练和评测。

6.7 部署工程​

部署把模型输出接到实际系统中,需要关注从传感器输入到执行器动作的整条链路。

  • ROS 2 与系统通信:学习节点、Topic、Service、Action 和启动配置,理解模块怎样交换状态与命令。入口是 ROS 2 工程基础。
  • 模型推理与动作执行:理解推理延迟、控制频率、动作分块和异步执行,阅读 RTC 实时执行;ONNX Runtime、TensorRT 等工具用于模型运行与推理优化。
  • 控制接口与调试:把策略动作映射到位置、速度或力矩命令,检查单位、时序、限幅和异常状态。入口是控制器集成。

动手实践:从 MoveIt 2 仿真项目理解系统连接,再参考 SO-101 真机教程完成设备连通与最小控制回路。

6.8 硬件​

理解硬件有助于判断算法实际能控制什么、观测什么,以及会受到哪些物理约束。

  • 机械与执行器:认识连杆、关节、传动、电机和减速器,理解自由度、工作空间、负载、回差与刚度。
  • 电子与电机驱动:认识供电、传感器电路、编码器和驱动器,理解电流、速度与位置控制之间的关系。
  • 嵌入式与通信:认识 MCU、实时任务和 CAN 等总线,理解上位机命令怎样到达执行器、状态怎样返回。

可以先通过 URDF 与机器人模型建立结构认识,再结合四足机器人课程理解模型与控制的联系。机械结构和 CAN 与 MCU 通信目前仍是待完善入口。

从一个模块开始​

先选择一个具体问题,例如理解 VLM 的图文融合、训练一个操作策略,或让一个关节跟踪目标。读对应的理论章节,再完成一个已有实验,记录输入、输出和结果。这样可以逐步把单个模块连接成完整的机器人系统。

岗位职责见 7. 就业岗位;论文、代码与工具入口见领域资源。