Capítulos
En esta página
6. Tecnologías y módulos
Este capítulo conecta la introducción con los cursos. Aprende qué hace cada módulo, estudia sus principios en fundamentos y prueba los métodos en proyectos. Empieza por un área que te interese y repasa los requisitos cuando los necesites.
6.1 Algoritmos de modelos fundacionales
Ante «pon la taza roja sobre el plato», un VLM interpreta imagen e instrucción, un VLA genera acciones y un modelo del mundo predice sus consecuencias. Pueden colaborar en un mismo sistema.
VLM: comprender imágenes y lenguaje
Un modelo de visión-lenguaje procesa imágenes y texto para describir, responder preguntas, entender objetivos y razonar sobre tareas. Estudia cómo se codifican las imágenes, cómo los modelos lingüísticos procesan secuencias y cómo se fusionan ambos tipos de información.
Los módulos incluyen Transformers, modelos de lenguaje, codificadores visuales, alineación imagen-texto y fusión multimodal. El modelo debe relacionar «taza roja» con el objeto de la imagen para informar las acciones posteriores.
Ruta: fundamentos multimodales → codificadores visuales y alineación → fusión multimodal y VLM.
VLA: de comprender a actuar
Un VLA genera acciones a partir de imágenes, instrucciones y estado robótico. Puede producir consignas articulares, objetivos del efector o secuencias continuas.
Estudia representaciones de acciones, imitación, bloques de acciones, difusión, flow matching e integración en el ciclo de control. OpenVLA y π0 muestran diseños distintos; el postentrenamiento usa resultados de interacción para mejorar la política.
Ruta: de VLM a VLA → introducción a VLA → OpenVLA / π0.
Práctica: π₀.₅ + RECAP, con preparación de datos, modelos de valor, ajuste de políticas y evaluación simulada.
Modelos del mundo: predecir consecuencias
Aprenden cómo cambia un entorno con el tiempo y las acciones. A partir de observaciones y acciones candidatas predicen estados, imágenes o representaciones latentes para planificación, aprendizaje de políticas o evaluación.
Estudia predicción condicionada por acciones, dinámica latente, predicción de vídeo y error acumulado a varios pasos. Comprende cómo ayudan a elegir acciones y cómo comprobar su fiabilidad en entornos nuevos.
Ruta: introducción → panorama y enfoques técnicos. El contenido actual se centra en conceptos, métodos y revisiones de investigación.
Una secuencia útil es «fundamentos multimodales → VLM → VLA», seguida de modelos del mundo para planificación o aprendizaje de políticas.
6.2 Algoritmos de manipulación
Sigue el proceso desde identificar un objeto hasta planificar, establecer contacto y completar la tarea.
- Cinemática y planificación: la directa calcula la pose del efector a partir de articulaciones; la inversa busca configuraciones. La planificación añade restricciones de trayectoria y colisión. Empieza por transformaciones y cinemática, después MoveIt 2.
- Imitación y generación de acciones: aprende de observaciones y acciones demostradas. ACT predice bloques; Diffusion Policy genera secuencias por difusión. Ruta: imitación, ACT, Diffusion Policy.
- Contacto y fuerza: estudia seguimiento de posición, flexibilidad y fuerzas de contacto en control de impedancia y fuerza.
Práctica: proyecto MoveIt 2 para planificación y ejecución; ACT bimanual para datos, entrenamiento y evaluación. ACT es una entrada a manipulación aprendida; su método original no depende de instrucciones lingüísticas.
6.3 Control del movimiento
El control hace que articulaciones y cuerpo ejecuten acciones de forma fiable. Empieza por retroalimentación y cinemática, y continúa con modelos y políticas aprendidas.
- Retroalimentación: corrige señales según el error entre estado deseado y actual. Aprende PID/PD, muestreo, límites y estabilidad en retroalimentación y PID.
- Control basado en modelos: dinámica, LQR, seguimiento y MPC para elegir señales y tratar restricciones. Sigue el curso de controladores.
- Control por refuerzo: define observaciones, acciones y recompensas. Empieza con MDP y PPO, después recompensas, aleatorización y sim-to-real.
Práctica: cuadrúpedo desde cero conecta PD, cinemática y marchas; MicroDuck RL muestra entrenamiento y evaluación del movimiento.
6.4 Navegación
«Percibir → estimar posición → planificar ruta → ejecutar y evitar obstáculos» requiere referencias coherentes y sensores fiables.
- Percepción y calibración: cámaras, LiDAR, IMU, parámetros intrínsecos y extrínsecos, sincronización y proyección. Consulta calibración y proyección de sensores.
- Localización y cartografía: la estimación fusiona observaciones; SLAM localiza mientras construye el mapa. Estudia deriva y alineación en odometría, marcas temporales y estado.
- Planificación y ejecución: buscar rutas y generar órdenes que respeten obstáculos y movimiento. Nav2 organiza planificación, control y recuperación; VLN incorpora lenguaje y semántica.
Ya hay material sobre calibración, estimación y tf2. Los proyectos de cartografía y navegación y navegación con visión y lenguaje siguen previstos.
6.5 Ingeniería de simulación
La simulación ofrece experimentos repetibles. Empieza por una escena mínima y añade robot, sensores, controlador y tarea.
- Modelos y escenas: articulaciones, eslabones, inercia, colisiones y actuadores con URDF y MJCF.
- Física y sensores: pasos temporales, contacto, fricción y parámetros de sensores con MuJoCo o Isaac Sim.
- Entrenamiento y evaluación: interfaces de observación, acción, recompensa y reinicio, paralelismo, aleatorización y ensayos repetidos. Empieza por Gymnasium.
Práctica: introducción a MuJoCo para crear y ejecutar un entorno; MicroDuck RL para un flujo completo.
6.6 Ingeniería de datos
Organiza observaciones, acciones e información de tarea en trayectorias que puedan recogerse, verificarse, almacenarse y entrenarse correctamente.
- Teleoperación y recogida: mapea entradas del operador a acciones mientras registras imágenes, articulaciones y tiempo.
- Organización y calidad: límites de episodios, etiquetas, unidades, frecuencias y calibración; detecta fotogramas perdidos, desalineaciones y acciones anómalas.
- Preparación: normalización, particiones de entrenamiento y validación, versiones, carga por lotes y efecto de la distribución.
Ruta: conjuntos de datos y curso LeRobot.
Práctica: SO-101 conecta dispositivos, control y datos; ACT bimanual lleva demostraciones a entrenamiento y evaluación.
6.7 Ingeniería de despliegue
Conecta las salidas de modelos con un robot operativo, desde sensores hasta actuadores.
- ROS 2 y comunicación: nodos, topics, servicios, acciones y lanzamiento en bases de ingeniería ROS 2.
- Inferencia y ejecución: latencia, frecuencias, bloques y asincronía en RTC. ONNX Runtime y TensorRT ayudan a ejecutar y optimizar modelos.
- Interfaces y depuración: convierte acciones en posición, velocidad o par y comprueba unidades, tiempos, límites y anomalías en integración de controladores.
Práctica: MoveIt 2 para conectar módulos y SO-101 para conectividad y un ciclo mínimo de control.
6.8 Hardware
Comprender el hardware ayuda a saber qué se puede controlar y observar y qué límites físicos respetar.
- Mecánica y actuadores: eslabones, articulaciones, transmisiones, motores y reductores; DoF, alcance, carga, holgura y rigidez.
- Electrónica y accionamientos: alimentación, circuitos de sensores, encoders y la relación entre control de corriente, velocidad y posición.
- Sistemas embebidos: MCU, tareas en tiempo real y buses CAN; cómo llegan las órdenes y regresa el estado.
Empieza por URDF y modelos y conecta modelado con control en el curso de cuadrúpedos. Diseño mecánico y CAN y MCU son todavía páginas pendientes de contenido.
Empieza por un módulo
Elige un problema concreto: fusión imagen-texto, una política de manipulación o seguimiento articular. Lee la teoría, completa un experimento y registra entradas, salidas y resultados. Conecta gradualmente los módulos en un sistema.
Consulta 7. Perfiles profesionales y los recursos.