Saltar al contenido principal

Ver como Markdown

Contenido convertido a Markdown. Usa el enlace a la página original al final para explorar los gráficos interactivos.

6. Tecnologías y módulos

Este capítulo conecta la introducción con los cursos. Aprende qué hace cada módulo, estudia sus principios en fundamentos y prueba los métodos en proyectos. Empieza por un área que te interese y repasa los requisitos cuando los necesites.

6.1 Algoritmos de modelos fundacionales​

Ante «pon la taza roja sobre el plato», un VLM interpreta imagen e instrucción, un VLA genera acciones y un modelo del mundo predice sus consecuencias. Pueden colaborar en un mismo sistema.

VLM: comprender imágenes y lenguaje​

Un modelo de visión-lenguaje procesa imágenes y texto para describir, responder preguntas, entender objetivos y razonar sobre tareas. Estudia cómo se codifican las imágenes, cómo los modelos lingüísticos procesan secuencias y cómo se fusionan ambos tipos de información.

Los módulos incluyen Transformers, modelos de lenguaje, codificadores visuales, alineación imagen-texto y fusión multimodal. El modelo debe relacionar «taza roja» con el objeto de la imagen para informar las acciones posteriores.

Ruta: fundamentos multimodales → codificadores visuales y alineación → fusión multimodal y VLM.

VLA: de comprender a actuar​

Un VLA genera acciones a partir de imágenes, instrucciones y estado robótico. Puede producir consignas articulares, objetivos del efector o secuencias continuas.

Estudia representaciones de acciones, imitación, bloques de acciones, difusión, flow matching e integración en el ciclo de control. OpenVLA y π0 muestran diseños distintos; el postentrenamiento usa resultados de interacción para mejorar la política.

Ruta: de VLM a VLA → introducción a VLA → OpenVLA / π0.

Práctica: π₀.₅ + RECAP, con preparación de datos, modelos de valor, ajuste de políticas y evaluación simulada.

Modelos del mundo: predecir consecuencias​

Aprenden cómo cambia un entorno con el tiempo y las acciones. A partir de observaciones y acciones candidatas predicen estados, imágenes o representaciones latentes para planificación, aprendizaje de políticas o evaluación.

Estudia predicción condicionada por acciones, dinámica latente, predicción de vídeo y error acumulado a varios pasos. Comprende cómo ayudan a elegir acciones y cómo comprobar su fiabilidad en entornos nuevos.

Ruta: introducción → panorama y enfoques técnicos. El contenido actual se centra en conceptos, métodos y revisiones de investigación.

Una secuencia útil es «fundamentos multimodales → VLM → VLA», seguida de modelos del mundo para planificación o aprendizaje de políticas.

6.2 Algoritmos de manipulación​

Sigue el proceso desde identificar un objeto hasta planificar, establecer contacto y completar la tarea.

  • Cinemática y planificación: la directa calcula la pose del efector a partir de articulaciones; la inversa busca configuraciones. La planificación añade restricciones de trayectoria y colisión. Empieza por transformaciones y cinemática, después MoveIt 2.
  • Imitación y generación de acciones: aprende de observaciones y acciones demostradas. ACT predice bloques; Diffusion Policy genera secuencias por difusión. Ruta: imitación, ACT, Diffusion Policy.
  • Contacto y fuerza: estudia seguimiento de posición, flexibilidad y fuerzas de contacto en control de impedancia y fuerza.

Práctica: proyecto MoveIt 2 para planificación y ejecución; ACT bimanual para datos, entrenamiento y evaluación. ACT es una entrada a manipulación aprendida; su método original no depende de instrucciones lingüísticas.

6.3 Control del movimiento​

El control hace que articulaciones y cuerpo ejecuten acciones de forma fiable. Empieza por retroalimentación y cinemática, y continúa con modelos y políticas aprendidas.

  • Retroalimentación: corrige señales según el error entre estado deseado y actual. Aprende PID/PD, muestreo, límites y estabilidad en retroalimentación y PID.
  • Control basado en modelos: dinámica, LQR, seguimiento y MPC para elegir señales y tratar restricciones. Sigue el curso de controladores.
  • Control por refuerzo: define observaciones, acciones y recompensas. Empieza con MDP y PPO, después recompensas, aleatorización y sim-to-real.

Práctica: cuadrúpedo desde cero conecta PD, cinemática y marchas; MicroDuck RL muestra entrenamiento y evaluación del movimiento.

«Percibir → estimar posición → planificar ruta → ejecutar y evitar obstáculos» requiere referencias coherentes y sensores fiables.

  • Percepción y calibración: cámaras, LiDAR, IMU, parámetros intrínsecos y extrínsecos, sincronización y proyección. Consulta calibración y proyección de sensores.
  • Localización y cartografía: la estimación fusiona observaciones; SLAM localiza mientras construye el mapa. Estudia deriva y alineación en odometría, marcas temporales y estado.
  • Planificación y ejecución: buscar rutas y generar órdenes que respeten obstáculos y movimiento. Nav2 organiza planificación, control y recuperación; VLN incorpora lenguaje y semántica.

Ya hay material sobre calibración, estimación y tf2. Los proyectos de cartografía y navegación y navegación con visión y lenguaje siguen previstos.

6.5 Ingeniería de simulación​

La simulación ofrece experimentos repetibles. Empieza por una escena mínima y añade robot, sensores, controlador y tarea.

  • Modelos y escenas: articulaciones, eslabones, inercia, colisiones y actuadores con URDF y MJCF.
  • Física y sensores: pasos temporales, contacto, fricción y parámetros de sensores con MuJoCo o Isaac Sim.
  • Entrenamiento y evaluación: interfaces de observación, acción, recompensa y reinicio, paralelismo, aleatorización y ensayos repetidos. Empieza por Gymnasium.

Práctica: introducción a MuJoCo para crear y ejecutar un entorno; MicroDuck RL para un flujo completo.

6.6 Ingeniería de datos​

Organiza observaciones, acciones e información de tarea en trayectorias que puedan recogerse, verificarse, almacenarse y entrenarse correctamente.

  • Teleoperación y recogida: mapea entradas del operador a acciones mientras registras imágenes, articulaciones y tiempo.
  • Organización y calidad: límites de episodios, etiquetas, unidades, frecuencias y calibración; detecta fotogramas perdidos, desalineaciones y acciones anómalas.
  • Preparación: normalización, particiones de entrenamiento y validación, versiones, carga por lotes y efecto de la distribución.

Ruta: conjuntos de datos y curso LeRobot.

Práctica: SO-101 conecta dispositivos, control y datos; ACT bimanual lleva demostraciones a entrenamiento y evaluación.

6.7 Ingeniería de despliegue​

Conecta las salidas de modelos con un robot operativo, desde sensores hasta actuadores.

  • ROS 2 y comunicación: nodos, topics, servicios, acciones y lanzamiento en bases de ingeniería ROS 2.
  • Inferencia y ejecución: latencia, frecuencias, bloques y asincronía en RTC. ONNX Runtime y TensorRT ayudan a ejecutar y optimizar modelos.
  • Interfaces y depuración: convierte acciones en posición, velocidad o par y comprueba unidades, tiempos, límites y anomalías en integración de controladores.

Práctica: MoveIt 2 para conectar módulos y SO-101 para conectividad y un ciclo mínimo de control.

6.8 Hardware​

Comprender el hardware ayuda a saber qué se puede controlar y observar y qué límites físicos respetar.

  • Mecánica y actuadores: eslabones, articulaciones, transmisiones, motores y reductores; DoF, alcance, carga, holgura y rigidez.
  • Electrónica y accionamientos: alimentación, circuitos de sensores, encoders y la relación entre control de corriente, velocidad y posición.
  • Sistemas embebidos: MCU, tareas en tiempo real y buses CAN; cómo llegan las órdenes y regresa el estado.

Empieza por URDF y modelos y conecta modelado con control en el curso de cuadrúpedos. Diseño mecánico y CAN y MCU son todavía páginas pendientes de contenido.

Empieza por un módulo​

Elige un problema concreto: fusión imagen-texto, una política de manipulación o seguimiento articular. Lee la teoría, completa un experimento y registra entradas, salidas y resultados. Conecta gradualmente los módulos en un sistema.

Consulta 7. Perfiles profesionales y los recursos.