Capítulos
En esta página
3. Habilidades robóticas
El estudio de la IA corporizada empieza por definir la tarea. Modelarla bien y elegir objetivos y métricas apropiados suele importar más que seleccionar y optimizar el modelo. Primero veremos cómo definirla y después cuatro habilidades habituales.
3.1 Primero, define la tarea
Aclara la habilidad deseada, el entorno y las restricciones antes de elegir un método. ¿Qué sensores usarás? ¿Cuáles son las observaciones y las acciones? ¿Qué cuenta como finalización? ¿Medirás éxito, tiempo u otras métricas?
Comprueba también si la configuración es adecuada. Una cámara en la muñeca puede aportar detalles que una cámara superior no ve. Cambiar sensores cambia las condiciones de observación: documéntalo y compara métodos con configuraciones coherentes.
3.2 Convierte la tarea en un problema de aprendizaje
Especifica entradas, salidas y objetivos. En cada instante
La acción modifica el entorno, llega una nueva observación y continúa el ciclo. El aprendizaje por refuerzo define además una recompensa
| Elemento | Significado | Brazo que recoge una taza | Cuadrúpedo que avanza |
|---|---|---|---|
| Observación | Información disponible | Imágenes, ángulos articulares y apertura de pinza | Ángulos y velocidades articulares, orientación y velocidad angular de la IMU, orden de velocidad |
| Estado | Información completa, a menudo no observable | Pose, masa y fricción reales de la taza | Fricción del suelo, contactos y velocidad real del cuerpo |
| Acción | Salida de la política | Incrementos de pose del efector o consignas articulares, más apertura/cierre | Ángulos objetivo de 12 articulaciones |
| Objetivo | Qué lograr | Colocar la taza en la zona indicada | Avanzar a una velocidad dada |
| Condición de éxito | Qué significa completar | Taza bien colocada y vertical, sin colisiones | Seguir la velocidad, mantener equilibrio y reducir deslizamientos |
| Frecuencia de control | Frecuencia de las acciones | De unos pocos a decenas de hercios | Por ejemplo, política a 50 Hz y control articular más rápido |
- Las observaciones revelan solo parte del estado: la cámara no muestra el peso de la taza; se infiere mediante fuerzas y movimiento al levantarla. Es la observabilidad parcial, que puede compensarse con historial o sensores adicionales.
- La definición de acciones cambia la dificultad: consignas articulares o poses del efector, valores absolutos o incrementos, posiciones o pares tienen ventajas y costes distintos.
- Compara configuraciones coherentes: resultados con diferentes observaciones, acciones, frecuencias o criterios de éxito no son directamente comparables.
3.3 Cuatro habilidades habituales
Agarre, manipulación, locomoción y navegación son un punto de partida útil. Las dos primeras cambian los objetos; las otras mueven al robot. Cada habilidad incluye una demo 3D que puedes recorrer paso a paso.
Agarre
Pregunta: ¿cómo sujetar un objeto de forma estable?
El agarre establece contactos entre un efector final y un objeto para restringir su movimiento, hacer que acompañe al efector y evitar deslizamientos ante perturbaciones previstas.
Una pinza, una mano diestra o una ventosa sujeta el objeto antes de moverlo. Para poner un bloque en una caja, el robot primero lo agarra y levanta. Mantener esa sujeción es el agarre; transportarlo, colocarlo y soltarlo completa la tarea de recoger y colocar.
Demostración de habilidades en 3D
Sujetar bien y levantar
Observar el objetoLocalizar la posición y orientación del bloque y elegir zonas de contacto en lados opuestos.
La detección de agarres suele recibir nubes de puntos o imágenes RGB-D y predecir posición 3D, orientación 3D (6-DoF) y apertura de una pinza paralela. También hay que comprobar alcanzabilidad y colisiones.
Los enfoques geométricos y mecánicos estudian cierre de forma y cierre de fuerza. Los métodos basados en datos aprenden la calidad del agarre o generan poses. Ejemplos: Dex-Net, el dataset y benchmark GraspNet-1Billion y AnyGrasp. Los modelos analíticos también pueden generar datos de entrenamiento.
El agarre puede planificarse antes o corregirse continuamente con visión, fuerza o tacto; AnyGrasp permite seguir poses de agarre. Los objetos rígidos regulares en celdas controladas son un caso relativamente maduro. Las manos diestras, objetos transparentes o deformables, oclusiones y escenas desordenadas siguen planteando retos.
Manipulación
Pregunta: ¿cómo cambiar el estado de un objeto mediante el contacto?
La manipulación aplica fuerzas o movimiento deliberadamente para cambiar posición, orientación, forma u otro estado relevante de un objeto. Por ejemplo, agarrar el tirador de un cajón y tirar por sus guías hasta la apertura deseada.
Demostración de habilidades en 3D
Agarrar el tirador y abrir el cajón
Acercarse al tiradorObservar el tirador y la dirección de las guías, y acercar la pinza al tirador.
El agarre es un subproblema de la manipulación. Un agarre estable suele mantener la relación de contacto para que el objeto acompañe al efector; al manipular pueden cambiar los contactos mediante cambios de dedos, rodadura o nuevos agarres. Los puntos fijos de contacto no son una frontera absoluta entre ambos conceptos.
La manipulación incluye agarrar, transportar, empujar, desplazar, voltear, manipular dentro de la mano, doblar ropa, ordenar cuerdas, abrir puertas, usar herramientas, coordinar brazos y realizar tareas largas. Empujar un objeto o chutar un balón es manipulación no prensil: no exige sujetarlo primero.
Las tareas complejas eligen acciones continuamente a partir de imágenes, propiocepción y, en ocasiones, lenguaje. El aprendizaje por imitación (IL) y los VLA son líneas importantes: ACT predice bloques de acciones; Diffusion Policy combina generación con ejecución de horizonte deslizante; π0 y OpenVLA exploran políticas multitarea de visión, lenguaje y acción.
Los retos incluyen contactos cambiantes, estados parcialmente observados, varias acciones válidas y errores acumulados. La retroalimentación en lazo cerrado importa tanto en manipulación compleja como en agarre. Distingue reproducir una tarea fija de generalizar a objetos y entornos nuevos.
Locomoción
Pregunta: ¿cómo mover el cuerpo con estabilidad?
La locomoción desplaza al propio robot mediante la interacción de patas o ruedas con el entorno, coordinando postura y estabilidad. Un cuadrúpedo que sube un escalón debe coordinar elevación de patas, apoyos y desplazamiento del peso. Elegir una ruta hasta una puerta requiere además navegación.
Demostración de habilidades en 3D
Mantener el equilibrio y subir escalones
Preparar el apoyoLas cuatro patas sostienen el cuerpo mientras el robot se prepara para avanzar.
Los robots con patas gestionan marchas, equilibrio, escalones, pendientes y recuperación de caídas. Los de ruedas afrontan restricciones de dirección, deslizamientos y terreno irregular. El control de cuerpo completo puede conectar movilidad y manipulación.
Las observaciones suelen incluir posiciones y velocidades articulares, orientación y velocidad angular de la IMU y, opcionalmente, profundidad o mapas de elevación. La política puede producir consignas para un controlador inferior o pares directamente. Distingue la frecuencia de la política de la frecuencia del servo articular.
Son habituales MPC y el refuerzo sim-to-real. Learning to Walk in Minutes entrena ANYmal con simulación masivamente paralela en Isaac Gym. La aleatorización del dominio reduce la brecha con la realidad; el entrenamiento profesor–alumno transfiere habilidades aprendidas con información privilegiada a observaciones de sensores embarcados. Robot Parkour explora seleccionar y ejecutar habilidades para superar obstáculos con visión.
Los cuadrúpedos han demostrado buena locomoción en muchos escenarios evaluados. El terreno extremo, la baja fricción, la fiabilidad prolongada y la coordinación corporal con humanoides o cargas variables requieren validación específica.
Navegación
Pregunta: ¿adónde ir, por qué ruta y cuándo parar?
La navegación elige y ajusta dirección o trayectoria usando un objetivo, observaciones y una estimación del estado, evitando obstáculos hasta alcanzar una ubicación. Responde a «¿dónde estoy, adónde voy y cómo llego?», por ejemplo al cruzar una habitación hasta la puerta.
Demostración de habilidades en 3D
Evitar obstáculos y llegar al objetivo
Localizar el robot y el objetivoIdentificar la posición actual, el objetivo y la ubicación de los obstáculos.
La navegación elige destino y ruta; la locomoción determina cómo se mueve el cuerpo por ella. Un sistema por capas transmite trayectorias, puntos intermedios o velocidades; el control coordina marchas, apoyos, articulaciones o ruedas. Ante cajas y escalones, navegación elige por dónde pasar y control ejecuta apoyos y equilibrio.
La cooperación es continua. El plan debe considerar pasos estrechos y escalones; si el robot resbala o se bloquea, la retroalimentación permite cambiar velocidad o replantear la ruta. Pueden usarse módulos separados, planificación conjunta o políticas aprendidas.
Los sistemas clásicos combinan localización o SLAM, planificación global como A* y planificación o control local como DWA o MPC. Nav2 reúne estos componentes. En mapas conocidos y entornos controlados existen soluciones maduras.
Por objetivos: PointNav alcanza coordenadas; ObjectNav busca una categoría de objeto; ImageNav localiza un lugar u objeto que coincide con una imagen; VLN sigue instrucciones naturales. Las entradas pueden ser RGB-D, LiDAR, odometría y objetivos; las salidas, velocidades o acciones discretas de avanzar, girar y parar.
Algunos benchmarks simplifican el movimiento de bajo nivel. En el mundo real hay errores de localización, deslizamientos, obstáculos dinámicos y fallos. Compara definiciones de tarea, sensores, criterios de éxito y eficiencia de ruta; un buen resultado PointNav no representa toda la navegación.
3.4 Comparación de habilidades
Las frecuencias describen una capa concreta. Distingue inferencia, ejecución, pasos de simulación y servos articulares.
| Habilidad | Entradas habituales | Salidas habituales | Escala temporal de ejemplo | Métodos | Avances y límites |
|---|---|---|---|---|---|
| Agarre | Nubes de puntos / RGB-D; fuerza y tacto opcionales | Pose, apertura o parámetros de contacto | Según la tarea o actualización continua | Geometría, mecánica, aprendizaje supervisado | Maduro en celdas controladas; objetos y contactos complejos siguen siendo difíciles |
| Manipulación | Imágenes y propiocepción; lenguaje, fuerza y tacto opcionales | Acciones del efector o articulaciones, bloques de acciones | ACT: ejecución a 50 Hz | Planificación, control, IL, RL, VLA | Depende de la tarea; generalización y tareas largas siguen abiertas |
| Locomoción | Articulaciones e IMU; terreno opcional | Consignas articulares, pares o posiciones de pies | Política a 50 Hz / control simulado a 200 Hz, derivado de legged_gym | MPC, control corporal, RL sim-to-real | Muchos resultados en cuadrúpedos; terreno difícil y coordinación corporal siguen abiertos |
| Navegación | Visión / LiDAR, pose y objetivo | Rutas, puntos intermedios, velocidades o acciones discretas | Alto nivel según necesidad; control local Nav2 a 20 Hz por defecto | SLAM, planificación, control y aprendizaje | Madura con mapas conocidos; entornos abiertos y objetivos semánticos siguen siendo difíciles |
3.5 Combinar habilidades en tareas reales
- Manipulación móvil: el robot navega al lugar de trabajo y coordina base y brazo; por ejemplo, «Ve a la cocina y trae la taza».
- Loco-manipulación: enfatiza la unión de movimiento, equilibrio y contacto, como un cuadrúpedo con brazo que transporta algo o un humanoide que abre una puerta manteniendo el equilibrio. ALMA es un ejemplo.
Un humanoide puede utilizar las cuatro habilidades. Sus capacidades dependen del hardware, percepción, control y entrenamiento, además de su forma.
Resumen
- Define habilidad, entorno, restricciones, observaciones, acciones y criterios de evaluación antes de elegir un método.
- Agarre y manipulación cambian objetos; locomoción y navegación mueven al robot. Sus entradas, salidas y tiempos difieren.
- Las tareas reales combinan habilidades. Compara métodos con configuraciones coherentes.
Para continuar
- 4. Plataformas de IA corporizada: cómo el cuerpo condiciona las habilidades.
- Procesos de decisión de Markov: formulación matemática.
- Proyectos: elige una dirección por plataforma y tarea.