Saltar al contenido principal

Ver como Markdown

Contenido convertido a Markdown. Usa el enlace a la página original al final para explorar los gráficos interactivos.

3. Habilidades robóticas

El estudio de la IA corporizada empieza por definir la tarea. Modelarla bien y elegir objetivos y métricas apropiados suele importar más que seleccionar y optimizar el modelo. Primero veremos cómo definirla y después cuatro habilidades habituales.

3.1 Primero, define la tarea​

Aclara la habilidad deseada, el entorno y las restricciones antes de elegir un método. ¿Qué sensores usarás? ¿Cuáles son las observaciones y las acciones? ¿Qué cuenta como finalización? ¿Medirás éxito, tiempo u otras métricas?

Comprueba también si la configuración es adecuada. Una cámara en la muñeca puede aportar detalles que una cámara superior no ve. Cambiar sensores cambia las condiciones de observación: documéntalo y compara métodos con configuraciones coherentes.

3.2 Convierte la tarea en un problema de aprendizaje​

Especifica entradas, salidas y objetivos. En cada instante , el robot recibe una observación y una política produce una acción según esa observación y el objetivo , por ejemplo una instrucción lingüística:

La acción modifica el entorno, llega una nueva observación y continúa el ciclo. El aprendizaje por refuerzo define además una recompensa para valorar cada paso. Para recompensas, retornos y funciones de valor, consulta procesos de decisión de Markov.

ElementoSignificadoBrazo que recoge una tazaCuadrúpedo que avanza
Observación Información disponibleImágenes, ángulos articulares y apertura de pinzaÁngulos y velocidades articulares, orientación y velocidad angular de la IMU, orden de velocidad
EstadoInformación completa, a menudo no observablePose, masa y fricción reales de la tazaFricción del suelo, contactos y velocidad real del cuerpo
Acción Salida de la políticaIncrementos de pose del efector o consignas articulares, más apertura/cierreÁngulos objetivo de 12 articulaciones
Objetivo Qué lograrColocar la taza en la zona indicadaAvanzar a una velocidad dada
Condición de éxitoQué significa completarTaza bien colocada y vertical, sin colisionesSeguir la velocidad, mantener equilibrio y reducir deslizamientos
Frecuencia de controlFrecuencia de las accionesDe unos pocos a decenas de herciosPor ejemplo, política a 50 Hz y control articular más rápido
  • Las observaciones revelan solo parte del estado: la cámara no muestra el peso de la taza; se infiere mediante fuerzas y movimiento al levantarla. Es la observabilidad parcial, que puede compensarse con historial o sensores adicionales.
  • La definición de acciones cambia la dificultad: consignas articulares o poses del efector, valores absolutos o incrementos, posiciones o pares tienen ventajas y costes distintos.
  • Compara configuraciones coherentes: resultados con diferentes observaciones, acciones, frecuencias o criterios de éxito no son directamente comparables.

3.3 Cuatro habilidades habituales​

Agarre, manipulación, locomoción y navegación son un punto de partida útil. Las dos primeras cambian los objetos; las otras mueven al robot. Cada habilidad incluye una demo 3D que puedes recorrer paso a paso.

Agarre​

Pregunta: ¿cómo sujetar un objeto de forma estable?

El agarre establece contactos entre un efector final y un objeto para restringir su movimiento, hacer que acompañe al efector y evitar deslizamientos ante perturbaciones previstas.

Una pinza, una mano diestra o una ventosa sujeta el objeto antes de moverlo. Para poner un bloque en una caja, el robot primero lo agarra y levanta. Mantener esa sujeción es el agarre; transportarlo, colocarlo y soltarlo completa la tarea de recoger y colocar.

Demostración de habilidades en 3D

Sujetar bien y levantar

Preparando la escena 3D…Un brazo alinea su pinza paralela con un bloque naranja, cierra los dedos y levanta el bloque de la mesa.

Observar el objetoLocalizar la posición y orientación del bloque y elegir zonas de contacto en lados opuestos.

Observa cómo cambia la relación entre pinza y objeto: del contacto inexistente a un agarre estable.Arrastra la barra de progreso o selecciona una etapa para explorar paso a paso. El movimiento está simplificado para ilustrar la habilidad.

La detección de agarres suele recibir nubes de puntos o imágenes RGB-D y predecir posición 3D, orientación 3D (6-DoF) y apertura de una pinza paralela. También hay que comprobar alcanzabilidad y colisiones.

Los enfoques geométricos y mecánicos estudian cierre de forma y cierre de fuerza. Los métodos basados en datos aprenden la calidad del agarre o generan poses. Ejemplos: Dex-Net, el dataset y benchmark GraspNet-1Billion y AnyGrasp. Los modelos analíticos también pueden generar datos de entrenamiento.

El agarre puede planificarse antes o corregirse continuamente con visión, fuerza o tacto; AnyGrasp permite seguir poses de agarre. Los objetos rígidos regulares en celdas controladas son un caso relativamente maduro. Las manos diestras, objetos transparentes o deformables, oclusiones y escenas desordenadas siguen planteando retos.

Manipulación​

Pregunta: ¿cómo cambiar el estado de un objeto mediante el contacto?

La manipulación aplica fuerzas o movimiento deliberadamente para cambiar posición, orientación, forma u otro estado relevante de un objeto. Por ejemplo, agarrar el tirador de un cajón y tirar por sus guías hasta la apertura deseada.

Demostración de habilidades en 3D

Agarrar el tirador y abrir el cajón

Preparando la escena 3D…El brazo agarra el tirador, mantiene el contacto y tira del cajón a lo largo de sus guías.

Acercarse al tiradorObservar el tirador y la dirección de las guías, y acercar la pinza al tirador.

Agarrar es solo el principio. La manipulación sigue cambiando el estado del cajón.Arrastra la barra de progreso o selecciona una etapa para explorar paso a paso. El movimiento está simplificado para ilustrar la habilidad.

El agarre es un subproblema de la manipulación. Un agarre estable suele mantener la relación de contacto para que el objeto acompañe al efector; al manipular pueden cambiar los contactos mediante cambios de dedos, rodadura o nuevos agarres. Los puntos fijos de contacto no son una frontera absoluta entre ambos conceptos.

La manipulación incluye agarrar, transportar, empujar, desplazar, voltear, manipular dentro de la mano, doblar ropa, ordenar cuerdas, abrir puertas, usar herramientas, coordinar brazos y realizar tareas largas. Empujar un objeto o chutar un balón es manipulación no prensil: no exige sujetarlo primero.

Las tareas complejas eligen acciones continuamente a partir de imágenes, propiocepción y, en ocasiones, lenguaje. El aprendizaje por imitación (IL) y los VLA son líneas importantes: ACT predice bloques de acciones; Diffusion Policy combina generación con ejecución de horizonte deslizante; π0 y OpenVLA exploran políticas multitarea de visión, lenguaje y acción.

Los retos incluyen contactos cambiantes, estados parcialmente observados, varias acciones válidas y errores acumulados. La retroalimentación en lazo cerrado importa tanto en manipulación compleja como en agarre. Distingue reproducir una tarea fija de generalizar a objetos y entornos nuevos.

Locomoción​

Pregunta: ¿cómo mover el cuerpo con estabilidad?

La locomoción desplaza al propio robot mediante la interacción de patas o ruedas con el entorno, coordinando postura y estabilidad. Un cuadrúpedo que sube un escalón debe coordinar elevación de patas, apoyos y desplazamiento del peso. Elegir una ruta hasta una puerta requiere además navegación.

Demostración de habilidades en 3D

Mantener el equilibrio y subir escalones

Preparando la escena 3D…Un cuadrúpedo alterna elevación, colocación y apoyo de las patas para subir tres escalones.

Preparar el apoyoLas cuatro patas sostienen el cuerpo mientras el robot se prepara para avanzar.

Observa cómo se mueve el cuerpo al coordinar los apoyos, las articulaciones y el centro de masa.Arrastra la barra de progreso o selecciona una etapa para explorar paso a paso. El movimiento está simplificado para ilustrar la habilidad.

Los robots con patas gestionan marchas, equilibrio, escalones, pendientes y recuperación de caídas. Los de ruedas afrontan restricciones de dirección, deslizamientos y terreno irregular. El control de cuerpo completo puede conectar movilidad y manipulación.

Las observaciones suelen incluir posiciones y velocidades articulares, orientación y velocidad angular de la IMU y, opcionalmente, profundidad o mapas de elevación. La política puede producir consignas para un controlador inferior o pares directamente. Distingue la frecuencia de la política de la frecuencia del servo articular.

Son habituales MPC y el refuerzo sim-to-real. Learning to Walk in Minutes entrena ANYmal con simulación masivamente paralela en Isaac Gym. La aleatorización del dominio reduce la brecha con la realidad; el entrenamiento profesor–alumno transfiere habilidades aprendidas con información privilegiada a observaciones de sensores embarcados. Robot Parkour explora seleccionar y ejecutar habilidades para superar obstáculos con visión.

Los cuadrúpedos han demostrado buena locomoción en muchos escenarios evaluados. El terreno extremo, la baja fricción, la fiabilidad prolongada y la coordinación corporal con humanoides o cargas variables requieren validación específica.

Pregunta: ¿adónde ir, por qué ruta y cuándo parar?

La navegación elige y ajusta dirección o trayectoria usando un objetivo, observaciones y una estimación del estado, evitando obstáculos hasta alcanzar una ubicación. Responde a «¿dónde estoy, adónde voy y cómo llego?», por ejemplo al cruzar una habitación hasta la puerta.

Demostración de habilidades en 3D

Evitar obstáculos y llegar al objetivo

Preparando la escena 3D…Un robot con ruedas sigue una ruta planificada alrededor de dos obstáculos y se detiene en el objetivo.

Localizar el robot y el objetivoIdentificar la posición actual, el objetivo y la ubicación de los obstáculos.

Observa el objetivo y la ruta: adónde ir, cómo evitar obstáculos y cuándo parar.Arrastra la barra de progreso o selecciona una etapa para explorar paso a paso. El movimiento está simplificado para ilustrar la habilidad.

La navegación elige destino y ruta; la locomoción determina cómo se mueve el cuerpo por ella. Un sistema por capas transmite trayectorias, puntos intermedios o velocidades; el control coordina marchas, apoyos, articulaciones o ruedas. Ante cajas y escalones, navegación elige por dónde pasar y control ejecuta apoyos y equilibrio.

La cooperación es continua. El plan debe considerar pasos estrechos y escalones; si el robot resbala o se bloquea, la retroalimentación permite cambiar velocidad o replantear la ruta. Pueden usarse módulos separados, planificación conjunta o políticas aprendidas.

Los sistemas clásicos combinan localización o SLAM, planificación global como A* y planificación o control local como DWA o MPC. Nav2 reúne estos componentes. En mapas conocidos y entornos controlados existen soluciones maduras.

Por objetivos: PointNav alcanza coordenadas; ObjectNav busca una categoría de objeto; ImageNav localiza un lugar u objeto que coincide con una imagen; VLN sigue instrucciones naturales. Las entradas pueden ser RGB-D, LiDAR, odometría y objetivos; las salidas, velocidades o acciones discretas de avanzar, girar y parar.

Algunos benchmarks simplifican el movimiento de bajo nivel. En el mundo real hay errores de localización, deslizamientos, obstáculos dinámicos y fallos. Compara definiciones de tarea, sensores, criterios de éxito y eficiencia de ruta; un buen resultado PointNav no representa toda la navegación.

3.4 Comparación de habilidades​

Las frecuencias describen una capa concreta. Distingue inferencia, ejecución, pasos de simulación y servos articulares.

HabilidadEntradas habitualesSalidas habitualesEscala temporal de ejemploMétodosAvances y límites
AgarreNubes de puntos / RGB-D; fuerza y tacto opcionalesPose, apertura o parámetros de contactoSegún la tarea o actualización continuaGeometría, mecánica, aprendizaje supervisadoMaduro en celdas controladas; objetos y contactos complejos siguen siendo difíciles
ManipulaciónImágenes y propiocepción; lenguaje, fuerza y tacto opcionalesAcciones del efector o articulaciones, bloques de accionesACT: ejecución a 50 HzPlanificación, control, IL, RL, VLADepende de la tarea; generalización y tareas largas siguen abiertas
LocomociónArticulaciones e IMU; terreno opcionalConsignas articulares, pares o posiciones de piesPolítica a 50 Hz / control simulado a 200 Hz, derivado de legged_gymMPC, control corporal, RL sim-to-realMuchos resultados en cuadrúpedos; terreno difícil y coordinación corporal siguen abiertos
NavegaciónVisión / LiDAR, pose y objetivoRutas, puntos intermedios, velocidades o acciones discretasAlto nivel según necesidad; control local Nav2 a 20 Hz por defectoSLAM, planificación, control y aprendizajeMadura con mapas conocidos; entornos abiertos y objetivos semánticos siguen siendo difíciles

3.5 Combinar habilidades en tareas reales​

  • Manipulación móvil: el robot navega al lugar de trabajo y coordina base y brazo; por ejemplo, «Ve a la cocina y trae la taza».
  • Loco-manipulación: enfatiza la unión de movimiento, equilibrio y contacto, como un cuadrúpedo con brazo que transporta algo o un humanoide que abre una puerta manteniendo el equilibrio. ALMA es un ejemplo.

Un humanoide puede utilizar las cuatro habilidades. Sus capacidades dependen del hardware, percepción, control y entrenamiento, además de su forma.

Resumen​

  • Define habilidad, entorno, restricciones, observaciones, acciones y criterios de evaluación antes de elegir un método.
  • Agarre y manipulación cambian objetos; locomoción y navegación mueven al robot. Sus entradas, salidas y tiempos difieren.
  • Las tareas reales combinan habilidades. Compara métodos con configuraciones coherentes.

Para continuar​

Referencias​

  1. Modern Robotics: Grasping and manipulation
  2. Modern Robotics: Wheeled robots and mobile manipulation
  3. Habitat: ObjectNav and ImageNav tasks and evaluation
  4. VLN-CE: Vision-and-language navigation in continuous environments