Saltar al contenido principal

Ver como Markdown

Contenido convertido a Markdown. Usa el enlace a la página original al final para explorar los gráficos interactivos.

5. Retos principales

Tras conceptos, historia, habilidades y cuerpos, este capítulo presenta los problemas todavía abiertos que motivan gran parte de la investigación. Conocerlos ayuda a juzgar qué resuelve realmente un resultado y dónde se aplica.

5.1 Datos: escasos, caros y difíciles de reutilizar​

Los grandes modelos aprovechan texto e imágenes de internet, pero los datos robóticos requieren teleoperación, demostraciones o interacción autónoma. Las aproximadamente 130.000 demostraciones de RT-1 se recogieron con 13 robots durante 17 meses.

Sensores, acciones y frecuencias diferentes dificultan reutilizar datos entre robots. También importa la calidad: sincronización entre observaciones y acciones, unidades y sistemas de referencia coherentes y demostraciones suaves afectan al entrenamiento.

Enfoques habituales: reunir datos de distintos cuerpos, como Open X-Embodiment; generar datos en simulación; aprender de vídeos humanos; generar datos con modelos del mundo; mejorar teleoperación y recogida.

En el sitio: conjuntos de datos y apuntes de LeRobot.

5.2 La brecha entre simulación y realidad​

La simulación es segura, barata y paralelizable, pero modela imperfectamente fricción, contactos, motores y retardos. Ruido, errores de calibración y desfases temporales tampoco se reproducen por completo. Una política que funciona en simulación puede vibrar, resbalar o caer en hardware.

Enfoques habituales: aleatorizar masa, fricción y latencia durante el entrenamiento; identificar el sistema y modelar actuadores; entrenar un profesor con información privilegiada y destilarlo en un alumno que use solo sensores embarcados; realizar ajustes ligeros en hardware; calibrar y sincronizar sensores.

En el sitio: calibración de sensores y sim2real.

5.3 Generalización​

Rendir bien durante el entrenamiento no garantiza resolver objetos, entornos, instrucciones o robots nuevos. Una política de agarre puede empeorar al cambiar el color de una taza, la iluminación o la cámara.

Enfoques habituales: datos más diversos; conocimiento semántico de VLM preentrenados, como en RT-2 para instrucciones no vistas; aprendizaje entre cuerpos; aleatorización visual y física.

Distingue reproducción y generalización: evaluar las tareas y entornos de entrenamiento muestra que se aprendieron; probar objetos y entornos nuevos demuestra transferencia.

5.4 Tareas largas y errores acumulados​

Doblar ropa u ordenar una habitación requiere decenas o cientos de pasos. Los pequeños errores se acumulan; al alcanzar estados ausentes de las demostraciones, la política puede desviarse cada vez más. Es un cambio de distribución.

Enfoques habituales: predecir bloques de acciones como ACT para reducir decisiones; dividir la tarea con un planificador superior; detectar fallos y recuperarse; seguir aprendiendo de la experiencia de despliegue.

En el sitio: bloques de acciones de ACT y aprendizaje en línea de π0.6.

5.5 Tiempo real y cómputo​

La inferencia de un gran modelo puede tardar decenas o cientos de milisegundos; el control inferior suele disponer de unos pocos a decenas. Cómputo, energía y refrigeración del robot también son limitados.

Enfoques habituales: capas con decisiones lentas de alto nivel y controladores rápidos; bloques de acciones y ejecución asíncrona para continuar mientras llega la siguiente predicción; compresión y aceleración de modelos en el dispositivo.

En el sitio: ejecución en tiempo real RTC.

5.6 Seguridad y fiabilidad​

Los errores físicos pueden causar colisiones, atrapamientos, caídas o daños. Las políticas aprendidas rara vez ofrecen garantías de seguridad y sus fallos son difíciles de explicar. Una aplicación debe funcionar durante periodos prolongados, no solo en unas pocas tomas de una demo.

Enfoques habituales: limitar velocidades, pares y espacio de trabajo; detectar colisiones y anomalías; conservar un controlador convencional de respaldo; validar primero en simulación; supervisar los experimentos reales y mantener accesible la parada de emergencia.

En el sitio: SO-101 + LeRobot explica conexión y pruebas de seguridad.

5.7 Evaluación​

Cambiar la definición de éxito, condiciones iniciales, posición de objetos o número de ensayos puede cambiar las conclusiones. Evaluar robots reales es laborioso y difícil de reproducir exactamente; mostrar solo la mejor ejecución exagera la capacidad.

Enfoques habituales: benchmarks públicos como LIBERO; descripción completa de condiciones y ensayos; separar resultados dentro y fuera de distribución; usar simuladores o modelos del mundo para reducir el tiempo de evaluación real.

5.8 Los retos están conectados​

La escasez de datos lleva a la simulación y a su brecha con la realidad; generalizar necesita diversidad; las tareas largas ponen a prueba la generalización y el tiempo real. Todo avance necesita evaluación fiable. Al leer un resultado, pregunta qué reto aborda, a qué coste y bajo qué condiciones se validó.

Resumen​

  • Datos escasos, sim-to-real y generalización son problemas fundamentales.
  • Tareas largas, tiempo real, cómputo, seguridad y fiabilidad determinan si un método sale del laboratorio.
  • Para juzgar avances, revisa condiciones de éxito, número de ensayos y distribuciones de prueba.

Siguientes pasos​

Continúa con 6. Tecnologías y módulos y 7. Perfiles profesionales, o elige según tu objetivo: