Saltar al contenido principal

Ver como Markdown

Contenido convertido a Markdown. Usa el enlace a la página original al final para explorar los gráficos interactivos.

2. Breve historia

La IA corporizada no apareció de repente. Sus ideas centrales proceden de las primeras investigaciones en IA y robótica; el impulso actual combina aprendizaje por refuerzo profundo, simulación a gran escala y grandes modelos. Este capítulo sigue una pregunta: ¿de dónde proceden las capacidades de un robot?

Cuatro etapas de un vistazo​

EtapaPeriodoEnfoque centralTrabajos representativos
Reglas programadas1960–1990Reglas humanas: razonamiento simbólico y después comportamientos reactivos que introdujeron la corporizaciónShakey, A*, STRIPS, arquitectura de subsunción
Control basado en modelos1990–2010Modelos físicos y probabilísticos para estimar, planificar y controlarSLAM, Stanley, ZMP, MPC, ROS
Aprendizaje por refuerzo profundo2012–2021Aprender políticas por ensayo y error; el aprendizaje profundo mejora también la percepciónPolíticas visuomotoras, QT-Opt, mano del cubo de Rubik, ANYmal, legged_gym
Modelos fundacionales2022–actualidadGrandes modelos preentrenados aportan lenguaje y capacidades generales, junto con control de bajo nivelSayCan, RT-2, Open X-Embodiment, π0

Cada etapa identifica una nueva fuente principal de capacidades, sin volver obsoletas las anteriores. La planificación y el control siguen siendo esenciales; la locomoción con patas se entrena sobre todo con aprendizaje por refuerzo profundo, y los VLA empiezan a utilizar refuerzo para mejorar con la experiencia de despliegue.

2.1 Reglas programadas (1960–1990)​

Las capacidades procedían de reglas escritas por personas: primero razonamiento lógico y simbólico y después reacciones directas al entorno, que introdujeron la idea de corporización.

Razonamiento simbólico: percibir, planificar y actuar​

Entre 1966 y 1972, SRI, entonces Stanford Research Institute, construyó Shakey, considerado el primer robot móvil capaz de razonar sobre sus acciones. Percibía con una cámara y un telémetro, representaba el entorno con símbolos y buscaba secuencias de acciones mediante un planificador. A* y STRIPS, desarrollados para Shakey, siguen siendo bases de la planificación de rutas y tareas.

Este esquema de percibir, construir un modelo del mundo, planificar y ejecutar se conoce como «percibir–planificar–actuar». Si cambia el entorno hay que reconstruir el modelo; la planificación lenta obliga al robot a detenerse para «pensar», y los símbolos no capturan todos los detalles del mundo real.

Robótica basada en comportamientos y corporización​

En los años ochenta, Rodney Brooks, del MIT, propuso una arquitectura de subsunción sin un modelo completo del mundo. Organiza comportamientos en capas: las inferiores ejecutan reflejos como evitar obstáculos; las superiores las inhiben o activan según sea necesario. Reaccionar directamente a los sensores mejora la rapidez y la robustez.

Brooks defendía que la inteligencia puede surgir de la interacción directa con el mundo, usando el propio mundo como modelo. También se observó que el cuerpo puede asumir parte del «cálculo»: un caminante dinámico pasivo, sin motores ni controladores, puede bajar una pendiente suave gracias a la estructura de sus piernas y a la gravedad.

La corporización pasó a ser un tema importante en IA y ciencias cognitivas: la inteligencia depende de algoritmos, cuerpo y entorno. Sin embargo, las reglas, tanto simbólicas como reactivas, seguían diseñándose a mano y funcionaban mal ante situaciones no previstas.

2.2 Control basado en modelos (1990–2010)​

Las capacidades procedían de modelos matemáticos: los probabilísticos describen ruido e incertidumbre y los físicos describen el movimiento. Aquí «modelo» no significa un gran modelo fundacional.

Desde los años noventa se extendieron los filtros de Kalman y de partículas para estimar estados, y SLAM para construir mapas mientras el robot se localiza. En 2005, el coche autónomo Stanley de Stanford recorrió unos 212 km por el desierto y ganó el DARPA Grand Challenge, mostrando la eficacia de la percepción y planificación probabilísticas.

En control, el punto de momento cero (ZMP) permitió caminar a humanoides como ASIMO; MPC y el control de cuerpo completo permitieron correr, saltar y resistir perturbaciones. ROS, cuyo desarrollo comenzó en 2007, proporcionó comunicaciones y herramientas comunes y redujo la dificultad de construir sistemas.

Predominaban sistemas modulares con interfaces claras entre percepción, localización, planificación y control. Eran fiables en entornos estructurados, pero requerían mucho diseño manual y modelos precisos, y se adaptaban mal a objetos, entornos y contactos nuevos.

2.3 Aprendizaje por refuerzo profundo (2012–2021)​

Hacia 2012, el aprendizaje profundo mejoró notablemente la percepción visual. En control, el aprendizaje por refuerzo profundo permitió aprender políticas mediante ensayo y error en simulación o en el mundo real.

  • Políticas visuomotoras de extremo a extremo: en 2016, Levine y colaboradores mapearon imágenes directamente a pares motores con una red neuronal, para tareas como enroscar una tapa y colgar una percha.
  • Aprender agarres reales: Google usó hasta 14 brazos para recoger más de 800.000 intentos en dos meses. QT-Opt aplicó refuerzo profundo al agarre visual, con más de 580.000 intentos reales de entrenamiento y un 96 % de éxito en objetos no vistos.
  • Entrenar en simulación y desplegar en hardware: OpenAI transfirió políticas mediante aleatorización del dominio para reorientar un bloque con una mano (2018) y resolver un cubo de Rubik con una sola mano (2019). ETH Zürich logró movimiento ágil y marcha en terreno difícil con ANYmal (2019–2020). En 2021, legged_gym redujo a unos minutos el entrenamiento de marcha en suelo plano mediante simulación paralela en GPU.
  • Plataformas y tareas de simulación: AI2-THOR y Habitat, junto con PointNav, ObjectNav y navegación con visión y lenguaje (VLN), permitieron entrenar y evaluar agentes a escala en interiores virtuales.

El cambio central fue pasar del diseño manual de cada módulo al aprendizaje a partir de datos e interacción. Aumentaron las necesidades de datos y cómputo; siguieron siendo difíciles el diseño de recompensas, la transferencia a la realidad y la generalización fuera del robot y la tarea de entrenamiento.

2.4 Modelos fundacionales (2022–actualidad)​

Desde 2022, los avances de los modelos de lenguaje y de visión-lenguaje llegaron rápidamente a la robótica. El preentrenamiento a gran escala aporta comprensión lingüística, sentido común y capacidades compartidas entre tareas:

  • Planificación con lenguaje: SayCan (2022) descompone peticiones como «He derramado la bebida, ¿me ayudas?» en habilidades ejecutables. Code as Policies (2022) genera código para controlar el robot.
  • Robotics Transformers y VLA: RT-1 (2022) entrenó una política Transformer con unas 130.000 demostraciones reales. RT-2 (2023) convirtió un modelo de visión-lenguaje en un VLA capaz de entender instrucciones ausentes de sus datos robóticos de entrenamiento.
  • Datos compartidos: Open X-Embodiment (2023) reunió más de un millón de trayectorias de 22 tipos de cuerpo robótico.
  • Imitación a bajo coste: ALOHA con ACT (2023) y Diffusion Policy (2023) mostraron que decenas o cientos de demostraciones permiten aprender manipulación bimanual precisa.
  • Código abierto y políticas generalistas: OpenVLA (2024) facilita reproducir y ajustar VLA. π0 (2024) y π0.5 (2025) generan acciones continuas mediante flow matching y realizan tareas largas, como ordenar cocinas y dormitorios en casas no vistas.
  • Modelos del mundo: Genie, Cosmos y V-JEPA 2 predicen cambios del entorno ante acciones y apoyan planificación, generación de datos y evaluación de políticas.

El gran modelo suele entender la tarea y decidir; los controladores de bajo nivel ejecutan con rapidez y estabilidad, una división a veces comparada con «cerebro» y «cerebelo». La simulación en GPU permite miles de entornos simultáneos y surgen nuevas plataformas, incluidos humanoides. Para la evolución técnica de VLA desde 2022, consulta De los LLM a las políticas robóticas.

2.5 Lecciones de la historia​

  1. El equilibrio entre diseño modular y extremo a extremo sigue abierto: desde percibir–planificar–actuar frente a comportamientos, hasta VLA jerárquicos o monolíticos, la cuestión es cómo dividir el sistema y qué información intercambiar.
  2. Las capacidades dependen cada vez más de los datos: escala, calidad y diversidad fijan buena parte del rendimiento.
  3. La simulación siempre ha sido clave: pasó de validar algoritmos a entrenar políticas en paralelo y generar datos con modelos del mundo; la brecha con la realidad persiste.
  4. El cuerpo sigue importando: un mismo modelo rinde de forma distinta según el robot; aprender entre distintos cuerpos sigue siendo un tema de investigación.

Los fundamentos organizan estos métodos en decisión, control, percepción e ingeniería.

Resumen​

  • Las reglas programadas pasaron del razonamiento simbólico a comportamientos que resaltaban la interacción entre cuerpo y entorno.
  • El control basado en modelos consolidó estimación, planificación y control modulares; ROS facilitó construir sistemas.
  • El refuerzo profundo permitió aprender por ensayo y error; los modelos fundacionales conectaron lenguaje, visión y acción.

Para continuar​

Referencias​

  1. Nils J. Nilsson (ed.). Shakey the Robot. SRI International Technical Note 323, 1984.
  2. Rodney A. Brooks. A Robust Layered Control System for a Mobile Robot. IEEE Journal on Robotics and Automation, 1986.
  3. Rodney A. Brooks. Elephants Don't Play Chess. Robotics and Autonomous Systems, 1990.
  4. Rodney A. Brooks. Intelligence without Representation. Artificial Intelligence, 1991.
  5. Tad McGeer. Passive Dynamic Walking. The International Journal of Robotics Research, 1990.
  6. Sebastian Thrun et al. Stanley: The Robot that Won the DARPA Grand Challenge. Journal of Field Robotics, 2006.
  7. Sebastian Thrun, Wolfram Burgard, Dieter Fox. Probabilistic Robotics. MIT Press, 2005.
  8. Sergey Levine et al. End-to-End Training of Deep Visuomotor Policies. JMLR, 2016.
  9. Sergey Levine et al. Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection. 2016.
  10. Dmitry Kalashnikov et al. QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. 2018.
  11. OpenAI. Learning Dexterous In-Hand Manipulation. 2018; Solving Rubik's Cube with a Robot Hand. 2019.
  12. Jemin Hwangbo et al. Learning Agile and Dynamic Motor Skills for Legged Robots. 2019.
  13. Joonho Lee et al. Learning Quadrupedal Locomotion over Challenging Terrain. 2020.
  14. Nikita Rudin et al. Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning. 2021.
  15. Manolis Savva et al. Habitat: A Platform for Embodied AI Research. 2019.
  16. Michael Ahn et al. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. 2022.
  17. Jacky Liang et al. Code as Policies: Language Model Programs for Embodied Control. 2022.
  18. Anthony Brohan et al. RT-1: Robotics Transformer for Real-World Control at Scale. 2022.
  19. Anthony Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. 2023.
  20. Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. 2023.
  21. Tony Z. Zhao et al. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. 2023.
  22. Cheng Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. 2023.
  23. Moo Jin Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model. 2024.
  24. Physical Intelligence. π0: A Vision-Language-Action Flow Model for General Robot Control. 2024; π0.5: a Vision-Language-Action Model with Open-World Generalization. 2025.
  25. Jake Bruce et al. Genie: Generative Interactive Environments. 2024.
  26. NVIDIA. Cosmos World Foundation Model Platform for Physical AI. 2025.
  27. Mido Assran et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. 2025.