Capitoli
In questa pagina
2. Breve storia
L'IA incarnata non è nata all'improvviso. Le sue idee centrali risalgono alle prime ricerche in IA e robotica; l'impulso attuale unisce apprendimento per rinforzo profondo, simulazione su larga scala e grandi modelli. Questo capitolo segue una domanda: da dove vengono le capacità di un robot?
Quattro fasi a colpo d'occhio
| Fase | Periodo | Approccio centrale | Lavori rappresentativi |
|---|---|---|---|
| Regole programmate | Anni 1960–1990 | Regole umane: prima ragionamento simbolico, poi comportamenti reattivi che introducono l'incarnazione | Shakey, A*, STRIPS, architettura a sussunzione |
| Controllo basato su modelli | Anni 1990–2010 | Modelli fisici e probabilistici per stimare, pianificare e controllare | SLAM, Stanley, ZMP, MPC, ROS |
| Apprendimento per rinforzo profondo | 2012–2021 | Apprendere politiche per tentativi ed errori; il deep learning migliora anche la percezione | Politiche visuomotorie, QT-Opt, mano del cubo di Rubik, ANYmal, legged_gym |
| Modelli fondazionali | 2022–oggi | Grandi modelli preaddestrati forniscono linguaggio e capacità generali, insieme al controllo di basso livello | SayCan, RT-2, Open X-Embodiment, π0 |
Ogni fase identifica una nuova fonte principale di capacità, senza rendere obsolete le precedenti. Pianificazione e controllo restano essenziali; la locomozione con zampe usa soprattutto il rinforzo profondo e i VLA iniziano a usare il rinforzo per migliorare con l'esperienza di impiego.
2.1 Regole programmate (anni 1960–1990)
Le capacità derivavano da regole scritte dalle persone: prima ragionamento logico e simbolico, poi reazioni dirette all'ambiente che introdussero l'idea di incarnazione.
Ragionamento simbolico: percepire, pianificare, agire
Tra il 1966 e il 1972 SRI, allora Stanford Research Institute, costruì Shakey, considerato il primo robot mobile capace di ragionare sulle proprie azioni. Percepiva con telecamera e telemetro, rappresentava l'ambiente con simboli e cercava sequenze di azioni con un pianificatore. A* e STRIPS, sviluppati per Shakey, restano basi della pianificazione di percorsi e compiti.
Lo schema percepire, costruire un modello del mondo, pianificare ed eseguire è noto come «percepisci–pianifica–agisci». Se cambia l'ambiente bisogna ricostruire il modello; la pianificazione lenta costringe il robot a fermarsi per «pensare», mentre i simboli non catturano tutti i dettagli del mondo reale.
Robotica basata sui comportamenti e incarnazione
Negli anni Ottanta Rodney Brooks del MIT propose un'architettura a sussunzione senza un modello completo del mondo. Organizza i comportamenti a strati: quelli inferiori gestiscono riflessi come evitare ostacoli, quelli superiori li inibiscono o attivano. La reazione diretta ai sensori migliora rapidità e robustezza.
Brooks sosteneva che l'intelligenza può emergere dall'interazione diretta con il mondo, usando il mondo stesso come modello. Si osservò anche che il corpo può svolgere parte del «calcolo»: un camminatore dinamico passivo, privo di motori e controllori, può scendere stabilmente lungo una lieve pendenza grazie alla struttura delle gambe e alla gravità.
L'incarnazione divenne un tema importante nell'IA e nelle scienze cognitive: l'intelligenza dipende da algoritmi, corpo e ambiente. Tuttavia, le regole simboliche e reattive restavano progettate a mano e gestivano male le situazioni impreviste.
2.2 Controllo basato su modelli (anni 1990–2010)
Le capacità derivavano da modelli matematici: quelli probabilistici descrivono rumore e incertezza, quelli fisici il movimento. Qui «modello» non indica un grande modello fondazionale.
Dagli anni Novanta si diffusero filtri di Kalman e particellari per stimare lo stato e SLAM per costruire mappe localizzando il robot. Nel 2005 Stanley, l'auto autonoma di Stanford, percorse circa 212 km nel deserto vincendo la DARPA Grand Challenge e mostrando l'efficacia di percezione e pianificazione probabilistiche.
Nel controllo, il punto di momento nullo (ZMP) consentì a umanoidi come ASIMO di camminare; MPC e controllo dell'intero corpo permisero corsa, salti e resistenza alle perturbazioni. ROS, sviluppato a partire dal 2007, fornì comunicazione e strumenti comuni, rendendo più semplice costruire sistemi.
Prevalevano sistemi modulari con interfacce chiare tra percezione, localizzazione, pianificazione e controllo. Erano affidabili in ambienti strutturati, ma richiedevano molto lavoro manuale e modelli precisi e si adattavano male a oggetti, ambienti e contatti nuovi.
2.3 Apprendimento per rinforzo profondo (2012–2021)
Intorno al 2012 il deep learning migliorò notevolmente la percezione visiva. Nel controllo, il rinforzo profondo permise di apprendere politiche per tentativi ed errori in simulazione o nel mondo reale.
- Politiche visuomotorie end-to-end: nel 2016 Levine e colleghi usarono una rete neurale per mappare immagini direttamente in coppie motrici, avvitando tappi e appendendo grucce.
- Apprendere prese reali: Google impiegò fino a 14 bracci per raccogliere oltre 800.000 tentativi in due mesi. QT-Opt applicò il rinforzo profondo alla presa visiva, con oltre 580.000 tentativi reali di addestramento e il 96% di successo su oggetti mai visti.
- Addestrare in simulazione, eseguire su hardware: OpenAI trasferì politiche tramite randomizzazione del dominio per riorientare un blocco nella mano (2018) e risolvere un cubo di Rubik con una mano (2019). ETH Zürich ottenne movimento agile e camminata su terreno difficile con ANYmal (2019–2020). Nel 2021 legged_gym ridusse a pochi minuti l'addestramento della camminata su terreno piano grazie alla simulazione parallela su GPU.
- Piattaforme e compiti simulati: AI2-THOR e Habitat, con PointNav, ObjectNav e navigazione visione-linguaggio (VLN), permisero addestramento e valutazione su larga scala in interni virtuali.
Il passaggio centrale fu dalla progettazione manuale di ogni modulo all'apprendimento da dati e interazione. Crebbero le esigenze di dati e calcolo; restarono difficili progettazione delle ricompense, trasferimento alla realtà e generalizzazione oltre robot e compito di addestramento.
2.4 Modelli fondazionali (2022–oggi)
Dal 2022 i progressi dei modelli linguistici e visione-linguaggio raggiunsero rapidamente la robotica. Il preaddestramento su larga scala porta comprensione linguistica, conoscenza comune e capacità condivise tra compiti:
- Pianificazione con il linguaggio: SayCan (2022) scompone richieste come «Ho rovesciato la bevanda, puoi aiutarmi?» in abilità eseguibili. Code as Policies (2022) genera codice per controllare il robot.
- Robotics Transformers e VLA: RT-1 (2022) addestrò una politica Transformer su circa 130.000 dimostrazioni reali. RT-2 (2023) trasformò un modello visione-linguaggio in un VLA capace di comprendere istruzioni assenti dai dati robotici di addestramento.
- Dati condivisi: Open X-Embodiment (2023) riunì oltre un milione di traiettorie di 22 tipi di corpo robotico.
- Imitazione a basso costo: ALOHA con ACT (2023) e Diffusion Policy (2023) mostrarono che decine o centinaia di dimostrazioni bastano per apprendere manipolazione bimanuale fine.
- Open source e politiche generaliste: OpenVLA (2024) facilita riproduzione e fine-tuning dei VLA. π0 (2024) e π0.5 (2025) generano azioni continue con flow matching e svolgono compiti lunghi, come riordinare cucine e camere in case mai viste.
- Modelli del mondo: Genie, Cosmos e V-JEPA 2 prevedono cambiamenti dell'ambiente in risposta alle azioni e supportano pianificazione, generazione di dati e valutazione delle politiche.
Il grande modello comprende il compito e decide; i controllori di basso livello eseguono rapidamente e stabilmente, una divisione talvolta paragonata a «cervello» e «cervelletto». La simulazione su GPU permette migliaia di ambienti contemporanei e nascono nuove piattaforme, inclusi umanoidi. Per l'evoluzione tecnica dei VLA dal 2022, vedi Dagli LLM alle politiche robotiche.
2.5 Lezioni della storia
- Il compromesso tra modulare ed end-to-end resta aperto: da percepisci–pianifica–agisci contro comportamenti fino a VLA gerarchici o monolitici, la domanda è come dividere il sistema e quali informazioni scambiare.
- Le capacità dipendono sempre più dai dati: scala, qualità e diversità determinano gran parte delle prestazioni.
- La simulazione è sempre stata fondamentale: dalla validazione degli algoritmi all'addestramento parallelo e alla generazione con modelli del mondo; il divario con la realtà persiste.
- Il corpo conta ancora: lo stesso modello rende diversamente su robot diversi e apprendere tra corpi differenti resta un tema di ricerca.
I fondamenti organizzano questi metodi in decisione, controllo, percezione e ingegneria.
Riepilogo
- Le regole programmate passarono dal ragionamento simbolico a comportamenti che valorizzano l'interazione tra corpo e ambiente.
- Il controllo basato su modelli consolidò stima, pianificazione e controllo modulari; ROS facilitò la costruzione dei sistemi.
- Il rinforzo profondo permise l'apprendimento per tentativi ed errori; i modelli fondazionali unirono linguaggio, visione e azione.
Per continuare
- 3. Abilità robotiche: come definire un compito.
- Dagli LLM alle politiche robotiche: evoluzione dei VLA dal 2022.
- Modelli del mondo: tre approcci tecnici e quattro usi.
Riferimenti
- Nils J. Nilsson (ed.). Shakey the Robot. SRI International Technical Note 323, 1984.
- Rodney A. Brooks. A Robust Layered Control System for a Mobile Robot. IEEE Journal on Robotics and Automation, 1986.
- Rodney A. Brooks. Elephants Don't Play Chess. Robotics and Autonomous Systems, 1990.
- Rodney A. Brooks. Intelligence without Representation. Artificial Intelligence, 1991.
- Tad McGeer. Passive Dynamic Walking. The International Journal of Robotics Research, 1990.
- Sebastian Thrun et al. Stanley: The Robot that Won the DARPA Grand Challenge. Journal of Field Robotics, 2006.
- Sebastian Thrun, Wolfram Burgard, Dieter Fox. Probabilistic Robotics. MIT Press, 2005.
- Sergey Levine et al. End-to-End Training of Deep Visuomotor Policies. JMLR, 2016.
- Sergey Levine et al. Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection. 2016.
- Dmitry Kalashnikov et al. QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. 2018.
- OpenAI. Learning Dexterous In-Hand Manipulation. 2018; Solving Rubik's Cube with a Robot Hand. 2019.
- Jemin Hwangbo et al. Learning Agile and Dynamic Motor Skills for Legged Robots. 2019.
- Joonho Lee et al. Learning Quadrupedal Locomotion over Challenging Terrain. 2020.
- Nikita Rudin et al. Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning. 2021.
- Manolis Savva et al. Habitat: A Platform for Embodied AI Research. 2019.
- Michael Ahn et al. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. 2022.
- Jacky Liang et al. Code as Policies: Language Model Programs for Embodied Control. 2022.
- Anthony Brohan et al. RT-1: Robotics Transformer for Real-World Control at Scale. 2022.
- Anthony Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. 2023.
- Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. 2023.
- Tony Z. Zhao et al. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. 2023.
- Cheng Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. 2023.
- Moo Jin Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model. 2024.
- Physical Intelligence. π0: A Vision-Language-Action Flow Model for General Robot Control. 2024; π0.5: a Vision-Language-Action Model with Open-World Generalization. 2025.
- Jake Bruce et al. Genie: Generative Interactive Environments. 2024.
- NVIDIA. Cosmos World Foundation Model Platform for Physical AI. 2025.
- Mido Assran et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. 2025.