Capitoli
In questa pagina
3. Abilità robotiche
Lo studio dell'IA incarnata inizia definendo il compito. Modellarlo bene e scegliere obiettivi e metriche adeguati è spesso più importante che selezionare e ottimizzare il modello. Vedremo prima come definirlo e poi quattro abilità comuni.
3.1 Prima definisci il compito
Chiarisci abilità desiderata, ambiente e vincoli prima di scegliere un metodo. Quali sensori userai? Quali sono osservazioni e azioni? Cosa significa completare il compito? Misurerai successo, tempo o altre metriche?
Verifica anche l'adeguatezza della configurazione. Una telecamera sul polso può mostrare dettagli invisibili a una dall'alto. Cambiare sensori cambia le condizioni di osservazione: documentalo e confronta i metodi in condizioni coerenti.
3.2 Trasforma il compito in un problema di apprendimento
Specifica ingressi, uscite e obiettivi. A ogni istante
L'azione modifica l'ambiente, arriva una nuova osservazione e il ciclo continua. Il rinforzo definisce anche una ricompensa
| Elemento | Significato | Braccio che raccoglie una tazza | Quadrupede che avanza |
|---|---|---|---|
| Osservazione | Informazione disponibile | Immagini, angoli articolari e apertura della pinza | Angoli e velocità articolari, orientamento e velocità angolare IMU, comando di velocità |
| Stato | Informazione completa, spesso non osservabile | Posa, massa e attrito reali della tazza | Attrito del terreno, contatti e velocità reale del corpo |
| Azione | Uscita della politica | Incrementi della posa dell'effettore o riferimenti articolari, più apertura/chiusura | Angoli obiettivo di 12 articolazioni |
| Obiettivo | Cosa ottenere | Posare la tazza nell'area indicata | Avanzare a una data velocità |
| Condizione di successo | Cosa significa completare | Tazza ben posizionata e verticale, nessuna collisione | Seguire la velocità, mantenere equilibrio e ridurre slittamenti |
| Frequenza di controllo | Frequenza delle azioni | Da pochi a decine di hertz | Per esempio, politica a 50 Hz e controllo articolare più rapido |
- Le osservazioni rivelano solo parte dello stato: la telecamera non mostra il peso della tazza; lo si deduce da forze e movimento durante il sollevamento. È l'osservabilità parziale, compensabile con osservazioni passate o sensori aggiuntivi.
- La definizione delle azioni cambia la difficoltà: riferimenti articolari o pose dell'effettore, valori assoluti o incrementi, posizioni o coppie hanno vantaggi e costi diversi.
- Confronta configurazioni coerenti: risultati con osservazioni, azioni, frequenze o condizioni di successo differenti non sono direttamente confrontabili.
3.3 Quattro abilità comuni
Presa, manipolazione, locomozione e navigazione sono un utile punto di partenza. Le prime due cambiano gli oggetti; le altre muovono il robot. Ogni abilità include una demo 3D esplorabile passo dopo passo.
Presa
Domanda: come tenere saldamente un oggetto?
La presa stabilisce contatti tra effettore finale e oggetto per vincolarne il movimento, farlo muovere insieme all'effettore ed evitare slittamenti in presenza delle perturbazioni previste.
Una pinza, una mano robotica articolata o una ventosa trattiene l'oggetto prima di spostarlo. Per mettere un blocco in una scatola, il robot prima lo afferra e solleva. Mantenere questo vincolo è la presa; trasporto, posizionamento e rilascio completano il compito di prelievo e posa.
Dimostrazione di abilità in 3D
Afferra saldamente, poi solleva
Osserva l'oggettoIndividua posizione e orientamento del blocco e scegli zone di contatto sui lati opposti.
Il rilevamento delle prese usa spesso nuvole di punti o immagini RGB-D per prevedere posizione 3D, orientamento 3D (6-DoF) e apertura di una pinza parallela. Servono anche verifiche di raggiungibilità e collisione.
Gli approcci geometrici e meccanici studiano chiusura di forma e chiusura di forza. I metodi basati sui dati apprendono la qualità delle prese o generano pose. Esempi: Dex-Net, il dataset e benchmark GraspNet-1Billion e AnyGrasp. Anche i modelli analitici possono generare dati di addestramento.
La presa può essere pianificata prima o corretta continuamente con visione, forza e tatto; AnyGrasp permette di seguire le pose di presa. Oggetti rigidi regolari in celle controllate sono un caso relativamente maturo. Mani articolate, oggetti trasparenti o deformabili, occlusioni e scene disordinate restano difficili.
Manipolazione
Domanda: come cambiare lo stato di un oggetto tramite il contatto?
La manipolazione applica deliberatamente forze o movimento per cambiare posizione, orientamento, forma o altro stato rilevante. Per esempio, afferrare la maniglia di un cassetto e tirarlo lungo le guide fino all'apertura desiderata.
Dimostrazione di abilità in 3D
Afferra la maniglia e apri il cassetto
Avvicinati alla manigliaOsserva la maniglia e la direzione delle guide, poi avvicina la pinza alla maniglia.
La presa è un sottoproblema della manipolazione. Una presa stabile mantiene in genere il rapporto di contatto affinché l'oggetto segua l'effettore; durante la manipolazione i contatti possono cambiare con scambi di dita, rotolamento o nuove prese. Punti di contatto fissi non sono un confine assoluto tra i due concetti.
La manipolazione comprende afferrare, trasportare, spingere, spostare, capovolgere, manipolare nella mano, piegare vestiti, sistemare corde, aprire porte, usare utensili, coordinare bracci e svolgere compiti lunghi. Spingere un oggetto o calciare un pallone è manipolazione non prensile: non richiede una presa iniziale.
I compiti complessi scelgono continuamente azioni da immagini, propriocezione e talvolta linguaggio. Apprendimento per imitazione (IL) e VLA sono direzioni importanti: ACT predice blocchi di azioni; Diffusion Policy combina generazione ed esecuzione a orizzonte mobile; π0 e OpenVLA esplorano politiche multitask visione-linguaggio-azione.
Le sfide includono contatti variabili, stati parzialmente osservati, più azioni valide ed errori cumulativi. La retroazione ad anello chiuso conta sia nella manipolazione complessa sia nella presa. Distingui riproduzione di un compito fisso e generalizzazione a oggetti e ambienti nuovi.
Locomozione
Domanda: come muovere il corpo in modo stabile?
La locomozione sposta il robot attraverso l'interazione di zampe o ruote con l'ambiente, coordinando postura e stabilità. Un quadrupede che sale un gradino deve coordinare sollevamento delle zampe, appoggi e spostamento del peso. Scegliere un percorso fino a una porta richiede anche navigazione.
Dimostrazione di abilità in 3D
Mantieni l'equilibrio e sali i gradini
Prepara il sostegnoLe quattro zampe sostengono il corpo mentre il robot si prepara ad avanzare.
I robot con zampe gestiscono andature, equilibrio, gradini, pendenze e recupero dalle cadute. Quelli su ruote affrontano vincoli di sterzata, slittamento e terreni irregolari. Il controllo dell'intero corpo può collegare mobilità e manipolazione.
Le osservazioni includono spesso posizioni e velocità articolari, orientamento e velocità angolare IMU e, opzionalmente, profondità o mappe di elevazione. La politica può produrre riferimenti per un controllore inferiore o coppie direttamente. Distingui frequenza della politica e frequenza del servo articolare.
Sono comuni MPC e rinforzo sim-to-real. Learning to Walk in Minutes addestra ANYmal con simulazione massivamente parallela in Isaac Gym. La randomizzazione del dominio riduce il divario con la realtà; l'addestramento insegnante–studente trasferisce abilità apprese con informazioni privilegiate alle osservazioni dei sensori di bordo. Robot Parkour esplora la selezione e l'esecuzione di abilità per superare ostacoli tramite visione.
I quadrupedi hanno dimostrato buone capacità in molti scenari valutati. Terreni estremi, basso attrito, affidabilità prolungata e coordinazione corporea con umanoidi o carichi variabili richiedono verifiche specifiche.
Navigazione
Domanda: dove andare, lungo quale percorso e quando fermarsi?
La navigazione sceglie e corregge direzione o percorso usando obiettivo, osservazioni e stima dello stato, evitando ostacoli fino alla destinazione. Risponde a «dove sono, dove vado e come ci arrivo?», per esempio attraversando una stanza fino alla porta.
Dimostrazione di abilità in 3D
Evita gli ostacoli e raggiungi l'obiettivo
Localizza robot e obiettivoIndividua posizione attuale, obiettivo e posizione degli ostacoli.
La navigazione sceglie destinazione e percorso; la locomozione determina come muovere il corpo lungo di esso. Un sistema a strati trasmette percorsi, punti intermedi o velocità; il controllo coordina andature, appoggi, articolazioni o ruote. Di fronte a scatole e gradini, la navigazione sceglie dove passare e il controllo gestisce appoggi ed equilibrio.
La cooperazione è continua. Il piano deve considerare passaggi stretti e gradini; slittamenti o blocchi richiedono correzioni di velocità o ripianificazione. Si possono usare moduli separati, pianificazione congiunta o politiche apprese.
I sistemi classici combinano localizzazione o SLAM, pianificazione globale come A* e pianificazione o controllo locale come DWA o MPC. Nav2 riunisce questi componenti. Esistono soluzioni mature per mappe note e ambienti controllati.
Per obiettivo: PointNav raggiunge coordinate; ObjectNav cerca una categoria di oggetti; ImageNav trova un luogo o oggetto corrispondente a un'immagine; VLN segue istruzioni naturali. Gli ingressi possono essere RGB-D, LiDAR, odometria e obiettivi; le uscite velocità o azioni discrete di avanzamento, svolta e arresto.
Alcuni benchmark semplificano il movimento di basso livello. Nel mondo reale ci sono errori di localizzazione, slittamenti, ostacoli dinamici e guasti. Confronta compiti, sensori, criteri di successo ed efficienza del percorso: un buon risultato PointNav non rappresenta tutta la navigazione.
3.4 Confronto delle abilità
Le frequenze descrivono uno strato specifico. Distingui inferenza, esecuzione, passi di simulazione e servo articolari.
| Abilità | Ingressi tipici | Uscite tipiche | Scala temporale di esempio | Metodi | Progressi e limiti |
|---|---|---|---|---|---|
| Presa | Nuvole di punti / RGB-D; forza e tatto opzionali | Posa, apertura o parametri di contatto | Secondo il compito o aggiornamento continuo | Geometria, meccanica, apprendimento supervisionato | Matura in celle controllate; oggetti e contatti complessi restano difficili |
| Manipolazione | Immagini e propriocezione; linguaggio, forza e tatto opzionali | Azioni dell'effettore o articolari, blocchi di azioni | ACT: esecuzione a 50 Hz | Pianificazione, controllo, IL, RL, VLA | Dipende dal compito; generalizzazione e compiti lunghi restano aperti |
| Locomozione | Articolazioni e IMU; terreno opzionale | Riferimenti articolari, coppie o obiettivi dei piedi | Politica a 50 Hz / controllo simulato a 200 Hz, derivati da legged_gym | MPC, controllo corporeo, RL sim-to-real | Molti risultati sui quadrupedi; terreni difficili e coordinazione corporea restano aperti |
| Navigazione | Visione / LiDAR, posa e obiettivo | Percorsi, punti intermedi, velocità o azioni discrete | Alto livello secondo necessità; controllo locale Nav2 a 20 Hz di default | SLAM, pianificazione, controllo e apprendimento | Matura con mappe note; ambienti aperti e obiettivi semantici restano difficili |
3.5 Combinare abilità in compiti reali
- Manipolazione mobile: il robot raggiunge il luogo di lavoro e coordina base e braccio; per esempio «Vai in cucina e porta la tazza».
- Loco-manipolazione: enfatizza l'unione di movimento, equilibrio e contatto, come un quadrupede con braccio che trasporta un oggetto o un umanoide che apre una porta mantenendo l'equilibrio. ALMA è un esempio.
Un umanoide può usare tutte e quattro le abilità. Le capacità dipendono da hardware, percezione, controllo e addestramento oltre che dalla forma.
Riepilogo
- Definisci abilità, ambiente, vincoli, osservazioni, azioni e criteri di valutazione prima di scegliere un metodo.
- Presa e manipolazione modificano gli oggetti; locomozione e navigazione muovono il robot. Ingressi, uscite e tempi differiscono.
- I compiti reali combinano abilità. Confronta i metodi in condizioni coerenti.
Per continuare
- 4. Piattaforme di IA incarnata: come il corpo condiziona le abilità.
- Processi decisionali di Markov: formulazione matematica.
- Progetti: scegli una direzione per piattaforma e compito.