Passa al contenuto principale

Visualizza come Markdown

Contenuto convertito in Markdown. Usa il link alla pagina originale in fondo per esplorare i grafici interattivi.

3. Abilità robotiche

Lo studio dell'IA incarnata inizia definendo il compito. Modellarlo bene e scegliere obiettivi e metriche adeguati è spesso più importante che selezionare e ottimizzare il modello. Vedremo prima come definirlo e poi quattro abilità comuni.

3.1 Prima definisci il compito​

Chiarisci abilità desiderata, ambiente e vincoli prima di scegliere un metodo. Quali sensori userai? Quali sono osservazioni e azioni? Cosa significa completare il compito? Misurerai successo, tempo o altre metriche?

Verifica anche l'adeguatezza della configurazione. Una telecamera sul polso può mostrare dettagli invisibili a una dall'alto. Cambiare sensori cambia le condizioni di osservazione: documentalo e confronta i metodi in condizioni coerenti.

3.2 Trasforma il compito in un problema di apprendimento​

Specifica ingressi, uscite e obiettivi. A ogni istante , il robot riceve un'osservazione e una politica produce un'azione in base a essa e all'obiettivo , per esempio un'istruzione linguistica:

L'azione modifica l'ambiente, arriva una nuova osservazione e il ciclo continua. Il rinforzo definisce anche una ricompensa per valutare ogni passo. Per ricompense, ritorni e funzioni di valore, vedi i processi decisionali di Markov.

ElementoSignificatoBraccio che raccoglie una tazzaQuadrupede che avanza
Osservazione Informazione disponibileImmagini, angoli articolari e apertura della pinzaAngoli e velocità articolari, orientamento e velocità angolare IMU, comando di velocità
StatoInformazione completa, spesso non osservabilePosa, massa e attrito reali della tazzaAttrito del terreno, contatti e velocità reale del corpo
Azione Uscita della politicaIncrementi della posa dell'effettore o riferimenti articolari, più apertura/chiusuraAngoli obiettivo di 12 articolazioni
Obiettivo Cosa ottenerePosare la tazza nell'area indicataAvanzare a una data velocità
Condizione di successoCosa significa completareTazza ben posizionata e verticale, nessuna collisioneSeguire la velocità, mantenere equilibrio e ridurre slittamenti
Frequenza di controlloFrequenza delle azioniDa pochi a decine di hertzPer esempio, politica a 50 Hz e controllo articolare più rapido
  • Le osservazioni rivelano solo parte dello stato: la telecamera non mostra il peso della tazza; lo si deduce da forze e movimento durante il sollevamento. È l'osservabilità parziale, compensabile con osservazioni passate o sensori aggiuntivi.
  • La definizione delle azioni cambia la difficoltà: riferimenti articolari o pose dell'effettore, valori assoluti o incrementi, posizioni o coppie hanno vantaggi e costi diversi.
  • Confronta configurazioni coerenti: risultati con osservazioni, azioni, frequenze o condizioni di successo differenti non sono direttamente confrontabili.

3.3 Quattro abilità comuni​

Presa, manipolazione, locomozione e navigazione sono un utile punto di partenza. Le prime due cambiano gli oggetti; le altre muovono il robot. Ogni abilità include una demo 3D esplorabile passo dopo passo.

Presa​

Domanda: come tenere saldamente un oggetto?

La presa stabilisce contatti tra effettore finale e oggetto per vincolarne il movimento, farlo muovere insieme all'effettore ed evitare slittamenti in presenza delle perturbazioni previste.

Una pinza, una mano robotica articolata o una ventosa trattiene l'oggetto prima di spostarlo. Per mettere un blocco in una scatola, il robot prima lo afferra e solleva. Mantenere questo vincolo è la presa; trasporto, posizionamento e rilascio completano il compito di prelievo e posa.

Dimostrazione di abilità in 3D

Afferra saldamente, poi solleva

Preparazione della scena 3D…Un braccio allinea la pinza parallela a un blocco arancione, chiude le dita e solleva il blocco dal tavolo.

Osserva l'oggettoIndividua posizione e orientamento del blocco e scegli zone di contatto sui lati opposti.

Osserva il rapporto tra pinza e oggetto: dall'assenza di contatto a una presa stabile.Trascina la barra di avanzamento o seleziona una fase per esplorare passo dopo passo. Il movimento è semplificato per illustrare l'abilità.

Il rilevamento delle prese usa spesso nuvole di punti o immagini RGB-D per prevedere posizione 3D, orientamento 3D (6-DoF) e apertura di una pinza parallela. Servono anche verifiche di raggiungibilità e collisione.

Gli approcci geometrici e meccanici studiano chiusura di forma e chiusura di forza. I metodi basati sui dati apprendono la qualità delle prese o generano pose. Esempi: Dex-Net, il dataset e benchmark GraspNet-1Billion e AnyGrasp. Anche i modelli analitici possono generare dati di addestramento.

La presa può essere pianificata prima o corretta continuamente con visione, forza e tatto; AnyGrasp permette di seguire le pose di presa. Oggetti rigidi regolari in celle controllate sono un caso relativamente maturo. Mani articolate, oggetti trasparenti o deformabili, occlusioni e scene disordinate restano difficili.

Manipolazione​

Domanda: come cambiare lo stato di un oggetto tramite il contatto?

La manipolazione applica deliberatamente forze o movimento per cambiare posizione, orientamento, forma o altro stato rilevante. Per esempio, afferrare la maniglia di un cassetto e tirarlo lungo le guide fino all'apertura desiderata.

Dimostrazione di abilità in 3D

Afferra la maniglia e apri il cassetto

Preparazione della scena 3D…Il braccio afferra la maniglia, mantiene il contatto e tira il cassetto lungo le guide.

Avvicinati alla manigliaOsserva la maniglia e la direzione delle guide, poi avvicina la pinza alla maniglia.

Afferrare è solo l'inizio. La manipolazione continua a cambiare lo stato del cassetto.Trascina la barra di avanzamento o seleziona una fase per esplorare passo dopo passo. Il movimento è semplificato per illustrare l'abilità.

La presa è un sottoproblema della manipolazione. Una presa stabile mantiene in genere il rapporto di contatto affinché l'oggetto segua l'effettore; durante la manipolazione i contatti possono cambiare con scambi di dita, rotolamento o nuove prese. Punti di contatto fissi non sono un confine assoluto tra i due concetti.

La manipolazione comprende afferrare, trasportare, spingere, spostare, capovolgere, manipolare nella mano, piegare vestiti, sistemare corde, aprire porte, usare utensili, coordinare bracci e svolgere compiti lunghi. Spingere un oggetto o calciare un pallone è manipolazione non prensile: non richiede una presa iniziale.

I compiti complessi scelgono continuamente azioni da immagini, propriocezione e talvolta linguaggio. Apprendimento per imitazione (IL) e VLA sono direzioni importanti: ACT predice blocchi di azioni; Diffusion Policy combina generazione ed esecuzione a orizzonte mobile; π0 e OpenVLA esplorano politiche multitask visione-linguaggio-azione.

Le sfide includono contatti variabili, stati parzialmente osservati, più azioni valide ed errori cumulativi. La retroazione ad anello chiuso conta sia nella manipolazione complessa sia nella presa. Distingui riproduzione di un compito fisso e generalizzazione a oggetti e ambienti nuovi.

Locomozione​

Domanda: come muovere il corpo in modo stabile?

La locomozione sposta il robot attraverso l'interazione di zampe o ruote con l'ambiente, coordinando postura e stabilità. Un quadrupede che sale un gradino deve coordinare sollevamento delle zampe, appoggi e spostamento del peso. Scegliere un percorso fino a una porta richiede anche navigazione.

Dimostrazione di abilità in 3D

Mantieni l'equilibrio e sali i gradini

Preparazione della scena 3D…Un quadrupede alterna sollevamento, appoggio e sostegno delle zampe per salire tre gradini.

Prepara il sostegnoLe quattro zampe sostengono il corpo mentre il robot si prepara ad avanzare.

Osserva come si muove il corpo coordinando appoggi, articolazioni e centro di massa.Trascina la barra di avanzamento o seleziona una fase per esplorare passo dopo passo. Il movimento è semplificato per illustrare l'abilità.

I robot con zampe gestiscono andature, equilibrio, gradini, pendenze e recupero dalle cadute. Quelli su ruote affrontano vincoli di sterzata, slittamento e terreni irregolari. Il controllo dell'intero corpo può collegare mobilità e manipolazione.

Le osservazioni includono spesso posizioni e velocità articolari, orientamento e velocità angolare IMU e, opzionalmente, profondità o mappe di elevazione. La politica può produrre riferimenti per un controllore inferiore o coppie direttamente. Distingui frequenza della politica e frequenza del servo articolare.

Sono comuni MPC e rinforzo sim-to-real. Learning to Walk in Minutes addestra ANYmal con simulazione massivamente parallela in Isaac Gym. La randomizzazione del dominio riduce il divario con la realtà; l'addestramento insegnante–studente trasferisce abilità apprese con informazioni privilegiate alle osservazioni dei sensori di bordo. Robot Parkour esplora la selezione e l'esecuzione di abilità per superare ostacoli tramite visione.

I quadrupedi hanno dimostrato buone capacità in molti scenari valutati. Terreni estremi, basso attrito, affidabilità prolungata e coordinazione corporea con umanoidi o carichi variabili richiedono verifiche specifiche.

Domanda: dove andare, lungo quale percorso e quando fermarsi?

La navigazione sceglie e corregge direzione o percorso usando obiettivo, osservazioni e stima dello stato, evitando ostacoli fino alla destinazione. Risponde a «dove sono, dove vado e come ci arrivo?», per esempio attraversando una stanza fino alla porta.

Dimostrazione di abilità in 3D

Evita gli ostacoli e raggiungi l'obiettivo

Preparazione della scena 3D…Un robot su ruote segue un percorso pianificato attorno a due ostacoli e si ferma all'obiettivo.

Localizza robot e obiettivoIndividua posizione attuale, obiettivo e posizione degli ostacoli.

Osserva obiettivo e percorso: dove andare, come evitare gli ostacoli e quando fermarsi.Trascina la barra di avanzamento o seleziona una fase per esplorare passo dopo passo. Il movimento è semplificato per illustrare l'abilità.

La navigazione sceglie destinazione e percorso; la locomozione determina come muovere il corpo lungo di esso. Un sistema a strati trasmette percorsi, punti intermedi o velocità; il controllo coordina andature, appoggi, articolazioni o ruote. Di fronte a scatole e gradini, la navigazione sceglie dove passare e il controllo gestisce appoggi ed equilibrio.

La cooperazione è continua. Il piano deve considerare passaggi stretti e gradini; slittamenti o blocchi richiedono correzioni di velocità o ripianificazione. Si possono usare moduli separati, pianificazione congiunta o politiche apprese.

I sistemi classici combinano localizzazione o SLAM, pianificazione globale come A* e pianificazione o controllo locale come DWA o MPC. Nav2 riunisce questi componenti. Esistono soluzioni mature per mappe note e ambienti controllati.

Per obiettivo: PointNav raggiunge coordinate; ObjectNav cerca una categoria di oggetti; ImageNav trova un luogo o oggetto corrispondente a un'immagine; VLN segue istruzioni naturali. Gli ingressi possono essere RGB-D, LiDAR, odometria e obiettivi; le uscite velocità o azioni discrete di avanzamento, svolta e arresto.

Alcuni benchmark semplificano il movimento di basso livello. Nel mondo reale ci sono errori di localizzazione, slittamenti, ostacoli dinamici e guasti. Confronta compiti, sensori, criteri di successo ed efficienza del percorso: un buon risultato PointNav non rappresenta tutta la navigazione.

3.4 Confronto delle abilità​

Le frequenze descrivono uno strato specifico. Distingui inferenza, esecuzione, passi di simulazione e servo articolari.

AbilitàIngressi tipiciUscite tipicheScala temporale di esempioMetodiProgressi e limiti
PresaNuvole di punti / RGB-D; forza e tatto opzionaliPosa, apertura o parametri di contattoSecondo il compito o aggiornamento continuoGeometria, meccanica, apprendimento supervisionatoMatura in celle controllate; oggetti e contatti complessi restano difficili
ManipolazioneImmagini e propriocezione; linguaggio, forza e tatto opzionaliAzioni dell'effettore o articolari, blocchi di azioniACT: esecuzione a 50 HzPianificazione, controllo, IL, RL, VLADipende dal compito; generalizzazione e compiti lunghi restano aperti
LocomozioneArticolazioni e IMU; terreno opzionaleRiferimenti articolari, coppie o obiettivi dei piediPolitica a 50 Hz / controllo simulato a 200 Hz, derivati da legged_gymMPC, controllo corporeo, RL sim-to-realMolti risultati sui quadrupedi; terreni difficili e coordinazione corporea restano aperti
NavigazioneVisione / LiDAR, posa e obiettivoPercorsi, punti intermedi, velocità o azioni discreteAlto livello secondo necessità; controllo locale Nav2 a 20 Hz di defaultSLAM, pianificazione, controllo e apprendimentoMatura con mappe note; ambienti aperti e obiettivi semantici restano difficili

3.5 Combinare abilità in compiti reali​

  • Manipolazione mobile: il robot raggiunge il luogo di lavoro e coordina base e braccio; per esempio «Vai in cucina e porta la tazza».
  • Loco-manipolazione: enfatizza l'unione di movimento, equilibrio e contatto, come un quadrupede con braccio che trasporta un oggetto o un umanoide che apre una porta mantenendo l'equilibrio. ALMA è un esempio.

Un umanoide può usare tutte e quattro le abilità. Le capacità dipendono da hardware, percezione, controllo e addestramento oltre che dalla forma.

Riepilogo​

  • Definisci abilità, ambiente, vincoli, osservazioni, azioni e criteri di valutazione prima di scegliere un metodo.
  • Presa e manipolazione modificano gli oggetti; locomozione e navigazione muovono il robot. Ingressi, uscite e tempi differiscono.
  • I compiti reali combinano abilità. Confronta i metodi in condizioni coerenti.

Per continuare​

Riferimenti​

  1. Modern Robotics: Grasping and manipulation
  2. Modern Robotics: Wheeled robots and mobile manipulation
  3. Habitat: ObjectNav and ImageNav tasks and evaluation
  4. VLN-CE: Vision-and-language navigation in continuous environments