Passa al contenuto principale

Visualizza come Markdown

Contenuto convertito in Markdown. Usa il link alla pagina originale in fondo per esplorare i grafici interattivi.

6. Tecnologie e moduli

Questo capitolo collega l'introduzione ai corsi. Scopri cosa fa ogni modulo, studiane i principi nei fondamenti e prova i metodi nei progetti. Parti da un'area che ti interessa e ripassa i prerequisiti quando servono.

6.1 Algoritmi dei modelli fondazionali​

Di fronte a «metti la tazza rossa sul piatto», un VLM interpreta immagine e istruzione, un VLA genera azioni e un modello del mondo ne prevede le conseguenze. Possono collaborare nello stesso sistema.

VLM: comprendere immagini e linguaggio​

Un modello visione-linguaggio elabora immagini e testo per descrivere, rispondere a domande, comprendere obiettivi e ragionare sui compiti. Studia codifica delle immagini, elaborazione delle sequenze linguistiche e fusione delle due forme di informazione.

I moduli includono Transformer, modelli linguistici, codificatori visivi, allineamento immagine-testo e fusione multimodale. Il modello deve collegare «tazza rossa» all'oggetto nell'immagine per informare le azioni successive.

Percorso: fondamenti multimodali → codificatori visivi e allineamento → fusione multimodale e VLM.

VLA: dalla comprensione all'azione​

Un VLA genera azioni da immagini, istruzioni e stato del robot. Può produrre riferimenti articolari, obiettivi dell'effettore o sequenze continue.

Studia rappresentazioni delle azioni, imitazione, blocchi di azioni, diffusione, flow matching e integrazione nel ciclo di controllo. OpenVLA e π0 mostrano progetti diversi; il post-addestramento usa gli esiti dell'interazione per migliorare la politica.

Percorso: da VLM a VLA → introduzione ai VLA → OpenVLA / π0.

Pratica: π₀.₅ + RECAP, con preparazione dati, modelli di valore, fine-tuning delle politiche e valutazione simulata.

Modelli del mondo: prevedere le conseguenze​

Apprendono come l'ambiente cambia nel tempo e con le azioni. Da osservazioni e azioni candidate prevedono stati, immagini o rappresentazioni latenti per pianificazione, apprendimento delle politiche o valutazione.

Studia previsione condizionata dalle azioni, dinamica latente, previsione video ed errore su più passi. Comprendi come aiutano a scegliere azioni e come verificarne l'affidabilità in ambienti nuovi.

Percorso: introduzione → panoramica e approcci tecnici. Il materiale attuale riguarda concetti, metodi e rassegne di ricerca.

Una sequenza utile è «fondamenti multimodali → VLM → VLA», seguita dai modelli del mondo per pianificazione o apprendimento delle politiche.

6.2 Algoritmi di manipolazione​

Segui il processo dall'identificazione dell'oggetto alla pianificazione, al contatto e al completamento del compito.

  • Cinematica e pianificazione: la diretta calcola la posa dalle articolazioni; l'inversa trova configurazioni. La pianificazione aggiunge vincoli di percorso e collisione. Inizia da trasformazioni e cinematica, poi MoveIt 2.
  • Imitazione e generazione delle azioni: apprendi da osservazioni e azioni dimostrate. ACT predice blocchi; Diffusion Policy genera sequenze per diffusione. Percorso: imitazione, ACT, Diffusion Policy.
  • Contatto e forza: studia inseguimento della posizione, cedevolezza e forze in controllo di impedenza e forza.

Pratica: progetto MoveIt 2 per pianificazione ed esecuzione; ACT bimanuale per dati, addestramento e valutazione. ACT introduce la manipolazione appresa; il metodo originale non dipende da istruzioni linguistiche.

6.3 Controllo del movimento​

Il controllo fa eseguire azioni affidabili ad articolazioni e corpo. Inizia da retroazione e cinematica, poi passa a modelli e politiche apprese.

  • Retroazione: corregge i segnali dall'errore tra stato desiderato e attuale. Studia PID/PD, campionamento, limiti e stabilità in retroazione e PID.
  • Controllo basato su modelli: dinamica, LQR, inseguimento e MPC per scegliere segnali e gestire vincoli. Segui il corso sui controllori.
  • Controllo per rinforzo: definisci osservazioni, azioni e ricompense. Parti da MDP e PPO, poi ricompense, randomizzazione e sim-to-real.

Pratica: quadrupede da zero collega PD, cinematica e andature; MicroDuck RL mostra addestramento e valutazione del movimento.

«Percepire → stimare la posizione → pianificare il percorso → eseguire evitando ostacoli» richiede riferimenti coerenti e sensori affidabili.

  • Percezione e calibrazione: telecamere, LiDAR, IMU, parametri intrinseci ed estrinseci, sincronizzazione e proiezione. Vedi calibrazione e proiezione dei sensori.
  • Localizzazione e mappatura: la stima fonde osservazioni; SLAM localizza costruendo la mappa. Studia deriva e allineamento in odometria, timestamp e stato.
  • Pianificazione ed esecuzione: cerca percorsi e genera comandi compatibili con ostacoli e movimento. Nav2 organizza pianificazione, controllo e recupero; VLN integra linguaggio e semantica.

È già disponibile materiale su calibrazione, stima e tf2. I progetti di mappatura e navigazione e navigazione visione-linguaggio sono ancora previsti.

6.5 Ingegneria della simulazione​

La simulazione offre esperimenti ripetibili. Parti da una scena minima e aggiungi robot, sensori, controllore e compito.

  • Modelli e scene: articolazioni, link, inerzia, collisioni e attuatori con URDF e MJCF.
  • Fisica e sensori: passi temporali, contatto, attrito e parametri dei sensori con MuJoCo o Isaac Sim.
  • Addestramento e valutazione: interfacce di osservazione, azione, ricompensa e reset, parallelismo, randomizzazione e prove ripetute. Inizia da Gymnasium.

Pratica: introduzione a MuJoCo per creare ed eseguire un ambiente; MicroDuck RL per un flusso completo.

6.6 Ingegneria dei dati​

Organizza osservazioni, azioni e informazioni del compito in traiettorie raccoglibili, verificabili, memorizzabili e utilizzabili correttamente nell'addestramento.

  • Teleoperazione e raccolta: mappa gli ingressi dell'operatore in azioni registrando immagini, articolazioni e tempi.
  • Organizzazione e qualità: confini degli episodi, etichette, unità, frequenze e calibrazione; rileva frame persi, disallineamenti e azioni anomale.
  • Preparazione: normalizzazione, partizioni di addestramento e validazione, versioni, caricamento a lotti ed effetti della distribuzione.

Percorso: dataset e corso LeRobot.

Pratica: SO-101 collega dispositivi, controllo e dati; ACT bimanuale porta le dimostrazioni in addestramento e valutazione.

6.7 Ingegneria della messa in opera​

Collega le uscite dei modelli a un robot operativo, dai sensori agli attuatori.

  • ROS 2 e comunicazione: nodi, topic, servizi, azioni e avvio nelle basi ingegneristiche di ROS 2.
  • Inferenza ed esecuzione: latenza, frequenze, blocchi e asincronia in RTC. ONNX Runtime e TensorRT aiutano a eseguire e ottimizzare i modelli.
  • Interfacce e debug: converti azioni in posizione, velocità o coppia e controlla unità, tempi, limiti e anomalie nell'integrazione dei controllori.

Pratica: MoveIt 2 per collegare moduli e SO-101 per connettività e un ciclo minimo di controllo.

6.8 Hardware​

Comprendere l'hardware aiuta a sapere cosa controllare e osservare e quali vincoli fisici rispettare.

  • Meccanica e attuatori: link, articolazioni, trasmissioni, motori e riduttori; DoF, raggio, carico, gioco e rigidezza.
  • Elettronica e azionamenti: alimentazione, circuiti dei sensori, encoder e rapporto tra controllo di corrente, velocità e posizione.
  • Sistemi embedded: MCU, compiti in tempo reale e bus CAN; come arrivano i comandi e ritorna lo stato.

Inizia da URDF e modelli e collega modellazione e controllo nel corso sui quadrupedi. Progettazione meccanica e CAN e MCU sono ancora pagine in attesa di contenuti.

Inizia da un modulo​

Scegli un problema concreto: fusione immagine-testo, una politica di manipolazione o inseguimento articolare. Leggi la teoria, completa un esperimento e registra ingressi, uscite e risultati. Collega gradualmente i moduli in un sistema.

Consulta 7. Profili professionali e le risorse.