Capitoli
In questa pagina
6. Tecnologie e moduli
Questo capitolo collega l'introduzione ai corsi. Scopri cosa fa ogni modulo, studiane i principi nei fondamenti e prova i metodi nei progetti. Parti da un'area che ti interessa e ripassa i prerequisiti quando servono.
6.1 Algoritmi dei modelli fondazionali
Di fronte a «metti la tazza rossa sul piatto», un VLM interpreta immagine e istruzione, un VLA genera azioni e un modello del mondo ne prevede le conseguenze. Possono collaborare nello stesso sistema.
VLM: comprendere immagini e linguaggio
Un modello visione-linguaggio elabora immagini e testo per descrivere, rispondere a domande, comprendere obiettivi e ragionare sui compiti. Studia codifica delle immagini, elaborazione delle sequenze linguistiche e fusione delle due forme di informazione.
I moduli includono Transformer, modelli linguistici, codificatori visivi, allineamento immagine-testo e fusione multimodale. Il modello deve collegare «tazza rossa» all'oggetto nell'immagine per informare le azioni successive.
Percorso: fondamenti multimodali → codificatori visivi e allineamento → fusione multimodale e VLM.
VLA: dalla comprensione all'azione
Un VLA genera azioni da immagini, istruzioni e stato del robot. Può produrre riferimenti articolari, obiettivi dell'effettore o sequenze continue.
Studia rappresentazioni delle azioni, imitazione, blocchi di azioni, diffusione, flow matching e integrazione nel ciclo di controllo. OpenVLA e π0 mostrano progetti diversi; il post-addestramento usa gli esiti dell'interazione per migliorare la politica.
Percorso: da VLM a VLA → introduzione ai VLA → OpenVLA / π0.
Pratica: π₀.₅ + RECAP, con preparazione dati, modelli di valore, fine-tuning delle politiche e valutazione simulata.
Modelli del mondo: prevedere le conseguenze
Apprendono come l'ambiente cambia nel tempo e con le azioni. Da osservazioni e azioni candidate prevedono stati, immagini o rappresentazioni latenti per pianificazione, apprendimento delle politiche o valutazione.
Studia previsione condizionata dalle azioni, dinamica latente, previsione video ed errore su più passi. Comprendi come aiutano a scegliere azioni e come verificarne l'affidabilità in ambienti nuovi.
Percorso: introduzione → panoramica e approcci tecnici. Il materiale attuale riguarda concetti, metodi e rassegne di ricerca.
Una sequenza utile è «fondamenti multimodali → VLM → VLA», seguita dai modelli del mondo per pianificazione o apprendimento delle politiche.
6.2 Algoritmi di manipolazione
Segui il processo dall'identificazione dell'oggetto alla pianificazione, al contatto e al completamento del compito.
- Cinematica e pianificazione: la diretta calcola la posa dalle articolazioni; l'inversa trova configurazioni. La pianificazione aggiunge vincoli di percorso e collisione. Inizia da trasformazioni e cinematica, poi MoveIt 2.
- Imitazione e generazione delle azioni: apprendi da osservazioni e azioni dimostrate. ACT predice blocchi; Diffusion Policy genera sequenze per diffusione. Percorso: imitazione, ACT, Diffusion Policy.
- Contatto e forza: studia inseguimento della posizione, cedevolezza e forze in controllo di impedenza e forza.
Pratica: progetto MoveIt 2 per pianificazione ed esecuzione; ACT bimanuale per dati, addestramento e valutazione. ACT introduce la manipolazione appresa; il metodo originale non dipende da istruzioni linguistiche.
6.3 Controllo del movimento
Il controllo fa eseguire azioni affidabili ad articolazioni e corpo. Inizia da retroazione e cinematica, poi passa a modelli e politiche apprese.
- Retroazione: corregge i segnali dall'errore tra stato desiderato e attuale. Studia PID/PD, campionamento, limiti e stabilità in retroazione e PID.
- Controllo basato su modelli: dinamica, LQR, inseguimento e MPC per scegliere segnali e gestire vincoli. Segui il corso sui controllori.
- Controllo per rinforzo: definisci osservazioni, azioni e ricompense. Parti da MDP e PPO, poi ricompense, randomizzazione e sim-to-real.
Pratica: quadrupede da zero collega PD, cinematica e andature; MicroDuck RL mostra addestramento e valutazione del movimento.
6.4 Navigazione
«Percepire → stimare la posizione → pianificare il percorso → eseguire evitando ostacoli» richiede riferimenti coerenti e sensori affidabili.
- Percezione e calibrazione: telecamere, LiDAR, IMU, parametri intrinseci ed estrinseci, sincronizzazione e proiezione. Vedi calibrazione e proiezione dei sensori.
- Localizzazione e mappatura: la stima fonde osservazioni; SLAM localizza costruendo la mappa. Studia deriva e allineamento in odometria, timestamp e stato.
- Pianificazione ed esecuzione: cerca percorsi e genera comandi compatibili con ostacoli e movimento. Nav2 organizza pianificazione, controllo e recupero; VLN integra linguaggio e semantica.
È già disponibile materiale su calibrazione, stima e tf2. I progetti di mappatura e navigazione e navigazione visione-linguaggio sono ancora previsti.
6.5 Ingegneria della simulazione
La simulazione offre esperimenti ripetibili. Parti da una scena minima e aggiungi robot, sensori, controllore e compito.
- Modelli e scene: articolazioni, link, inerzia, collisioni e attuatori con URDF e MJCF.
- Fisica e sensori: passi temporali, contatto, attrito e parametri dei sensori con MuJoCo o Isaac Sim.
- Addestramento e valutazione: interfacce di osservazione, azione, ricompensa e reset, parallelismo, randomizzazione e prove ripetute. Inizia da Gymnasium.
Pratica: introduzione a MuJoCo per creare ed eseguire un ambiente; MicroDuck RL per un flusso completo.
6.6 Ingegneria dei dati
Organizza osservazioni, azioni e informazioni del compito in traiettorie raccoglibili, verificabili, memorizzabili e utilizzabili correttamente nell'addestramento.
- Teleoperazione e raccolta: mappa gli ingressi dell'operatore in azioni registrando immagini, articolazioni e tempi.
- Organizzazione e qualità: confini degli episodi, etichette, unità, frequenze e calibrazione; rileva frame persi, disallineamenti e azioni anomale.
- Preparazione: normalizzazione, partizioni di addestramento e validazione, versioni, caricamento a lotti ed effetti della distribuzione.
Percorso: dataset e corso LeRobot.
Pratica: SO-101 collega dispositivi, controllo e dati; ACT bimanuale porta le dimostrazioni in addestramento e valutazione.
6.7 Ingegneria della messa in opera
Collega le uscite dei modelli a un robot operativo, dai sensori agli attuatori.
- ROS 2 e comunicazione: nodi, topic, servizi, azioni e avvio nelle basi ingegneristiche di ROS 2.
- Inferenza ed esecuzione: latenza, frequenze, blocchi e asincronia in RTC. ONNX Runtime e TensorRT aiutano a eseguire e ottimizzare i modelli.
- Interfacce e debug: converti azioni in posizione, velocità o coppia e controlla unità, tempi, limiti e anomalie nell'integrazione dei controllori.
Pratica: MoveIt 2 per collegare moduli e SO-101 per connettività e un ciclo minimo di controllo.
6.8 Hardware
Comprendere l'hardware aiuta a sapere cosa controllare e osservare e quali vincoli fisici rispettare.
- Meccanica e attuatori: link, articolazioni, trasmissioni, motori e riduttori; DoF, raggio, carico, gioco e rigidezza.
- Elettronica e azionamenti: alimentazione, circuiti dei sensori, encoder e rapporto tra controllo di corrente, velocità e posizione.
- Sistemi embedded: MCU, compiti in tempo reale e bus CAN; come arrivano i comandi e ritorna lo stato.
Inizia da URDF e modelli e collega modellazione e controllo nel corso sui quadrupedi. Progettazione meccanica e CAN e MCU sono ancora pagine in attesa di contenuti.
Inizia da un modulo
Scegli un problema concreto: fusione immagine-testo, una politica di manipolazione o inseguimento articolare. Leggi la teoria, completa un esperimento e registra ingressi, uscite e risultati. Collega gradualmente i moduli in un sistema.
Consulta 7. Profili professionali e le risorse.