Un braccio robotico osserva una cella di lavoro attraverso una normale telecamera RGB, riceve un comando come “prendi il blocco blu” e genera autonomamente la sequenza di movimenti necessaria per afferrarlo e trasferirlo. È il principio dimostrato da ChunkVLA-AM, un sistema sviluppato da ricercatori della University of Texas Rio Grande Valley, University of South Florida e San Diego State University per studiare l’impiego dei Vision-Language-Action model nell’automazione della manifattura additiva. Il lavoro è stato reso pubblico su arXiv il 1° ottobre 2026 e il gruppo di ricerca coordinato da Jinghao Yang ne segnala l’accettazione come regular paper alla conferenza ICTAI 2026. La dimostrazione è interessante, ma richiede subito una precisazione: il robot non ha ancora rimosso supporti, pulito polvere, eseguito sabbiatura o effettuato altre vere operazioni di post-processing. Nei test fisici ha eseguito un compito molto più controllato, trasferendo blocchi colorati da un punto A a un punto B. Gli autori lo utilizzano come proxy sperimentale del recupero di una parte dopo la stampa, cioè come primo passo verso celle additive nelle quali un robot possa interpretare visivamente il contesto e intervenire senza che ogni traiettoria debba essere programmata manualmente.

Il sistema, denominato ChunkVLA-AM, utilizza come base OpenVLA-OFT, una versione ottimizzata della famiglia OpenVLA. OpenVLA è un modello Vision-Language-Action da circa sette miliardi di parametri sviluppato per trasformare immagini e istruzioni linguistiche direttamente in comandi robotici. Non si tratta quindi di collegare semplicemente un chatbot a un braccio meccanico: un VLA è addestrato specificamente a mettere in relazione ciò che vede, ciò che gli viene chiesto e il movimento fisico che dovrebbe eseguire. Nel caso di ChunkVLA-AM, il modello è stato ulteriormente adattato alla cinematica e al sistema di coordinate di un cobot FAIRINO FR3, producendo sequenze di movimenti cartesiani che vengono controllate da un livello software locale prima dell’esecuzione.

Perché un Vision-Language-Action model può essere interessante nella manifattura additiva

Una cella di additive manufacturing realmente automatizzata richiede molto più della macchina che deposita o consolida il materiale. Al termine del processo bisogna identificare il componente, manipolarlo, trasferirlo verso stazioni successive, eventualmente separarlo dalla piattaforma, controllarlo e gestire anomalie. Nelle tecnologie metalliche possono entrare in gioco anche manipolazione della build plate, depowdering, trattamento termico, rimozione dei supporti e lavorazioni meccaniche; nei sistemi FFF possono essere necessarie estrazione del pezzo, rimozione dei supporti e controllo di fenomeni come warping o distacco dal piano.

Gran parte di queste operazioni può già essere automatizzata con robot industriali tradizionali. Il limite non è quindi l’assenza di robot capaci di prendere una parte, ma la rigidità delle procedure convenzionali. Un robot classico può ripetere un pick-and-place con precisione elevata quando posizione del componente, geometria, orientamento, attrezzatura e condizioni della cella rimangono predeterminati. Se cambia la parte, il punto in cui si trova o l’azione richiesta, è normalmente necessario modificare programma, coordinate o sistema di visione.

L’approccio VLA tenta di introdurre un livello differente di flessibilità. Invece di codificare esplicitamente una catena del tipo “identifica oggetto A, vai alla coordinata X, abbassa il TCP di Y millimetri, chiudi la pinza”, l’operatore può fornire un’istruzione linguistica e lasciare al modello il compito di associare immagine, oggetto e azioni. In prospettiva, un sistema potrebbe ricevere istruzioni del tipo “rimuovi il componente completato”, “porta il campione nella zona di raffreddamento” oppure “controlla il bordo deformato”. Nel lavoro ChunkVLA-AM, tuttavia, queste attività più complesse sono indicate dagli autori soprattutto come sviluppi futuri: l’esperimento fisico si limita alla selezione per colore e al trasferimento di oggetti.

Il robot utilizzato è un FAIRINO FR3

La piattaforma fisica scelta dai ricercatori è il FAIRINO FR3, un cobot a sei assi. Il produttore specifica una capacità nominale di carico di 3 kg, con un massimo dichiarato di 5 kg in determinate condizioni, un raggio operativo di 622 mm e una pose repeatability secondo ISO 9283 pari a ±0,02 mm. Quest’ultimo valore non deve essere confrontato direttamente con gli errori millimetrici ottenuti dal modello AI: la repeatability del robot misura la capacità meccanica del manipolatore di ritornare ripetutamente a una posizione comandata, mentre gli errori di ChunkVLA-AM comprendono anche la previsione del modello, la percezione visuale e la ricostruzione della traiettoria.

In altre parole, il fatto che il braccio abbia una repeatability nominale di ±0,02 mm non significa che un sistema AI guidato da una sola immagine RGB sappia localizzare autonomamente un oggetto con la stessa accuratezza. Nel caso studiato, l’errore maggiore nasce proprio dalla componente percettiva e decisionale, non dalla capacità dei servomotori del cobot di riprodurre una traiettoria nota.

Cosa significa realmente “otto movimenti alla volta”

La caratteristica che dà il nome a ChunkVLA-AM è l’action chunking. Invece di chiedere al modello una singola azione, eseguirla e interrogarlo nuovamente dopo ogni piccolo movimento, il sistema genera un blocco di otto azioni future in una singola inferenza.

Ogni azione è descritta attraverso sette valori logici: variazione della posizione lungo X, Y e Z; variazione di orientamento attraverso tre componenti rotazionali; comando binario della pinza. Formalmente la rappresentazione utilizzata dai ricercatori è quindi composta da sei gradi di movimento dell’end effector più lo stato del gripper.

Non significa che il robot “impari otto mosse e poi le memorizzi”. A ogni ciclo il modello osserva un’immagine, considera il comando linguistico e genera una breve traiettoria futura composta da otto step. Il robot esegue quel chunk e solo dopo acquisisce una nuova immagine, dalla quale viene calcolato il gruppo successivo di azioni.

Si crea quindi un compromesso tra controllo open loop e closed loop. All’interno del singolo chunk gli otto comandi vengono eseguiti senza una nuova osservazione visiva; fra un chunk e quello successivo il sistema osserva nuovamente la scena e corregge la traiettoria. Definire l’intero sistema semplicemente “closed loop” nasconderebbe questa distinzione.

I dati dimostrativi utilizzati per l’adattamento sono campionati a circa 25 Hz. Otto campioni corrispondono teoricamente a circa 0,32 secondi di traiettoria a quella frequenza, anche se il tempo effettivo del ciclo robotico comprende comunicazione, esecuzione e altre operazioni e non può essere ricavato soltanto dalla frequenza del dataset.

Perché non chiedere all’AI un movimento alla volta

L’action chunking cerca di affrontare due problemi. Il primo è la latenza. Un modello da sette miliardi di parametri richiede risorse computazionali significative; interrogare il server per ogni microscopico movimento introdurrebbe un continuo ciclo di acquisizione, trasmissione dell’immagine, inferenza, risposta ed esecuzione.

Il secondo è la coerenza temporale. Generando più azioni correlate contemporaneamente, il modello può produrre segmenti di traiettoria maggiormente continui rispetto a una successione di decisioni indipendenti. È uno dei principi già esplorati nella robotica tramite architetture come ACT e successivamente incorporato nella strategia OpenVLA-OFT.

Esiste però il compromesso opposto: un chunk troppo lungo aumenta il tempo durante il quale il robot esegue movimenti senza verificare visivamente che la scena sia ancora quella prevista. Se l’oggetto scivola, un operatore interviene o compare un ostacolo, il modello non reagisce fino alla successiva acquisizione.

Per questo otto non rappresenta un numero universalmente ottimale. È l’orizzonte scelto per la configurazione sperimentale presentata nel lavoro. Gli stessi autori indicano tra gli sviluppi futuri la necessità di confrontare sistematicamente differenti lunghezze del chunk. Inoltre il confronto effettuato nel paper non consente di attribuire tutto il miglioramento agli otto step, perché il modello chunked differisce dal baseline anche per il tipo di adattamento effettuato.

OpenVLA e OpenVLA-OFT: da dove arriva il modello

OpenVLA è stato sviluppato da ricercatori provenienti, tra gli altri, da Stanford University e University of California, Berkeley. Il modello originario possiede circa sette miliardi di parametri ed è stato addestrato su circa 970.000 dimostrazioni robotiche reali, utilizzando una struttura che combina un modello linguistico Llama 2 con rappresentazioni visuali derivate da DINOv2 e SigLIP.

L’obiettivo di un modello simile è costruire una politica robotica sufficientemente generale da poter successivamente essere adattata a nuovi robot e compiti senza dover addestrare l’intero sistema da zero.

OpenVLA-OFT è una successiva strategia di optimized fine-tuning sviluppata da Moo Jin Kim, Chelsea Finn e Percy Liang a Stanford. Il lavoro combina, tra gli altri elementi, parallel decoding, action chunking e una rappresentazione continua delle azioni. Nei benchmark originali i ricercatori hanno mostrato miglioramenti rilevanti della velocità di generazione e delle prestazioni rispetto alla versione standard di OpenVLA. Questi risultati appartengono però ai benchmark del progetto OpenVLA-OFT e non devono essere trasferiti direttamente alla cella di additive manufacturing.

ChunkVLA-AM prende questa architettura e affronta un problema ulteriore: come adattarla a un robot che non coincide con quelli utilizzati durante il pretraining.

Senza adattamento al FR3 il modello sbaglia di centinaia di millimetri

Uno dei risultati forse più istruttivi del paper riguarda proprio il comportamento zero-shot. Utilizzare direttamente OpenVLA o OpenVLA-OFT sul FAIRINO FR3 senza uno specifico adattamento produce errori troppo elevati per essere compatibili con una cella industriale.

Nei test sulle traiettorie registrate, le configurazioni zero-shot hanno mostrato Mean Absolute Error compresi tra 179,60 e 650,12 mm. Sono errori enormi rispetto alle dimensioni della cella e dimostrano che possedere un grande modello robotico generalista non significa poterlo installare su qualsiasi manipolatore e iniziare immediatamente a lavorare.

Le ragioni sono strutturali. Robot differenti descrivono le proprie azioni in modi differenti: posizione assoluta, delta cartesiani, coordinate articolari, velocità, orientamenti e convenzioni della pinza possono avere significati diversi. Anche quando due modelli utilizzano vettori della stessa lunghezza, le singole variabili non sono necessariamente equivalenti.

Il lavoro di ChunkVLA-AM comprende quindi una pipeline per trasformare i log del FR3 nel formato TFDS/RLDS utilizzato dall’ecosistema OpenVLA, definendo sistema di coordinate, normalizzazione delle azioni, immagini, comandi linguistici e informazioni relative agli episodi.

LoRA permette di adattare il modello senza riaddestrare sette miliardi di parametri

Per l’adattamento i ricercatori utilizzano LoRA, Low-Rank Adaptation, una tecnica che evita di modificare tutti i pesi del modello di base. La maggior parte della rete rimane congelata e vengono addestrate matrici aggiuntive molto più piccole.

Nel setup descritto vengono utilizzati rank LoRA pari a 32, dropout zero, learning rate di 5×10⁻⁴, batch size 8 e accumulo dei gradienti su quattro step, corrispondente a un batch effettivo di 32. L’addestramento viene effettuato per circa 30 epoche.

La scelta è rilevante perché uno dei problemi pratici dei foundation model robotici è il costo necessario per personalizzarli per ogni nuova macchina, end effector e cella produttiva. Un approccio parameter-efficient può rendere l’adattamento più gestibile, anche se rimane necessario raccogliere dimostrazioni rappresentative del nuovo robot.

Il paper non presenta quindi un sistema che impara il lavoro semplicemente ascoltando una singola istruzione. Il comando in linguaggio naturale viene interpretato da un modello che dispone di un pretraining esteso e che è stato successivamente fine-tuned su dimostrazioni del FR3.

Una sola telecamera RGB, senza depth camera e senza sensori tattili

Un elemento interessante della dimostrazione è la semplicità dell’apparato di percezione. Il modello utilizza una singola telecamera RGB monoculare fissata nella cella. Le immagini vengono convertite in RGB, rese quadrate tramite padding e ridimensionate a 224 × 224 pixel.

Non vengono utilizzate telecamere depth, stereo vision, sensori tattili o una rete di telecamere distribuite intorno alla cella. Questo riduce la complessità dell’hardware ma rende più difficile valutare la profondità.

Il problema emerge nei risultati: l’errore sull’asse Z è nettamente maggiore rispetto a quelli sulle direzioni laterali. È un comportamento plausibile per un sistema che deve ricavare la geometria tridimensionale da una singola vista bidimensionale e che non dispone di misura diretta della profondità.

L’impiego di una camera fissa semplifica inoltre l’esperimento ma limita la generalizzazione. Il sistema è stato testato nella stessa configurazione di cella. Non è stato dimostrato che possa essere spostato su una stampante diversa, cambiare automaticamente posizione della telecamera o operare in un ambiente produttivo non precedentemente adattato.

Da 9,5 mm a 1,74 mm di errore medio, ma attenzione a cosa misura questo numero

Il confronto fra le configurazioni mostra una forte riduzione dell’errore dopo l’adattamento. Un modello fine-tuned ma a predizione single-step raggiunge un errore medio sui tre assi di 9,50 mm, con 16,90 mm sull’asse X.

ChunkVLA-AM nella configurazione adattata con chunk da otto step riporta invece una media degli errori assoluti sui tre assi pari a circa 1,74 mm: 0,37 mm su X, 0,97 mm su Y e 3,87 mm su Z.

Non bisogna chiamare questo valore genericamente “precisione di 1,74 mm”. Si tratta di Mean Absolute Error della traiettoria prevista rispetto alla traiettoria dell’esperto nelle analisi effettuate sui dati registrati. Non è né la risoluzione del robot, né la sua repeatability meccanica, né una misura metrologica della posizione reale del TCP durante tutte le prove fisiche.

Gli stessi autori specificano inoltre che queste curve vengono ottenute sulle traiettorie loggate in open loop e devono essere distinte dal successo finale dell’esperimento robotico closed-loop.

39 trasferimenti riusciti su 42

La validazione fisica comprende 42 prove, divise equamente tra un blocco rosso e uno blu: 21 test per ciascun colore. Il comando chiedeva al robot di prendere uno dei due oggetti, trasferirlo dal punto A al punto B e rilasciarlo.

Il sistema ha completato correttamente 39 trasferimenti su 42, pari al 92,9%.

I tre fallimenti hanno avuto la stessa origine generale: nella fase finale di deposito l’altezza di rilascio non era controllata sufficientemente e il blocco, una volta lasciato dalla pinza, cadeva o si ribaltava.

È un risultato utile perché evidenzia immediatamente la differenza tra riconoscere il target e svolgere un processo industriale robusto. Il robot riesce nella maggior parte dei casi a individuare il colore richiesto, avvicinarsi, afferrare e trasportare l’oggetto. Le criticità arrivano però proprio nella componente tridimensionale più delicata.

Per manipolare un componente stampato realmente, specialmente quando possiede geometrie fragili, superfici ancora calde o una posizione non perfettamente conosciuta, pochi millimetri sulla quota verticale possono fare la differenza tra un prelievo corretto e una collisione.

L’RTX 6000 Ada non è montata sul robot

Il modello da sette miliardi di parametri non viene eseguito dal computer che controlla il cobot. ChunkVLA-AM utilizza un’architettura cloud-edge, anche se nel prototipo il termine “remote server” non implica necessariamente un cloud pubblico.

La workstation locale collegata al FAIRINO FR3 rimane CPU-only. Acquisisce l’immagine e la trasmette tramite un’interfaccia FastAPI a un server dotato di NVIDIA RTX 6000 Ada. Il server esegue l’inferenza OpenVLA-OFT e restituisce il chunk di azioni.

Secondo gli autori, il tempo di inferenza registrato sul server è circa 0,06-0,08 secondi per richiesta. Questo numero non rappresenta però il tempo di ciclo totale: esclude acquisizione dell’immagine, trasmissione attraverso la rete e movimento fisico del robot.

L’architettura permette di mantenere la parte computazionalmente impegnativa lontana dal controller industriale e facilita l’impiego di hardware robotico relativamente semplice. Introduce però un’altra variabile: la rete. Per questo il client locale verifica timeout, pacchetti obsoleti e altre condizioni prima di autorizzare i movimenti.

L’AI non invia comandi direttamente ai motori senza controlli

Uno degli aspetti più importanti della ricerca è proprio il livello di sicurezza posto tra output del modello ed esecuzione fisica. Il VLA propone la traiettoria, ma un filtro tradizionale esamina ogni azione prima di passarla al controllore.

Nella configurazione sperimentale ogni movimento cartesiano viene limitato a un massimo di 5 mm per azione, mentre le variazioni rotazionali sono limitate a 0,05 radianti, circa 2,86°. Il sistema controlla inoltre che la nuova posizione rimanga all’interno del volume di lavoro consentito e sopra una quota minima rispetto alla build plate.

Vengono respinti anche valori non numerici, comandi non validi per il gripper, risposte arrivate dopo un timeout, chunk ormai obsoleti o azioni ricevute dopo l’attivazione dell’emergency stop. Quando un comando viene considerato non sicuro, il resto del chunk può essere scartato.

Questa architettura mette in evidenza un principio importante per l’AI industriale: il foundation model non sostituisce necessariamente il controllo deterministico. Può generare la strategia di movimento, ma limiti geometrici, interlock ed emergency stop rimangono gestiti mediante logiche esplicite e verificabili.

La luce modifica le prestazioni

Gli autori hanno dedicato una parte significativa della sperimentazione alle condizioni di illuminazione. È un problema particolarmente importante nell’additive manufacturing, dove la scena può comprendere build plate metalliche riflettenti, polimeri neri, superfici lucide, ombre prodotte dal manipolatore e illuminazione interna della macchina.

Sono state considerate condizioni di luce bassa, normale e sovraesposta, oltre a illuminazione calda a circa 3.000 K e fredda a circa 6.500 K. La camera è rimasta nella stessa posizione.

Nella condizione baseline, con luminanza media dell’immagine pari a circa 109 sulla scala 0-255, gli errori misurati sono 0,37 mm su X, 0,97 mm su Y e 3,87 mm su Z, con errore tridimensionale L2 di circa 4,01 mm. Nell’estrema sovraesposizione, con luminanza intorno a 190, l’errore L2 sale a circa 5,22 mm e quello sull’asse Y raggiunge 2,30 mm.

Una successiva analisi su dieci traiettorie e livelli di luminanza compresi tra 30 e 210 individua una regione di errore relativamente basso tra 85 e 125, con il minimo aggregato intorno a 95. Gli autori sottolineano però correttamente che 95 non va interpretato come “l’illuminazione ideale”: nei singoli trial la luminanza associata al minimo errore varia ampiamente, fra 36 e 198.

L’informazione più utile è quindi un’altra: il modello soffre maggiormente alle estremità, soprattutto in condizioni molto scure o fortemente sovraesposte. In una cella produttiva reale questo suggerisce la necessità di illuminazione controllata, augmentation durante l’addestramento oppure sensori più robusti.

Il limite maggiore: non è stato ancora dimostrato il vero post-processing

È qui che occorre ridimensionare l’interpretazione più ambiziosa del progetto. Definire il sistema come un robot che ha già imparato il “post-processing della stampa 3D” sarebbe improprio.

Il task fisico consiste nel riconoscere un blocco rosso o blu, afferrarlo e trasferirlo. Non risultano dimostrate nel paper operazioni come rimozione di supporti, distacco automatico di un componente da una build plate, depowdering, sabbiatura, levigatura, machining, lucidatura, controllo dimensionale o gestione reale di un pezzo deformato.

Persino la frase “post-print retrieval” deve essere letta nel significato sperimentale utilizzato dagli autori: i blocchi servono da proxy riproducibile per una futura parte stampata.

È una scelta perfettamente ragionevole dal punto di vista della ricerca. Per capire se un modello VLA possa controllare un robot è utile partire da un task semplice e misurabile. Ma il passaggio da questo esperimento a una cella industriale completamente autonoma rimane considerevole.

Rimuovere una stampa reale è più difficile che prendere un blocco

Una parte FFF può essere ancora aderente alla piattaforma. Per rimuoverla il robot deve conoscere non soltanto la sua posizione, ma anche forza necessaria, orientamento, fragilità e modalità di distacco. Una pinza rigida potrebbe danneggiare pareti sottili; un componente deformato potrebbe trovarsi diversi millimetri lontano dalla geometria nominale.

In vat photopolymerization entrano in gioco resina non polimerizzata, dripping e necessità di trasferire il pezzo senza contaminarne superfici o attrezzature. Nel powder bed fusion metallico il problema diventa ancora diverso: manipolazione di polvere, DPI, atmosfera controllata, massa della build plate e successivi processi di separazione introducono requisiti incompatibili con una semplice dimostrazione pick-and-place.

Il modello dovrebbe quindi integrare informazioni che la configurazione ChunkVLA-AM corrente non possiede: depth sensing, force/torque feedback, tactile sensing, stato della macchina e talvolta dati termici o dimensionali.

Gli autori stessi indicano il contact-force monitoring come uno degli sviluppi futuri.

Riconoscere un pezzo deformato richiede un salto ulteriore

Nel paper viene proposta per il futuro anche l’ispezione di parti deformate. Questa applicazione è più complessa del riconoscimento di un blocco colorato. Identificare un warped edge richiede innanzitutto sapere quale dovrebbe essere la geometria corretta.

Un sistema industriale potrebbe dover confrontare l’immagine con il CAD nominale, con dati dimensionali o con immagini di riferimento. Una singola camera RGB potrebbe individuare deformazioni molto evidenti, ma non può sostituire automaticamente metrologia 3D, profilometria o CT quando sono richieste tolleranze dimensionali precise.

Un VLA potrebbe quindi diventare il livello decisionale che interpreta la situazione e ordina un controllo aggiuntivo, piuttosto che sostituire tutti i sensori specialistici.

Il vero vantaggio potrebbe essere nelle produzioni molto variabili

Una cella tradizionale progettata per produrre milioni di componenti identici non ha necessariamente bisogno di un grande modello multimodale: un sistema di visione deterministico e un programma robotico validato possono risultare più veloci, prevedibili e semplici da qualificare.

La situazione cambia nell’additive manufacturing, dove una singola macchina può produrre continuamente geometrie differenti e dove il vantaggio economico deriva spesso proprio dall’assenza di tooling specifico. Se ogni nuovo componente richiedesse settimane per riprogrammare l’automazione downstream, parte della flessibilità della stampa 3D verrebbe persa.

È in questo contesto che i VLA potrebbero diventare interessanti. Il CAD e il job di produzione potrebbero definire che cosa è stato costruito; la visione potrebbe rilevare dove si trova realmente il pezzo; un comando di alto livello potrebbe indicare l’operazione richiesta; il robot potrebbe infine generare la manipolazione più appropriata mantenendosi all’interno di un insieme di vincoli verificabili.

L’obiettivo non sarebbe necessariamente eliminare la programmazione industriale, ma spostarla verso un livello più astratto: definire regole, zone sicure e capacità disponibili, lasciando al modello parte della generazione delle traiettorie.

Dal comando in linguaggio naturale all’autonomia industriale manca ancora la validazione

La dimostrazione ChunkVLA-AM presenta un risultato concreto: 39 successi su 42 tentativi con un modello da sette miliardi di parametri adattato a un cobot commerciale e controllato attraverso una sola telecamera RGB. Dimostra inoltre che il trasferimento zero-shot di un VLA generalista è insufficiente e che l’adattamento specifico all’embodiment è indispensabile.

Non dimostra invece che la tecnologia sia pronta per gestire autonomamente un reparto di stampa 3D. Il numero dei task fisici è molto limitato, gli oggetti sono semplici, il workspace è fisso, la telecamera non cambia posizione e manca una valutazione estesa su geometrie, materiali e condizioni realmente rappresentative del post-processing.

La percentuale del 92,9% deve essere letta proprio in questo contesto. In un esperimento di ricerca è un risultato promettente; in una cella produttiva che deve funzionare per migliaia di cicli senza danneggiare componenti di valore, un fallimento ogni quattordici operazioni circa sarebbe generalmente incompatibile con una reale automazione non supervisionata.

Cosa è stato realmente dimostrato

ElementoStato verificatoLimite da considerare
ChunkVLA-AMSistema sperimentale funzionanteNon è un prodotto commerciale
PubblicazionePreprint arXiv del 1° ottobre 2026; il laboratorio indica accettazione a ICTAI 2026La versione pubblicamente analizzata è arXiv v1
RobotFAIRINO FR3 a 6 assiIl test riguarda una sola configurazione robotica
ModelloOpenVLA-OFT, circa 7 miliardi di parametriRichiede adattamento specifico al FR3
PercezioneUna telecamera RGB monoculareNessuna depth camera o tactile sensing
Action chunk8 azioni 7-D per inferenzaOtto non è dimostrato come numero ottimale
InferenzaCirca 0,06-0,08 s su RTX 6000 AdaEsclude rete, acquisizione ed esecuzione robotica
Errore medio traiettoria1,74 mm di MAE medio sugli assi nella configurazione adattataNon è la repeatability o la “precisione” del robot
Errore Z3,87 mm nella baselineSignificativamente superiore a X e Y
Test fisici39 successi su 42, pari al 92,9%Solo trasferimento di blocchi rosso/blu
Fallimenti3 casiTutti nella fase di rilascio per controllo insufficiente dell’altezza
Robustezza alla luceTestata su differenti livelli e temperature colorePeggioramento alle condizioni estreme
Vero post-processing AMNon dimostratoRimozione supporti, depowdering, finishing e inspection restano sviluppi futuri

Il passo interessante non è che il robot “capisca l’italiano”, ma che percezione e movimento inizino a fondersi

La parte più rilevante di ChunkVLA-AM non è quindi la possibilità scenografica di parlare a un robot. Sistemi industriali controllabili tramite interfacce linguistiche esistono già a diversi livelli. Il passaggio più interessante è l’integrazione tra percezione, linguaggio e generazione del movimento all’interno della stessa politica robotica.

Un operatore umano che recupera un pezzo da una stampante compie continuamente questo processo: osserva la cella, riconosce quale componente deve prendere, decide come raggiungerlo, adatta la mano se la posizione è differente da quella attesa e modifica l’azione quando qualcosa non va. La robotica tradizionale suddivide normalmente queste funzioni in moduli differenti. I VLA tentano di apprenderne una rappresentazione congiunta.

ChunkVLA-AM mostra che questa strategia può essere trasferita a una piccola cella collegata alla manifattura additiva, ma mostra contemporaneamente quanto l’automazione fisica sia meno indulgente della generazione di testo o immagini. Uno scarto di pochi millimetri sulla quota Z può far cadere un pezzo; un cambiamento nell’illuminazione modifica le previsioni; il passaggio da un robot a un altro richiede nuovo addestramento; e l’output dell’AI deve comunque essere racchiuso dentro un livello di sicurezza deterministico.

Il percorso più realistico non sembra quindi quello di affidare improvvisamente l’intera fabbrica a un modello generalista, ma di introdurre progressivamente sistemi VLA in task nei quali la flessibilità ha più valore della ripetizione assoluta: riconoscimento e movimentazione di lotti variabili, recupero di parti, smistamento, gestione di anomalie e interventi che oggi richiedono programmazione manuale per ogni nuova geometria.

La dimostrazione con due blocchi colorati è ancora lontana da questo scenario, ma consente di misurare per la prima volta diversi problemi concreti: adattamento all’hardware, latenza, robustezza visuale, sicurezza e deriva della traiettoria. Saranno proprio questi aspetti, più del numero di parametri del modello, a determinare se i Vision-Language-Action model riusciranno a passare dai laboratori alle vere celle di additive manufacturing.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI).

Di Fantasy

Lascia un commento