Per anni abbiamo associato l'intelligenza artificiale a schermi, testi, immagini, numeri. Un'AI confinata nel digitale, capace di scrivere, tradurre, riconoscere pattern, ma incapace di toccare il mondo. Oggi questa distinzione sta rapidamente saltando. L'ultima frontiera dell'AI è quella fisica: sistemi intelligenti che percepiscono, decidono e agiscono nello spazio reale. È ciò che viene sempre più spesso chiamato Physical AI.
Non si tratta di robot umanoidi da fantascienza. Anzi, il punto chiave è proprio l'opposto: la rivoluzione non passa dall'imitazione dell'uomo, ma dalla capacità di svolgere compiti concreti in modo adattivo, efficiente e collaborativo. Bracci robotici, veicoli autonomi, droni, sistemi di picking e manipolazione stanno diventando intelligenti non perché "assomigliano" a noi, ma perché imparano - e imparano soprattutto in ambienti simulati, trasferendo poi quelle competenze nel mondo reale.
Dalla macchina deterministica al sistema adattivo
Per decenni i robot industriali sono stati macchine deterministiche. Perfetti nel ripetere lo stesso gesto migliaia di volte, inutili appena cambiava il contesto. Funzionavano secondo regole rigide: se accade X, esegui Y. Questo approccio ha funzionato in ambienti altamente strutturati, come le linee di assemblaggio automobilistiche, ma ha mostrato tutti i suoi limiti appena la complessità aumentava.
La Physical AI segna un cambio di paradigma. I robot non si limitano più a eseguire istruzioni pre-programmate, ma percepiscono l'ambiente, interpretano segnali visivi e tattili, apprendono da dimostrazioni umane, migliorano tramite tentativi ed errori. In altre parole, passano dall'automazione all'autonomia. Questo passaggio e le sue implicazioni industriali sono descritti bene nell'articolo del Financial Times (Colback, 2026).
World models: dare ai robot una rappresentazione del mondo
Se l'obiettivo è permettere a un sistema artificiale di agire nel mondo fisico, il problema centrale non è solo il controllo motorio, ma la comprensione delle dinamiche del mondo. Qui entrano in gioco i cosiddetti world models.
Un world model è una rappresentazione interna che consente al sistema di prevedere cosa accadrà a seguito di una determinata azione. Non si limita a riconoscere un oggetto o a reagire a uno stimolo, ma prova ad anticipare conseguenze: collisioni, attrito, stabilità, deformazioni, vincoli spaziali. In questo senso, i world models sono la base per passare da un comportamento puramente reattivo a uno pianificato.
Negli ultimi anni questa linea di ricerca è diventata centrale perché collega due domini che fino a poco tempo fa erano separati: l'apprendimento su grandi quantità di dati percettivi (immagini e video) e il controllo di sistemi fisici. Un riferimento utile è V-JEPA 2 di Meta (paper su arXiv), un world model basato su video che apprende rappresentazioni predittive del mondo visivo. Vale la pena precisare che V-JEPA 2 nasce come modello per la comprensione video e la sua applicazione diretta al controllo robotico è ancora in fase esplorativa - rappresenta però la direzione verso cui si muove la ricerca.
In parallelo, nella robotica avanzata sta emergendo il concetto di agenti generalisti: sistemi che accumulano esperienza su più robot e più compiti, costruendo una rappresentazione sempre più ampia delle possibilità di interazione fisica. Un esempio molto citato è RoboCat di Google DeepMind, che dimostra come un singolo modello possa apprendere a manipolare oggetti diversi su hardware diversi.
Aggiornamento agosto 2026: modelli aperti e collaborazione tra robot
Nel 2026 questa traiettoria ha fatto un ulteriore passo avanti. NVIDIA ha presentato Cosmos 3 come famiglia aperta di world model per generare dati sintetici, specializzare sistemi di Physical AI e testarli in simulazione prima del rilascio nel mondo reale. L'apertura non è un dettaglio accessorio: consente a imprese e laboratori di adattare i modelli ai propri dati, hardware e ambienti operativi.
Google DeepMind ha inoltre introdotto Gemini Robotics ER 2, che usa flussi video continui per monitorare l'avanzamento di un compito, correggersi quando qualcosa va storto e orchestrare passaggi successivi. La novità più significativa è la collaborazione multi-robot: macchine con forme e capacità diverse possono coordinarsi attraverso una rappresentazione semantica condivisa. I world model stanno quindi diventando non solo simulatori del futuro possibile, ma infrastrutture di coordinamento tra percezione, pianificazione e azione.
Perché la simulazione è diventata decisiva
A differenza dei modelli linguistici, che possono essere addestrati su enormi quantità di dati già disponibili, la Physical AI si scontra con un problema strutturale: i dati fisici non sono gratuiti. Non è possibile lasciare un robot libero di fare milioni di tentativi in una fabbrica o in un magazzino senza costi, rischi e interruzioni operative.
Per questo la simulazione è diventata il terreno di gioco principale. In ambienti virtuali, che rispettano le leggi della fisica, è possibile generare enormi quantità di esperienza, variare sistematicamente le condizioni, esplorare casi limite e addestrare più istanze in parallelo. Il robot impara nel virtuale e poi trasferisce quanto appreso nel mondo reale.
Questo approccio è noto come sim-to-real. Il trasferimento, tuttavia, non è mai perfetto. Esiste sempre un divario tra simulazione e realtà: attriti non modellati con precisione, sensori rumorosi, oggetti imperfetti, illuminazione variabile. Questo cosiddetto reality gap è uno dei principali problemi aperti della robotica moderna. Per una sintesi recente si veda Aljalbout et al., 2025.
Per ridurre questo divario vengono utilizzate tecniche come la domain randomization, che introduce variabilità intenzionale negli ambienti simulati - se il robot impara a funzionare con parametri fisici che variano casualmente, sarà più robusto quando incontra la variabilità del mondo reale. Il riferimento classico è Tobin et al., 2017. Altre strategie includono l'addestramento ibrido che combina dati reali e sintetici, e il fine-tuning sul campo dopo il deployment iniziale.
Simulatori, digital twin e la questione dei dati
Negli ecosistemi industriali più avanzati, la simulazione non è solo uno strumento di addestramento, ma una vera e propria infrastruttura. Simulatori fisici, digital twin e generatori di dati sintetici formano una catena che collega progettazione, test, addestramento e operatività.
Una piattaforma di riferimento in questo ambito è NVIDIA Isaac Sim, pensata per simulare e testare robot in ambienti virtuali fisicamente plausibili e per generare dati sintetici.
Qui emerge una questione strategica che merita attenzione: chi controlla i simulatori e i dataset sintetici avrà un vantaggio competitivo significativo. Per anni questo terreno è stato dominato da piattaforme proprietarie. Un segnale di controtendenza importante è Newton, motore fisico open-source sviluppato congiuntamente da NVIDIA, Google DeepMind e Disney Research e donato alla Linux Foundation (annuncio NVIDIA, annuncio Linux Foundation). La scelta di rendere aperto uno strato così critico dell'infrastruttura robotica suggerisce che i grandi attori vedono valore nella creazione di uno standard condiviso - forse perché la competizione si sta spostando verso i livelli superiori: i modelli, i dati proprietari, l'integrazione verticale.
Una frontiera emergente è l'uso di modelli generativi per costruire ambienti simulativi in modo più rapido e flessibile, riducendo il lavoro manuale di creazione degli scenari.
Limiti strutturali e illusioni da evitare
Prima di passare alle applicazioni, è importante essere chiari sui limiti. I robot intelligenti sono ancora lontani dall'essere generalisti nel senso umano del termine. Faticano con ambienti completamente non strutturati, con compiti ambigui e con l'apprendimento continuo.
Quest'ultimo punto merita una nota. Fenomeni come il catastrophic forgetting - la tendenza dei modelli neurali a dimenticare competenze precedenti quando ne apprendono di nuove - sono particolarmente problematici per la Physical AI. A differenza di un chatbot, un robot opera in ambienti che cambiano continuamente e deve adattarsi senza perdere le capacità già acquisite. È un problema ancora aperto e una delle ragioni per cui i sistemi attuali tendono a essere specializzati piuttosto che universali.
Anche l'idea del robot umanoide universale resta, per ora, più una narrazione che una realtà industriale. Paradossalmente, le soluzioni più efficaci sono spesso quelle meno "umane": bracci semplici, veicoli autonomi specializzati, robot a quattro zampe, forme progettate per il compito e non per l'estetica. La forma umanoide ha senso solo quando l'ambiente è stato progettato per gli umani e non può essere modificato - una condizione meno frequente di quanto si pensi.
Applicazioni concrete e impatto organizzativo
L'evoluzione verso la Physical AI sta già cambiando settori come la logistica, la manifattura, l'agricoltura e la sanità. I robot moderni non operano più solo in ambienti rigidi e completamente automatizzati, ma sempre più spesso lavorano a fianco degli esseri umani, adattandosi a contesti variabili.
Un segnale importante in questa direzione è l'idea di modelli vision-language-action pensati per la robotica, come Gemini Robotics di Google DeepMind. L'obiettivo è creare sistemi che comprendano istruzioni in linguaggio naturale, interpretino la scena visiva e traducano tutto in azioni fisiche appropriate.
Questa trasformazione ha implicazioni profonde per l'organizzazione del lavoro. Il valore non risiede solo nell'acquisto della tecnologia, ma nella capacità di ridisegnare i processi. I compiti umani diventano meno manuali e più orientati alla supervisione, alla manutenzione, alla gestione delle eccezioni.
La Physical AI, in questo senso, non è solo una tecnologia produttiva, ma una tecnologia organizzativa. Richiede nuove competenze, nuove responsabilità e una governance attenta, soprattutto in termini di sicurezza e affidabilità. Un errore software, quando è incorporato in un sistema fisico, ha conseguenze immediate. La certificazione, la tracciabilità delle decisioni e la definizione delle responsabilità in caso di incidenti sono questioni che le organizzazioni dovranno affrontare.
Una nuova fase dell'intelligenza artificiale
La Physical AI rappresenta una nuova fase dell'intelligenza artificiale: quella in cui l'AI smette di essere solo uno strumento cognitivo e diventa una forza operativa nel mondo reale. I world models e l'addestramento in simulazione sono i pilastri di questa transizione, perché permettono di trasformare l'esperienza fisica in qualcosa di apprendibile, scalabile e migliorabile nel tempo.
Se l'AI generativa ha cambiato il modo in cui pensiamo, scriviamo e comunichiamo, la Physical AI cambierà il modo in cui produciamo, costruiamo, muoviamo e curiamo. Non sarà una rivoluzione rumorosa. Ma, come spesso accade, sarà proprio questa integrazione silenziosa a renderla irreversibile.
Riferimenti
Aljalbout, E., Xing, J., Romero, A., Akinola, I., Garrett, C. R., Heiden, E., Gupta, A., Hermans, T., Narang, Y., Fox, D., Scaramuzza, D., & Ramos, F. (2025). The Reality Gap in Robotics: Challenges, Solutions, and Best Practices (arXiv:2510.20808). https://arxiv.org/abs/2510.20808
Assran, M., Bardes, A., Fan, D., Garrido, Q., Howes, R., Komeili, M., Muckley, M., Rizvi, A., Roberts, C., Sinha, K., Zholus, A., … Ballas, N. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv:2506.09985). https://arxiv.org/abs/2506.09985
Bousmalis, K., Vezzani, G., Rao, D., Devin, C., Lee, A. X., Bauza, M., Davchev, T., Zhou, Y., Gupta, A., Raju, A., Laurens, A., Fantacci, C., Dalibard, V., Zambelli, M., Martins, M., Pevceviciute, R., Blokzijl, M., Denil, M., … Heess, N. (2023). RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation (arXiv:2306.11706). https://arxiv.org/abs/2306.11706
Colback, L. (2026, January 20). Physical AI: robotics are poised to revolutionise business. Financial Times. https://www.ft.com/content/3449e77c-721b-4fc9-8082-c584d8f74848
Google DeepMind. (2025, March 12). Gemini Robotics brings AI into the physical world. DeepMind Blog. https://deepmind.google/blog/gemini-robotics-brings-ai-into-the-physical-world/
Linux Foundation. (2025, September 29). Linux Foundation announces contribution of Newton by Disney Research, Google DeepMind and NVIDIA to accelerate open robot learning. https://www.linuxfoundation.org/press/linux-foundation-announces-contribution-of-newton-by-disney-research-google-deepmind-and-nvidia-to-accelerate-open-robot-learning
Meta AI. (2025). V-JEPA 2. https://ai.meta.com/vjepa/
NVIDIA. (n.d.). NVIDIA Isaac Sim. NVIDIA Developer. https://developer.nvidia.com/isaac/sim
NVIDIA. (n.d.). Synthetic Data Generation. Isaac Sim Documentation. https://docs.isaacsim.omniverse.nvidia.com/6.0.0/synthetic_data_generation/index.html
NVIDIA. (2025, March 18). Announcing Newton, an open-source physics engine for robotics simulation. NVIDIA Developer Blog. https://developer.nvidia.com/blog/announcing-newton-an-open-source-physics-engine-for-robotics-simulation/
Tobin, J., Fong, R., Ray, A., Schneider, J., Zaremba, W., & Abbeel, P. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (arXiv:1703.06907). https://arxiv.org/abs/1703.06907
