Guardare avanti

Physical AI: world models, simulazione e la nuova intelligenza che agisce nel mondo

World models, simulazione e robotica intelligente

Pubblicato il 1 febbraio 20269 minuti di lettura
Physical AI: world models, simulazione e la nuova intelligenza che agisce nel mondo
Physical AIworld modelssimulazioneroboticasim-to-realdigital twin
Questo tema nel libroParte V - Guardare avanti2 capitoli: apri la sintesi e leggi come iniziano

Questa parte guarda chi possiede l’intelligenza artificiale, capitale, dati, chip, energia e acqua, e dove sta andando: dalle proteine alla robotica, dalle armi autonome all’intelligenza artificiale generale, con il metro del capitolo 1, dimostrazione o servizio.

I capitoli di questa parte

  • Capitolo 12 · pagina 181Chi possiede l’intelligenza artificialeIl capitale: algoritmi, brevetti e chi addestra · I dati che nessuno può copiare · Le macchine che il denaro non compra · Chi decide: la somma, lo scaffale, gli Stati · Il conto: energia e acqua

    Un sistema di intelligenza artificiale poggia su tre cose: gli algoritmi, i dati e le macchine. Il capitolo le guarda come si guarda una carta geografica, perché ognuna sta in mani precise e in luoghi precisi, e chi la controlla può decidere di non dartela. Gli algoritmi sono la risorsa più mobile: un’idea passa i confini dentro un articolo scientifico. La Cina registra tre quarti dei brevetti, eppure i modelli davvero nuovi escono soprattutto dagli Stati Uniti, e la ragione non sta nell’ingegno. Addestrare un modello di frontiera costa centinaia di milioni di dollari, e quel capitale si raccoglie in pochi posti al mondo: il primo confine è finanziario. I dati disegnano una mappa diversa. Il testo di qualità sul web è una quantità finita, un bene comune che si sta esaurendo, e quando finisce il vantaggio passa a chi possiede quello che nessun altro può copiare, come gli archivi di un’azienda o le conversazioni di un prodotto usato da milioni di persone. Il dato nasce dove vivono gli utenti, ma il valore si accumula dove ha sede la società che li raccoglie. Con i chip il globale si incaglia nella geografia fisica. Le GPU le vende quasi solo NVIDIA e si fabbricano in pochissimi stabilimenti, primo fra tutti a Taiwan, a cento chilometri dalla costa cinese; sotto ci sono le materie prime, concentrate anch’esse in pochi paesi, e sopra i decreti di due governi. Qui il controllo si esercita in modo secco: un divieto di esportazione fa più di un dazio, perché chiude il mercato a qualunque prezzo si sia disposti a pagare. Le tre mappe non coincidono, e chi comanda su una non comanda sulle altre: è questo che tiene aperta la partita, e la rende dura. Sopra le tre mappe ce n’è una quarta, lo scaffale da cui i modelli si scaricano, e ci sono gli Stati, che hanno cominciato a decidere chi può comprare che cosa. Tutte e tre le risorse, infine, consumano: il conto in energia e acqua, che chiude il capitolo, è il prezzo dei pezzi, e sta diventando il collo di bottiglia della corsa.

    Perché leggerlo: senza sapere chi ha i pezzi non si capisce da che cosa dipende la corsa, e le notizie sui chip, su Taiwan e sulle terre rare si leggono come cronaca invece che come un capitolo di una guerra per il dominio della IA. Si legge tutto in un’ora, e nessun capitolo lo presuppone.

  • Capitolo 13 · pagina 191Dove sta andandoLe biotecnologie: la prova che fa lavoro vero · La robotica: l’IA fuori dallo schermo · Le armi e i conflitti: l’autonomia dove costa di più · Verso l’intelligenza artificiale generale · Quello che nessuno ha ancora deciso

    Fin qui hai visto quasi soltanto modelli di linguaggio. Fuori dal testo l’intelligenza artificiale fa altro, e il capitolo guarda quattro campi in cui sta cambiando le cose più in profondità, messi in fila da quello in cui il risultato è acquisito a quello in cui è ancora una parola. Il primo campo è la biologia. Prevedere la forma di una proteina dalla sua sequenza era un problema aperto da cinquant’anni: AlphaFold lo ha risolto, nel 2024 ha portato il Nobel per la Chimica e nel 2026 un farmaco progettato con questi metodi è entrato nell’ultima fase di sperimentazione. Il secondo è il corpo: l’IA che esce dallo schermo ed entra in macchine che percepiscono, si muovono e lavorano accanto alle persone, dove i dati non sono gratis e le promesse corrono più avanti dei prodotti. Il terzo è la guerra: droni che colpiscono da soli quando il collegamento salta, sistemi che producono liste di bersagli più in fretta di quanto una catena di comando riesca a verificarle, modelli che entrano in una rete e la attraversano da soli. È la frontiera in cui l’autonomia costa di più, e in cui le regole sono più indietro. Il quarto è la parola: l’intelligenza artificiale generale, che i laboratori annunciano, i padri della disciplina discutono e nessuno sa misurare; la strada che ci porta, intanto, è quella degli agenti che hai visto nella Parte II. Per tutti e quattro il metro è lo stesso, ed è quello del capitolo 1: dimostrazione o servizio.

    Perché leggerlo: per leggere gli annunci su queste quattro frontiere senza spaventarti né entusiasmarti a comando, e per riconoscere, in fondo, le scelte che nessuno ha detto ad alta voce e che ti arrivano sul tavolo travestite da scelte tecniche. Nessun capitolo lo presuppone: si può leggere per ultimo, o a pezzi.

Il libro costruisce le basi in modo progressivo; gli articoli approfondiscono e aggiornano i singoli temi man mano che cambiano.

Per anni abbiamo associato l'intelligenza artificiale a schermi, testi, immagini, numeri. Un'AI confinata nel digitale, capace di scrivere, tradurre, riconoscere pattern, ma incapace di toccare il mondo. Oggi questa distinzione sta rapidamente saltando. L'ultima frontiera dell'AI è quella fisica: sistemi intelligenti che percepiscono, decidono e agiscono nello spazio reale. È ciò che viene sempre più spesso chiamato Physical AI.

Non si tratta di robot umanoidi da fantascienza. Anzi, il punto chiave è proprio l'opposto: la rivoluzione non passa dall'imitazione dell'uomo, ma dalla capacità di svolgere compiti concreti in modo adattivo, efficiente e collaborativo. Bracci robotici, veicoli autonomi, droni, sistemi di picking e manipolazione stanno diventando intelligenti non perché "assomigliano" a noi, ma perché imparano - e imparano soprattutto in ambienti simulati, trasferendo poi quelle competenze nel mondo reale.

Dalla macchina deterministica al sistema adattivo

Per decenni i robot industriali sono stati macchine deterministiche. Perfetti nel ripetere lo stesso gesto migliaia di volte, inutili appena cambiava il contesto. Funzionavano secondo regole rigide: se accade X, esegui Y. Questo approccio ha funzionato in ambienti altamente strutturati, come le linee di assemblaggio automobilistiche, ma ha mostrato tutti i suoi limiti appena la complessità aumentava.

La Physical AI segna un cambio di paradigma. I robot non si limitano più a eseguire istruzioni pre-programmate, ma percepiscono l'ambiente, interpretano segnali visivi e tattili, apprendono da dimostrazioni umane, migliorano tramite tentativi ed errori. In altre parole, passano dall'automazione all'autonomia. Questo passaggio e le sue implicazioni industriali sono descritti bene nell'articolo del Financial Times (Colback, 2026).

World models: dare ai robot una rappresentazione del mondo

Se l'obiettivo è permettere a un sistema artificiale di agire nel mondo fisico, il problema centrale non è solo il controllo motorio, ma la comprensione delle dinamiche del mondo. Qui entrano in gioco i cosiddetti world models.

Un world model è una rappresentazione interna che consente al sistema di prevedere cosa accadrà a seguito di una determinata azione. Non si limita a riconoscere un oggetto o a reagire a uno stimolo, ma prova ad anticipare conseguenze: collisioni, attrito, stabilità, deformazioni, vincoli spaziali. In questo senso, i world models sono la base per passare da un comportamento puramente reattivo a uno pianificato.

Negli ultimi anni questa linea di ricerca è diventata centrale perché collega due domini che fino a poco tempo fa erano separati: l'apprendimento su grandi quantità di dati percettivi (immagini e video) e il controllo di sistemi fisici. Un riferimento utile è V-JEPA 2 di Meta (paper su arXiv), un world model basato su video che apprende rappresentazioni predittive del mondo visivo. Vale la pena precisare che V-JEPA 2 nasce come modello per la comprensione video e la sua applicazione diretta al controllo robotico è ancora in fase esplorativa - rappresenta però la direzione verso cui si muove la ricerca.

In parallelo, nella robotica avanzata sta emergendo il concetto di agenti generalisti: sistemi che accumulano esperienza su più robot e più compiti, costruendo una rappresentazione sempre più ampia delle possibilità di interazione fisica. Un esempio molto citato è RoboCat di Google DeepMind, che dimostra come un singolo modello possa apprendere a manipolare oggetti diversi su hardware diversi.

Aggiornamento agosto 2026: modelli aperti e collaborazione tra robot

Nel 2026 questa traiettoria ha fatto un ulteriore passo avanti. NVIDIA ha presentato Cosmos 3 come famiglia aperta di world model per generare dati sintetici, specializzare sistemi di Physical AI e testarli in simulazione prima del rilascio nel mondo reale. L'apertura non è un dettaglio accessorio: consente a imprese e laboratori di adattare i modelli ai propri dati, hardware e ambienti operativi.

Google DeepMind ha inoltre introdotto Gemini Robotics ER 2, che usa flussi video continui per monitorare l'avanzamento di un compito, correggersi quando qualcosa va storto e orchestrare passaggi successivi. La novità più significativa è la collaborazione multi-robot: macchine con forme e capacità diverse possono coordinarsi attraverso una rappresentazione semantica condivisa. I world model stanno quindi diventando non solo simulatori del futuro possibile, ma infrastrutture di coordinamento tra percezione, pianificazione e azione.

Perché la simulazione è diventata decisiva

A differenza dei modelli linguistici, che possono essere addestrati su enormi quantità di dati già disponibili, la Physical AI si scontra con un problema strutturale: i dati fisici non sono gratuiti. Non è possibile lasciare un robot libero di fare milioni di tentativi in una fabbrica o in un magazzino senza costi, rischi e interruzioni operative.

Per questo la simulazione è diventata il terreno di gioco principale. In ambienti virtuali, che rispettano le leggi della fisica, è possibile generare enormi quantità di esperienza, variare sistematicamente le condizioni, esplorare casi limite e addestrare più istanze in parallelo. Il robot impara nel virtuale e poi trasferisce quanto appreso nel mondo reale.

Questo approccio è noto come sim-to-real. Il trasferimento, tuttavia, non è mai perfetto. Esiste sempre un divario tra simulazione e realtà: attriti non modellati con precisione, sensori rumorosi, oggetti imperfetti, illuminazione variabile. Questo cosiddetto reality gap è uno dei principali problemi aperti della robotica moderna. Per una sintesi recente si veda Aljalbout et al., 2025.

Per ridurre questo divario vengono utilizzate tecniche come la domain randomization, che introduce variabilità intenzionale negli ambienti simulati - se il robot impara a funzionare con parametri fisici che variano casualmente, sarà più robusto quando incontra la variabilità del mondo reale. Il riferimento classico è Tobin et al., 2017. Altre strategie includono l'addestramento ibrido che combina dati reali e sintetici, e il fine-tuning sul campo dopo il deployment iniziale.

Simulatori, digital twin e la questione dei dati

Negli ecosistemi industriali più avanzati, la simulazione non è solo uno strumento di addestramento, ma una vera e propria infrastruttura. Simulatori fisici, digital twin e generatori di dati sintetici formano una catena che collega progettazione, test, addestramento e operatività.

Una piattaforma di riferimento in questo ambito è NVIDIA Isaac Sim, pensata per simulare e testare robot in ambienti virtuali fisicamente plausibili e per generare dati sintetici.

Qui emerge una questione strategica che merita attenzione: chi controlla i simulatori e i dataset sintetici avrà un vantaggio competitivo significativo. Per anni questo terreno è stato dominato da piattaforme proprietarie. Un segnale di controtendenza importante è Newton, motore fisico open-source sviluppato congiuntamente da NVIDIA, Google DeepMind e Disney Research e donato alla Linux Foundation (annuncio NVIDIA, annuncio Linux Foundation). La scelta di rendere aperto uno strato così critico dell'infrastruttura robotica suggerisce che i grandi attori vedono valore nella creazione di uno standard condiviso - forse perché la competizione si sta spostando verso i livelli superiori: i modelli, i dati proprietari, l'integrazione verticale.

Una frontiera emergente è l'uso di modelli generativi per costruire ambienti simulativi in modo più rapido e flessibile, riducendo il lavoro manuale di creazione degli scenari.

Limiti strutturali e illusioni da evitare

Prima di passare alle applicazioni, è importante essere chiari sui limiti. I robot intelligenti sono ancora lontani dall'essere generalisti nel senso umano del termine. Faticano con ambienti completamente non strutturati, con compiti ambigui e con l'apprendimento continuo.

Quest'ultimo punto merita una nota. Fenomeni come il catastrophic forgetting - la tendenza dei modelli neurali a dimenticare competenze precedenti quando ne apprendono di nuove - sono particolarmente problematici per la Physical AI. A differenza di un chatbot, un robot opera in ambienti che cambiano continuamente e deve adattarsi senza perdere le capacità già acquisite. È un problema ancora aperto e una delle ragioni per cui i sistemi attuali tendono a essere specializzati piuttosto che universali.

Anche l'idea del robot umanoide universale resta, per ora, più una narrazione che una realtà industriale. Paradossalmente, le soluzioni più efficaci sono spesso quelle meno "umane": bracci semplici, veicoli autonomi specializzati, robot a quattro zampe, forme progettate per il compito e non per l'estetica. La forma umanoide ha senso solo quando l'ambiente è stato progettato per gli umani e non può essere modificato - una condizione meno frequente di quanto si pensi.

Applicazioni concrete e impatto organizzativo

L'evoluzione verso la Physical AI sta già cambiando settori come la logistica, la manifattura, l'agricoltura e la sanità. I robot moderni non operano più solo in ambienti rigidi e completamente automatizzati, ma sempre più spesso lavorano a fianco degli esseri umani, adattandosi a contesti variabili.

Un segnale importante in questa direzione è l'idea di modelli vision-language-action pensati per la robotica, come Gemini Robotics di Google DeepMind. L'obiettivo è creare sistemi che comprendano istruzioni in linguaggio naturale, interpretino la scena visiva e traducano tutto in azioni fisiche appropriate.

Questa trasformazione ha implicazioni profonde per l'organizzazione del lavoro. Il valore non risiede solo nell'acquisto della tecnologia, ma nella capacità di ridisegnare i processi. I compiti umani diventano meno manuali e più orientati alla supervisione, alla manutenzione, alla gestione delle eccezioni.

La Physical AI, in questo senso, non è solo una tecnologia produttiva, ma una tecnologia organizzativa. Richiede nuove competenze, nuove responsabilità e una governance attenta, soprattutto in termini di sicurezza e affidabilità. Un errore software, quando è incorporato in un sistema fisico, ha conseguenze immediate. La certificazione, la tracciabilità delle decisioni e la definizione delle responsabilità in caso di incidenti sono questioni che le organizzazioni dovranno affrontare.

Una nuova fase dell'intelligenza artificiale

La Physical AI rappresenta una nuova fase dell'intelligenza artificiale: quella in cui l'AI smette di essere solo uno strumento cognitivo e diventa una forza operativa nel mondo reale. I world models e l'addestramento in simulazione sono i pilastri di questa transizione, perché permettono di trasformare l'esperienza fisica in qualcosa di apprendibile, scalabile e migliorabile nel tempo.

Se l'AI generativa ha cambiato il modo in cui pensiamo, scriviamo e comunichiamo, la Physical AI cambierà il modo in cui produciamo, costruiamo, muoviamo e curiamo. Non sarà una rivoluzione rumorosa. Ma, come spesso accade, sarà proprio questa integrazione silenziosa a renderla irreversibile.

Riferimenti

Aljalbout, E., Xing, J., Romero, A., Akinola, I., Garrett, C. R., Heiden, E., Gupta, A., Hermans, T., Narang, Y., Fox, D., Scaramuzza, D., & Ramos, F. (2025). The Reality Gap in Robotics: Challenges, Solutions, and Best Practices (arXiv:2510.20808). https://arxiv.org/abs/2510.20808

Assran, M., Bardes, A., Fan, D., Garrido, Q., Howes, R., Komeili, M., Muckley, M., Rizvi, A., Roberts, C., Sinha, K., Zholus, A., … Ballas, N. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv:2506.09985). https://arxiv.org/abs/2506.09985

Bousmalis, K., Vezzani, G., Rao, D., Devin, C., Lee, A. X., Bauza, M., Davchev, T., Zhou, Y., Gupta, A., Raju, A., Laurens, A., Fantacci, C., Dalibard, V., Zambelli, M., Martins, M., Pevceviciute, R., Blokzijl, M., Denil, M., … Heess, N. (2023). RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation (arXiv:2306.11706). https://arxiv.org/abs/2306.11706

Colback, L. (2026, January 20). Physical AI: robotics are poised to revolutionise business. Financial Times. https://www.ft.com/content/3449e77c-721b-4fc9-8082-c584d8f74848

Google DeepMind. (2025, March 12). Gemini Robotics brings AI into the physical world. DeepMind Blog. https://deepmind.google/blog/gemini-robotics-brings-ai-into-the-physical-world/

Linux Foundation. (2025, September 29). Linux Foundation announces contribution of Newton by Disney Research, Google DeepMind and NVIDIA to accelerate open robot learning. https://www.linuxfoundation.org/press/linux-foundation-announces-contribution-of-newton-by-disney-research-google-deepmind-and-nvidia-to-accelerate-open-robot-learning

Meta AI. (2025). V-JEPA 2. https://ai.meta.com/vjepa/

NVIDIA. (n.d.). NVIDIA Isaac Sim. NVIDIA Developer. https://developer.nvidia.com/isaac/sim

NVIDIA. (n.d.). Synthetic Data Generation. Isaac Sim Documentation. https://docs.isaacsim.omniverse.nvidia.com/6.0.0/synthetic_data_generation/index.html

NVIDIA. (2025, March 18). Announcing Newton, an open-source physics engine for robotics simulation. NVIDIA Developer Blog. https://developer.nvidia.com/blog/announcing-newton-an-open-source-physics-engine-for-robotics-simulation/

Tobin, J., Fong, R., Ray, A., Schneider, J., Zaremba, W., & Abbeel, P. (2017). Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (arXiv:1703.06907). https://arxiv.org/abs/1703.06907

Resta aggiornato

Un solo aggiornamento per articoli, eventi e nuove edizioni

Nuovi articoli sull'IA
Nuove edizioni del libro ed eventi