Non passa mese, praticamente non passa settimana senza che il mondo dell’intelligenza artificiale non ci regali qualche novità. A parte le gare su quali modelli vengono rilasciati (e quando il governo americano dà loro il permesso di essere diffusi) ci sono sempre più spesso anche dei cambiamenti strategici nella natura di queste tecnologie.
Questa volta tocca ai world models, che stanno diventando il nuovo campo di battaglia dell’intelligenza artificiale: non più solo chatbot capaci di parlare, ma sistemi che provano a capire lo spazio, il tempo e le conseguenze delle azioni. Da Google DeepMind a Nvidia, fino alle startup più aggressive, la corsa è aperta per costruire macchine in grado di simulare il mondo reale. Secondo gli esperti questa è la prossima grande sfida dell’AI, che potrebbe cambiare per sempre la robotica, l’automotive e l’industria in generale. O almeno, provarci.
Il muro dei modelli linguistici
Il punto di partenza di questa corsa è una presa d’atto scomoda: i grandi modelli linguistici hanno un limite strutturale che nessun incremento di parametri riesce a sanare. Processano il testo con straordinaria fluidità, ma non hanno alcuna rappresentazione interna della fisica, della geometria né delle conseguenze di un’azione nel mondo reale. La discussione, già sollevata con forza dallo studio di Apple sui limiti architetturali dell’AI moderna, mostra che questi sistemi riconoscono pattern senza comprendere davvero lo spazio e il tempo fisico.
È qui che entrano i world model: sistemi progettati per costruire una rappresentazione interna dell’ambiente, in grado di prevedere come cambierà uno scenario, cosa succederà se un agente si muove in un certo modo, e quali forze fisiche governano quella trasformazione.
Non sono generatori di video né motori grafici tridimensionali, ma qualcosa di concettualmente più profondo: simulatori del reale capaci di ragionare su causalità, spazio e sequenze temporali. L’interesse non è puramente accademico, visti i miliardi di dollari che stanno confluendo nel settore da ogni direzione.
La tassonomia e il dibattito architetturale
Il 3 giugno 2026 il team di World Labs guidato da Fei-Fei Li (genio di origine cinese del settore delle intelligenze artificiali) ha pubblicato A Functional Taxonomy of World Models, un framework che suddivide il campo in tre funzioni distinte. I renderer producono output visivi ottimizzati per la percezione umana; i simulatori modellano le transizioni di stato governate dalla fisica; i pianificatori selezionano le azioni per raggiungere obiettivi.
Il lavoro di Fei-Fei Li mira a fare chiarezza su un termine che era stato applicato indistintamente a generatori video, motori fisici e sistemi di controllo robotico, spesso generando più nebbia che comprensione.
In parallelo, Yann LeCun, responsabile dell’AI di Meta, ha sostenuto con forza al World Modeling Workshop del MILA di Montreal e poi all’ETH di Zurigo che i world model devono adottare la Joint Embedding Predictive Architecture (JEPA) anziché gli approcci generativi oggi dominanti. Secondo LeCun, un vero world model non genera pixel ma costruisce rappresentazioni strutturate del mondo che permettono di prevedere stati futuri in modo efficiente, senza dover ricostruire l’intera scena.
La divisione tra la scuola generativa e quella predittiva non generativa è il dibattito tecnico più acceso del momento, e non è ancora chiaro quale approccio prevarrà su scala industriale.
Il diluvio dei capitali
Come si dice, in questi casi, bisogna seguire i soldi. Ovverosia, i finanziamenti: questi raccontano la direzione di sviluppo meglio di qualsiasi manifesto. Overworld, startup di Providence in Rhode Island che sviluppa world model diffusivi compatibili con hardware consumer, ha chiuso a gennaio un pre-seed da 4,5 milioni di dollari guidato da Kindred Ventures; la singaporiana Video Rebirth ha raccolto 80 milioni di dollari con AMD Ventures e Hyundai per costruire un motore AI di livello industriale per la generazione di ambienti video.
Ancora, PhysicsX ha chiuso l’8 giugno un round Series C da 300 milioni di dollari a una valutazione di 2,4 miliardi, con il sostegno di Temasek, Nvidia e Siemens, mentre all’ICLR 2026 di aprile il secondo Workshop sui World Model ha riunito ricercatori impegnati a unificare modellazione generativa, processo decisionale e ragionamento causale in sistemi scalabili.
I big: Nvidia costruisce Cosmos, Google simula il mondo
Nvidia ha rilasciato a inizio giugno Cosmos 3, terza versione del suo modello fondazionale omnimodale per l’AI fisica, con un’architettura che combina un transformer autoregressivo per ragionamento e pianificazione con uno diffusivo per la generazione video fisicamente accurata. Come già emerso nell’analisi del keynote di Jensen Huang al Computex 2026, il modello può funzionare come sistema di visione artificiale, come generatore di dati sintetici per robot e veicoli autonomi, e come simulatore per la valutazione delle policy di controllo.
Il problema che Cosmos vuole risolvere è strutturale: quasi tutto il materiale video disponibile nel mondo è in terza persona, mentre addestrare robot fisici richiede dati in prima persona, e colmare questo divario esige la capacità di produrre scenari fisicamente coerenti in quantità industriale.
L’interesse di Nvidia per la simulazione del mondo fisico non è di ieri: già al CES 2025 di Las Vegas Huang aveva presentato la prima versione di Cosmos come una piattaforma capace di creare ambienti virtuali che ricostruiscono fedelmente il comportamento del mondo reale, con applicazioni che spaziano dalla guida autonoma alla robotica industriale.
Google DeepMind punta invece su Genie 3, presentato come il primo world model interattivo in tempo reale capace di generare ambienti fotorealistici da descrizioni testuali, con coerenza delle scene garantita dalla memoria degli stati precedenti, a una risoluzione di 720p e circa venti fotogrammi al secondo.
La piattaforma Project Genie, costruita su Genie 3, è già disponibile per sviluppatori e ricercatori negli Stati Uniti e permette di generare percorsi interattivi che simulano la fisica degli elementi visibili in tempo reale, aprendo scenari concreti per il training di agenti generalisti.
Le applicazioni, i limiti e la posta in gioco
Con Gemini Robotics, Google DeepMind ha già dimostrato come un world model possa abilitare robot generalisti capaci di adattarsi a situazioni non previste durante l’addestramento, compiere operazioni di destrezza fine e interagire con ambienti inediti senza riallineare il sistema da capo.
Le applicazioni più immediate riguardano tutta la filiera dell’intelligenza fisica: robotica, guida autonoma, simulazione industriale, produzione di dati sintetici, testing di scenari pericolosi o rari senza esporre persone e macchine a rischio reale.
Nvidia ha dichiarato esplicitamente che i suoi World Foundation Model puntano a generare dati fisici scalabili per accelerare lo sviluppo di AI fisica, in linea con la traiettoria già indicata nell’era della robotica generalista e degli umanoidi, che Jensen Huang considera il prossimo mercato esplosivo da mille miliardi di dollari.
I limiti, tuttavia, esistono e sarebbe imprudente ignorarli: Genie 3 non simula il mondo con precisione fisica perfetta, l’interazione continua regge solo per pochi minuti, e il testo generato all’interno delle scene può risultare incoerente. Come evidenzia il campo degli agenti AI che operano in loop autonomi, la robustezza dei sistemi che devono agire nel mondo reale richiede un livello di affidabilità che i modelli odierni non hanno ancora raggiunto, e i world model non fanno eccezione.
La comunità scientifica non ha ancora una tassonomia condivisa, LeCun insiste che confondere world model con generatori video sia un errore concettuale capace di sviare anni di ricerca, e la domanda su quale architettura prevarrà resta aperta su tutti i fronti: chi la risolverà controllerà la piattaforma su cui si costruirà l’AI incarnata del prossimo decennio.
Tutte le notizie e gli approfondimenti sull’intelligenza artificiale sono disponibili nella sezione dedicata di macitynet.












