Questo sito contiene link di affiliazione per cui può essere compensato

Home » Tutorial e FAQ » Mac Studio M5 Ultra e AI: cosa significano 70B, 405B, 1T e RDMA

Mac Studio M5 Ultra e AI: cosa significano 70B, 405B, 1T e RDMA

Quanto è grande davvero un modello AI da 405 miliardi di parametri? E cosa cambia quando un Mac Studio può mettere a disposizione 256 o 512 GB di memoria unificata e collegarsi ad altri Mac via Thunderbolt 5?

Abbiamo tradotto 70B, 405B, 1T, Q4 e token al secondo in esempi concreti, arrivando fino a una biblioteca immaginaria composta da oltre un milione di volumi dell’Encyclopédie di Diderot.

Con Mac Studio M5 Ultra Apple spinge il proprio desktop professionale in una direzione sempre più esplicitamente legata all’intelligenza artificiale eseguita in locale. Il chip arriva fino a una CPU 36-core e una GPU 80-core, ma per questo particolare tipo di applicazione due numeri sono probabilmente ancora più interessanti: fino a 512 GB di memoria unificata e 1,2 TB/s di banda della memoria.

C’è poi una novità meno immediata, ma potenzialmente ancora più importante. Più Mac Studio possono essere collegati fra loro tramite Thunderbolt 5 utilizzando RDMA, Remote Direct Memory Access, per distribuire fra più computer modelli che non potrebbero essere caricati nella memoria di una singola macchina. Apple dichiara che un cluster composto da quattro Mac Studio può arrivare fino a tre volte le prestazioni di inferenza AI di un singolo sistema.

Per capire perché tutto questo sia importante bisogna però decifrare alcune sigle che compaiono ormai continuamente quando si parla di AI locale: 70B, 123B, 235B, 405B, 671B, 1T, Q4, MoE e tok/s.

Prima di iniziare potete consultare il nostro approfondimento su perché Apple Silicon è particolarmente adatto all’AI locale, con il confronto tra Mac mini, Mac Studio, MacBook Pro e le principali generazioni di chip Apple.

Per orientarsi fra le macchine più compatte abbiamo anche messo a confronto Mac mini M6, M5 Pro e M4 Pro, mentre un articolo separato ricostruisce prezzi, memoria e configurazioni dei nuovi Mac mini. Per capire invece come cambia la struttura dei processori, trovate il nostro approfondimento su M6 a 2 nanometri e M5 Ultra quad-die.

Cosa significano 70B, 405B e 1T

La lettera B significa billion, cioè miliardo. Un modello 70B possiede quindi circa 70 miliardi di parametri; un modello 405B ne possiede circa 405 miliardi.

La T deriva invece da trillion nella numerazione anglosassone: 1T equivale a mille miliardi di parametri.

Un parametro è essenzialmente un valore numerico che viene regolato durante l’addestramento della rete neurale. Preso singolarmente non corrisponde a una parola, a un’immagine o a un’informazione precisa: è l’interazione di miliardi di questi valori a permettere al modello di riconoscere strutture linguistiche, relazioni fra concetti, schemi logici e associazioni apprese durante l’addestramento.

Mac Studio M5 Ultra e AI: cosa significano 70B, 405B, 1T e RDMA - macitynet.it
I volumi di una Enciclopedia di Diderot completa

Quanto sono 70 miliardi di parametri? Una biblioteca di tante Encyclopédie

Decine o centinaia di miliardi di parametri restano comunque numeri difficili da visualizzare. Un parametro, è bene precisarlo subito, non equivale a una parola, a un fatto conosciuto dal modello o a una pagina di enciclopedia: è uno dei moltissimi coefficienti numerici regolati durante l’addestramento della rete neurale.

Possiamo però utilizzare un paragone puramente illustrativo per comprendere la scala dei numeri. Immaginiamo per un momento che ogni parametro corrisponda a una parola stampata e prendiamo come riferimento una delle più famose raccolte organizzate del sapere umano: l’Encyclopédie di Diderot e d’Alembert.

Una Encyclopédie significava 28 grandi volumi in-folio

L’edizione originale dell’Encyclopédie ou Dictionnaire raisonné des sciences, des arts et des métiers, pubblicata sotto la direzione di Diderot e d’Alembert fra il 1751 e il 1772, comprende 28 volumi in-folio: 17 volumi di testo e 11 volumi di tavole illustrate.

Il termine in-folio descrive anche il formato fisico del volume. Il grande foglio di stampa veniva piegato una sola volta, ottenendo due fogli e quattro pagine: si trattava quindi di libri di notevoli dimensioni, molto più ingombranti di un normale volume moderno. L’opera completa occupava fisicamente una consistente sezione di una libreria.

In seguito furono pubblicati quattro volumi supplementari di testo, un volume supplementare di tavole e due volumi di indici. Per questo alcune raccolte complete vengono indicate come composte da 35 volumi. Nel nostro confronto utilizzeremo però sempre i 28 volumi dell’edizione originale, per mantenere un riferimento uniforme.

La versione digitalizzata dall’ARTFL dell’Università di Chicago contiene circa 21,7 milioni di parole, oltre 74.000 articoli e circa 18.000 pagine di testo. Possiamo quindi utilizzarla come una sorta di unità di misura immaginaria della nostra biblioteca.

Da 70B a 1T: da 90.000 a quasi 1,3 milioni di volumi

Se facessimo corrispondere, soltanto per visualizzare la scala, un parametro a una parola, i 70 miliardi di parametri di Llama 3.1 70B sarebbero numericamente equivalenti a più di 3.200 Encyclopédie complete.

Poiché ogni Encyclopédie comprende 28 grandi tomi, possiamo immaginare una biblioteca costituita da circa 90.000 volumi in-folio.

Con Llama 405B saliremmo a oltre 18.600 Encyclopédie, vale a dire più di 520.000 grandi volumi. Kimi K2 con 1T, mille miliardi di parametri, porterebbe l’esperimento mentale a circa 46.000 Encyclopédie complete, quasi 1,3 milioni di volumi in-folio.

Da 70B a 1T: parametri, Encyclopédie ed esempi reali
Classe Parametri Equivalente numerico in Encyclopédie 28 volumi per Encyclopédie Esempio reale
70B 70 miliardi circa 3.200 copie circa 90.000 volumi in-folio Llama 3.1 70B
123B 123 miliardi circa 5.700 copie circa 159.000 volumi in-folio Mistral Large 2
235B 235 miliardi circa 10.800 copie circa 303.000 volumi in-folio Qwen3-235B-A22B
405B 405 miliardi circa 18.700 copie circa 523.000 volumi in-folio Llama 3.1 405B
671B 671 miliardi circa 30.900 copie circa 866.000 volumi in-folio DeepSeek-V3
1T 1.000 miliardi circa 46.000 copie circa 1.290.000 volumi in-folio Kimi K2

Il salto dimensionale diventa così più intuitivo. Un 70B può essere immaginato come una biblioteca da circa 90.000 grandi volumi; un 405B supera il mezzo milione di volumi; un modello da 1T arriva vicino a 1,3 milioni di tomi.

Naturalmente questa biblioteca non rappresenta la quantità di conoscenza posseduta dal modello. Llama 405B non contiene realmente 18.700 copie dell’Encyclopédie e Kimi K2 non ha memorizzato 1,3 milioni di libri. Un libro conserva informazioni sotto forma di parole leggibili; un parametro è soltanto un coefficiente numerico. La capacità del modello emerge dalle relazioni fra miliardi di questi coefficienti.

Il paragone torna però molto concreto quando si parla di memoria del computer: tutti quei parametri devono essere rappresentati numericamente e conservati da qualche parte. È qui che entrano in gioco la quantizzazione Q4 e i 256 o 512 GB di memoria unificata del Mac Studio M5 Ultra.

Più parametri non significa automaticamente una AI migliore

Il numero di parametri dà un’indicazione della dimensione del modello, non rappresenta da solo una classifica della sua intelligenza. Un modello moderno più piccolo, addestrato meglio e con un’architettura più efficiente, può superare un modello precedente molto più grande.

Qualità dei dati, procedure di addestramento e post-training, capacità di ragionamento, architettura e specializzazione pesano quindi almeno quanto il semplice numero di parametri.

Quel numero rimane però fondamentale quando dobbiamo rispondere a una domanda molto pratica: il modello entra nella memoria del nostro Mac?

Dense e MoE: due modelli da 600 miliardi possono comportarsi in modo molto diverso

C’è un’altra distinzione fondamentale. Alcuni modelli sono definiti dense, altri utilizzano un’architettura MoE, Mixture of Experts.

Llama 3.1 405B è un buon esempio di modello dense: i suoi 405 miliardi di parametri fanno parte della grande rete utilizzata durante l’inferenza.

Qwen3-235B-A22B, DeepSeek-V3 e Kimi K2 utilizzano invece un sistema Mixture of Experts. Possiamo immaginarli come una grande struttura piena di specialisti: tutti devono essere presenti nell’edificio, ma per rispondere a una particolare domanda vengono chiamati al lavoro soltanto alcuni di loro.

Dense e MoE: parametri totali e parametri attivati
Modello Parametri totali Parametri attivati per token Architettura Cosa significa in pratica
Llama 3.1 70B 70B Modello dense Dense Modello relativamente compatto ma già molto potente per chat, testi, analisi e programmazione
Mistral Large 2 123B Modello dense Dense Grande modello general purpose progettato anche per inferenza su singolo nodo
Qwen3-235B-A22B 235B 22B MoE Dispone di 128 expert e ne seleziona 8 per token
Llama 3.1 405B 405B Modello dense Dense Un modello enorme che utilizza l’intera rete durante l’inferenza
DeepSeek-V3 671B 37B MoE La memoria deve contenere centinaia di miliardi di parametri, ma per ogni token ne viene attivata solo una frazione
Kimi K2 1T 32B MoE 384 expert complessivi, 8 selezionati per token più un expert condiviso

Questo spiega una sigla apparentemente complicata come Qwen3-235B-A22B: 235B indica i parametri complessivi mentre A22B segnala che circa 22 miliardi vengono attivati durante l’elaborazione di ciascun token.

Nel caso di DeepSeek-V3 il modello contiene 671 miliardi di parametri, ma ne attiva circa 37 miliardi per token. Kimi K2 arriva addirittura a mille miliardi di parametri complessivi, mentre la parte attiva per ciascun token è nell’ordine dei 32 miliardi.

Questo riduce enormemente la quantità di calcolo necessaria rispetto a un ipotetico modello dense della stessa dimensione, ma non elimina il problema della memoria: gli expert che potrebbero essere chiamati devono comunque essere disponibili da qualche parte.

Q4: come centinaia di miliardi di parametri diventano centinaia di GB

I parametri sono numeri. Memorizzarli con una precisione elevata richiede molti byte e un modello molto grande potrebbe occupare una quantità proibitiva di memoria.

Per l’inferenza locale si ricorre quindi spesso alla quantizzazione, cioè alla rappresentazione dei pesi utilizzando un numero inferiore di bit.

Quando si incontra la sigla Q4 o 4-bit, significa in termini generali che gran parte dei pesi viene rappresentata con circa quattro bit. Il calcolo elementare suggerirebbe mezzo byte per parametro: 70 miliardi di parametri diventerebbero circa 35 GB e 405 miliardi circa 203 GB.

Nella realtà i file sono più grandi perché sono necessari scale, metadati e altri valori e perché non tutti i componenti vengono necessariamente memorizzati con la stessa precisione.

I file realmente disponibili nella comunità MLX danno quindi un’idea più utile del semplice calcolo teorico.

Quanto occupano davvero i modelli AI quantizzati a 4 bit
Modello Parametri complessivi Dimensione teorica a 4 bit Esempio MLX 4-bit reale
Llama 3.1 70B 70B ~35 GB ~39,7 GB
Qwen3-235B-A22B 235B ~118 GB ~132 GB
Llama 3.1 405B 405B ~203 GB ~231 GB
DeepSeek-V3 671B ~336 GB ~378 GB
Kimi K2 1T ~500 GB ~578 GB

Questa tabella è particolarmente utile per comprendere i 256 e i 512 GB del Mac Studio. Bisogna inoltre ricordare che non possiamo occupare tutta la memoria con il file del modello: servono spazio per macOS, runtime MLX o altri programmi, cache KV e contesto della conversazione.

Un modello da 231 GB su un computer con 256 GB di memoria è quindi tecnicamente molto diverso da un modello da 132 GB sulla stessa macchina, anche se entrambi risultano formalmente inferiori ai 256 GB disponibili.

Cosa significa 25-35 tok/s

L’altra sigla che accompagna quasi tutti i benchmark dei modelli linguistici è tok/s, abbreviazione di tokens per second, token al secondo.

Un token è l’unità con cui il modello divide internamente il testo. Non corrisponde necessariamente a una parola: può essere una parola intera, una parte di parola, un numero, un segno di punteggiatura o un altro frammento. Il risultato cambia inoltre con il tokenizer utilizzato e con la lingua.

Per questo 30 token al secondo non significano esattamente 30 parole al secondo. In un testo italiano possiamo considerare, soltanto come ordine di grandezza, 25-35 tok/s come qualcosa nell’area di circa 15-25 parole generate ogni secondo.

Token al secondo: come cambia la percezione della velocità
Velocità di generazione Percezione nell’uso quotidiano
2-3 tok/s La risposta si costruisce lentamente e l’attesa è evidente
5-10 tok/s Utilizzabile in chat, ma si continua ad aspettare il completamento
15-20 tok/s La conversazione appare già piuttosto fluida
25-35 tok/s Il modello scrive molto più rapidamente della normale velocità di lettura umana
50+ tok/s Per un singolo utilizzatore la generazione del testo tende a diventare quasi istantanea rispetto alla lettura

Una persona parla normalmente soltanto poche parole al secondo e legge alcune parole al secondo. Una AI capace di produrre una ventina di parole al secondo sta quindi già generando testo molto più rapidamente di quanto il lettore riesca normalmente a seguirlo.

Una risposta di 300 parole, per esempio, potrebbe essere completata nell’ordine di alcune decine di secondi anche senza raggiungere velocità particolarmente elevate.

Prefill e generazione: il modello prima legge e poi scrive

C’è però un altro valore che rischia di essere confuso con i token al secondo prodotti durante la risposta.

Quando forniamo al modello un documento, un lungo prompt o magari centinaia di pagine di sorgenti software, la AI deve prima elaborare tutto il materiale ricevuto. Questa fase è normalmente chiamata prefill o prompt processing.

Solo dopo inizia la generazione autoregressiva della risposta, misurata in token al secondo.

Apple dichiara per Mac Studio M5 Ultra un prompt processing in LM Studio fino a quattro volte più rapido rispetto a M3 Ultra. Questo non significa che un modello che generava 10 tok/s ne genererà automaticamente 40: Apple sta misurando un’altra parte del processo.

La differenza è comunque concreta. Nell’analisi di un PDF da centinaia di pagine, di un grande progetto software o di un archivio utilizzato per RAG, ridurre il tempo necessario a elaborare il contesto può fare iniziare la risposta molto prima.

Perché 1,2 TB/s di banda della memoria sono così importanti

Durante la generazione, un grande LLM deve continuamente recuperare enormi quantità di pesi dalla memoria. Di conseguenza la velocità alla quale CPU e soprattutto GPU possono raggiungere la memoria diventa determinante.

M5 Ultra porta questa banda fino a 1,2 TB/s, il 50% in più rispetto alla generazione precedente secondo Apple. A questo si aggiungono i Neural Accelerator integrati nei core GPU.

È anche per questo che non conviene tradurre direttamente il numero dei core GPU o un valore generico di potenza AI nei token al secondo: a seconda del modello può essere il calcolo a costituire il collo di bottiglia oppure possono diventarlo memoria, cache, sincronizzazione e trasferimento dei pesi.

Nel frattempo sono arrivati anche i primi riscontri indipendenti sulle prestazioni generali del processore: M5 Ultra ha superato quota 52.000 punti nel multi-core di Geekbench 7 nella configurazione a 36 core. È però un test CPU e non misura direttamente la velocità di generazione degli LLM. Per attribuire con rigore valori come 25, 35 o 50 tok/s ai diversi modelli servono benchmark specifici e ripetibili sul nuovo Mac Studio. Questi numeri vanno quindi letti come unità di misura della velocità percepita, non come valori già verificati per ogni modello AI.

512 GB annunciati, ma oggi in Italia il massimo acquistabile è 256 GB

A questo punto bisogna introdurre una distinzione essenziale fra le capacità del nuovo M5 Ultra e le configurazioni acquistabili nella prima fase commerciale.

Apple ha annunciato Mac Studio M5 Ultra con fino a 512 GB di memoria unificata, ma ha precisato che la configurazione da 512 GB arriverà soltanto a fine ottobre.

Al momento del lancio, nel configuratore italiano il massimo acquistabile è quindi 256 GB di memoria unificata per macchina. È utile tenere completamente separati i due scenari, perché cambiano parecchio i modelli che possono essere caricati su uno, due o quattro Mac Studio.

Scenario 1: Mac Studio M5 Ultra con 512 GB

Partiamo dalla configurazione più interessante annunciata da Apple, quella da 512 GB, anche se sarà disponibile solo in seguito.

Con mezzo terabyte di memoria locale un singolo Mac Studio può ospitare comodamente Llama 70B, Qwen3-235B e Llama 405B in 4 bit. Diventa inoltre realistico caricare su una sola macchina anche un modello della classe di DeepSeek-V3, la cui conversione MLX 4-bit presa come riferimento occupa circa 378 GB.

Kimi K2 1T, invece, raggiunge circa 578 GB nella versione MLX 4-bit utilizzata per questo confronto: non entra in 512 GB neppure prima di considerare memoria del sistema e cache.

Mac Studio M5 Ultra da 512 GB: uno, due o quattro nodi
Configurazione futura da 512 GB Memoria complessiva Esempi pratici Valutazione
1 × M5 Ultra 512 GB 512 GB locali Llama 70B, Qwen3-235B, Llama 405B, DeepSeek-V3 4-bit Il vantaggio maggiore è mantenere tutto il modello nella memoria locale a 1,2 TB/s
2 × M5 Ultra 512 GB 1.024 GB distribuiti Kimi K2 1T 4-bit e modelli della stessa classe La soglia del trilione di parametri diventa molto più gestibile
4 × M5 Ultra 512 GB 2.048 GB distribuiti Modelli enormi, quantizzazioni meno aggressive, più cache o più workload simultanei Massima capacità, ma con comunicazione fra quattro nodi

In questa configurazione il passaggio più significativo è probabilmente quello fra una e due macchine. Con un solo M5 Ultra da 512 GB DeepSeek-V3 può rimanere completamente locale; con due macchine si supera il terabyte complessivo e diventa possibile distribuire Kimi K2 senza lavorare sul limite assoluto della memoria.

Quattro Mac da 512 GB porterebbero il pool complessivo a circa 2 TB. Questo non obbliga necessariamente a cercare un singolo modello da due terabyte: lo spazio aggiuntivo può essere utilizzato anche per quantizzazioni di maggiore qualità, context window molto grandi, più istanze e workload simultanei.

Scenario 2: Mac Studio M5 Ultra da 256 GB acquistabile oggi in Italia

La situazione pratica al momento del lancio è diversa. Con 256 GB per macchina, un singolo Mac Studio rimane eccezionalmente capiente rispetto alla maggior parte delle workstation, ma la soglia dei modelli realmente comodi da utilizzare si abbassa.

Un Llama 70B da circa 39,7 GB rappresenta un carico leggero rispetto alla memoria disponibile. Anche Qwen3-235B-A22B da circa 132 GB lascia oltre cento gigabyte lordi a disposizione del sistema, della cache e del contesto.

Il caso interessante è Llama 3.1 405B: la conversione MLX 4-bit presa come riferimento occupa circa 231 GB. Formalmente è inferiore ai 256 GB del Mac, ma rimangono meno di 25 GB prima di aver considerato macOS, runtime, cache KV e contesto.

È quindi più corretto definirlo un caso limite che un carico comodo per la configurazione da 256 GB.

Mac Studio M5 Ultra da 256 GB: uno, due o quattro nodi
Configurazione acquistabile al lancio Memoria complessiva Esempi pratici Valutazione
1 × M5 Ultra 256 GB 256 GB locali Llama 70B e Qwen3-235B comodi; Llama 405B 4-bit al limite La classe 200-250B è molto più tranquilla; 405B richiede attenzione alla memoria residua
2 × M5 Ultra 256 GB 512 GB distribuiti DeepSeek-V3 4-bit da circa 378 GB Si apre la classe dei modelli da 600-700B, ma Kimi K2 resta troppo grande
4 × M5 Ultra 256 GB 1.024 GB distribuiti Kimi K2 1T 4-bit da circa 578 GB La classe del trilione di parametri diventa realisticamente caricabile

La progressione è quindi particolarmente semplice da ricordare: 256 GB su un Mac permettono di affrontare comodamente Qwen3-235B e portano Llama 405B vicino al limite; 512 GB distribuiti su due Mac permettono di entrare nella classe di DeepSeek-V3; 1 TB distribuito su quattro Mac consente di ospitare modelli da un trilione di parametri come Kimi K2.

Il confronto diretto tra le configurazioni da 256 e 512 GB

Affiancando le due possibilità si vede immediatamente quanto la futura opzione da 512 GB cambi il numero di macchine necessario per uno stesso modello.

Confronto diretto: 256 GB contro 512 GB per Mac Studio
Numero di Mac Studio Con 256 GB per Mac, disponibili al lancio Con 512 GB per Mac, da fine ottobre Differenza pratica
1 Mac 256 GB locali 512 GB locali DeepSeek-V3 passa da impossibile su un singolo Mac a realisticamente caricabile
2 Mac 512 GB distribuiti 1.024 GB distribuiti Kimi K2 passa da troppo grande a comodamente distribuibile
4 Mac 1.024 GB distribuiti 2.048 GB distribuiti Si raddoppia il margine per modelli, cache, quantizzazione e workload simultanei

Questo è anche il motivo per cui bisogna essere precisi quando si parla dei 2 TB disponibili con quattro Mac Studio: è uno scenario tecnicamente previsto utilizzando quattro configurazioni da 512 GB, ma queste ultime non sono acquistabili al momento del lancio.

Per un acquirente italiano che ordinasse oggi quattro Mac Studio nella configurazione massima disponibile, il valore corretto da considerare è invece circa 1 TB complessivo distribuito.

RDMA: come possono più Mac lavorare sullo stesso modello

A questo punto entra in gioco RDMA, Remote Direct Memory Access.

In una normale comunicazione di rete i dati attraversano diversi livelli software, vengono elaborati dallo stack TCP/IP e possono richiedere più copie fra buffer differenti. RDMA permette trasferimenti molto più diretti fra la memoria dei sistemi coinvolti, riducendo copie, intervento della CPU e soprattutto latenza.

MLX dispone del backend JACCL, progettato proprio per comunicazioni a bassa latenza mediante RDMA attraverso Thunderbolt. La documentazione MLX indica una latenza nell’ordine di grandezza di dieci volte inferiore rispetto al precedente backend Ring basato su TCP.

Questa caratteristica è particolarmente importante per tecniche come il tensor parallelism, nelle quali parti dello stesso calcolo vengono suddivise fra processori presenti su macchine diverse.

Mac Studio M5 Ultra e AI: cosa significano 70B, 405B, 1T e RDMA - macitynet.it

Due Mac con 256 GB non sono un Mac con 512 GB

È però fondamentale non confondere il pool distribuito con la memoria unificata interna al singolo SoC.

Due Mac Studio da 256 GB possiedono complessivamente 512 GB di memoria, ma ogni M5 Ultra continua ad avere i propri 256 GB fisicamente locali. Quando servono dati residenti sull’altro Mac bisogna attraversare Thunderbolt 5.

Lo stesso vale per quattro macchine: 4 × 256 GB producono circa 1 TB complessivo, ma non nasce un ipotetico M5 Ultra con 1 TB di RAM collegato alla GPU a 1,2 TB/s.

La differenza di scala è enorme. La memoria locale dell’M5 Ultra raggiunge 1,2 TB/s; Thunderbolt 5 utilizza invece collegamenti nell’ordine delle decine di gigabit al secondo. RDMA rende il trasferimento molto più efficiente, ma non può annullare la differenza fisica fra memoria interna e collegamento esterno.

Il software deve quindi distribuire il modello in maniera intelligente affinché ciascun nodo lavori il più possibile sui pesi residenti nella propria memoria e la quantità di comunicazione fra i Mac rimanga sotto controllo.

Perché quattro Mac non sono quattro volte più veloci

La stessa Apple permette di capire immediatamente questo limite. L’azienda dichiara per un cluster composto da quattro Mac Studio un’inferenza AI fino a tre volte più veloce rispetto a un singolo sistema, non quattro volte.

Aggiungere nodi aumenta la potenza di calcolo e soprattutto la memoria disponibile, ma introduce anche sincronizzazione e trasferimenti fra le macchine.

Per alcuni modelli il vantaggio principale del cluster può quindi essere meno spettacolare in termini di token al secondo ma decisivo da un altro punto di vista: permettere al modello di funzionare.

Un Kimi K2 4-bit da circa 578 GB, per esempio, semplicemente non entra nei 512 GB aggregati di due Mac da 256 GB. Passare a quattro macchine non serve soltanto ad accelerarlo: porta la memoria complessiva a circa un terabyte e rende possibile caricarlo con un margine utilizzabile.

Quattro Mac e sei cavi Thunderbolt

La configurazione distribuita è anche fisicamente meno banale di quanto possa sembrare. Per utilizzare JACCL in una topologia completamente connessa, MLX richiede che ogni nodo possa comunicare direttamente con ogni altro nodo.

Con due Mac basta naturalmente un collegamento Thunderbolt. Con quattro Mac Studio una full mesh richiede sei collegamenti Thunderbolt diretti.

È un dettaglio apparentemente secondario ma molto concreto se immaginiamo un laboratorio AI costruito sulla scrivania: servono porte, cavi certificati adatti alle prestazioni richieste e una disposizione razionale delle macchine.

La biblioteca aiuta anche a capire la memoria distribuita

Il paragone con l’Encyclopédie può essere esteso per comprendere anche la differenza fra memoria locale e memoria distribuita.

Immaginiamo il Mac Studio da 256 GB come una grande biblioteca. Un modello relativamente piccolo come Llama 70B occupa soltanto una parte degli scaffali. Qwen3-235B ne utilizza una quota molto maggiore. Llama 405B arriva praticamente a riempire l’edificio.

DeepSeek-V3 non entra più.

Possiamo allora costruire una seconda biblioteca da 256 GB e collegarla alla prima con un corridoio molto veloce: questo è, semplificando, il ruolo svolto da Thunderbolt 5 e RDMA. Ora disponiamo complessivamente di 512 GB di scaffali e DeepSeek può essere suddiviso fra le due strutture.

Kimi K2 è ancora troppo grande: servono quattro biblioteche, per un totale di circa un terabyte.

Il corridoio fra gli edifici è rapido, ma raggiungere uno scaffale nella stessa stanza rimane molto più veloce. È esattamente il motivo per cui il software cerca di evitare continui spostamenti di dati fra i Mac.

Cosa cambia nell’uso concreto dell’AI locale

Per una normale chat locale non è necessario arrivare a questi estremi. Un modello da 70B può già affrontare con ottimi risultati scrittura, riassunti, traduzioni, interrogazione di documenti e numerosi compiti di programmazione, e su una macchina con 256 GB lascia una quantità enorme di memoria inutilizzata.

Le configurazioni più grandi diventano interessanti quando si vogliono utilizzare modelli frontier open-weight, analizzare grandi quantità di documenti senza inviarli a un servizio cloud, costruire coding agent che lavorano su repository molto estesi, utilizzare context window enormi oppure servire più richieste contemporaneamente.

C’è inoltre una differenza pratica rispetto alle workstation costruite attorno a GPU discrete. In una normale scheda grafica la VRAM costituisce un limite separato dalla memoria del computer. Apple Silicon utilizza invece memoria unificata, raggiungibile da CPU e GPU all’interno dello stesso sistema.

Questo consente a un Mac Studio da 256 o 512 GB di mettere a disposizione della GPU quantità di memoria difficilmente ottenibili con una singola scheda grafica tradizionale, anche se le GPU professionali dedicate possono offrire vantaggi enormi in termini di potenza di calcolo, ecosistema CUDA e scalabilità da data center.

256 GB oggi, 512 GB da fine ottobre

La distinzione temporale è quindi importante. Il Mac Studio M5 Ultra annunciato da Apple supporta fino a 512 GB, ma questa configurazione non fa parte della prima disponibilità: Apple ne prevede l’arrivo a fine ottobre.

Per chi acquista in Italia nella fase iniziale, la scala realmente disponibile è:

1 Mac = 256 GB locali → 2 Mac = 512 GB distribuiti → 4 Mac = 1 TB distribuito.

Quando arriverà la configurazione da 512 GB la scala raddoppierà:

1 Mac = 512 GB locali → 2 Mac = 1 TB distribuito → 4 Mac = 2 TB distribuiti.

La differenza più interessante non consiste semplicemente nell’avere più RAM. Con 512 GB DeepSeek-V3 può scendere da due Mac a uno; Kimi K2 può passare da quattro Mac da 256 GB a una coppia di Mac da 512 GB.

Mac Studio diventa anche un mattone per costruire un cluster AI

È probabilmente questa la novità più particolare del nuovo Mac Studio. I 512 GB attirano immediatamente l’attenzione, ma Thunderbolt 5 con RDMA cambia anche il ruolo della macchina.

Un singolo Mac Studio rimane una workstation capace di eseguire modelli locali enormi. Due o quattro unità possono invece diventare i nodi di un piccolo cluster AI da scrivania, nel quale memoria e calcolo vengono distribuiti senza ricorrere alla classica infrastruttura Ethernet/InfiniBand di un data center.

Non significa che quattro Mac si trasformino magicamente in un singolo computer con 1 o 2 TB di memoria unificata locale. La latenza, la banda di Thunderbolt e il modo in cui il software divide il modello continuano a contare e impediscono una scalabilità perfettamente lineare.

Ma dal punto di vista pratico la possibilità di partire da una macchina e aggiungerne una seconda o una quarta quando il modello supera la memoria disponibile crea uno scenario piuttosto insolito nel mondo dei personal computer.

E rende finalmente più comprensibile anche quella sequenza di sigle apparentemente astratte: 70B è già un enorme modello utilizzabile con grande margine; 405B porta un Mac da 256 GB vicino al limite; 671B come DeepSeek richiede oggi almeno due M5 Ultra da 256 GB; 1T come Kimi K2 porta il cluster italiano attuale a quattro macchine.

Quando arriveranno i 512 GB, gli stessi gradini si sposteranno verso l’alto. Ed è proprio qui che memoria unificata, 1,2 TB/s di banda, Thunderbolt 5 e RDMA iniziano ad avere un significato molto più concreto delle singole cifre riportate sulla scheda tecnica.

Offerte Apple e Tecnologia

Le offerte dell'ultimo minuto le trovi nel nostro canale Telegram

Offerte Speciali

Offerte Amazon 9 ottobre: Apple, Sonos, Sony, DJI, Switchbot – aggiornato

Le migliori offerte Amazon del 9 ottobre 2026: dispositivi tech e accessori per la vita di tutti i giorni, selezionati da Macitynet.

Ultimi articoli