Intermedio 21 minMini-PC

GB10 128 GB: quali LLM funzionano davvero (misurazioni)

Risposta diretta

Su una GIGABYTE AI TOP ATOM (NVIDIA GB10, 128 GB), i 13 modelli misurati, dal 4B al 235B, ci stanno con 32 768 token di contesto e almeno 20 GB di margine. I grandi modelli MoE, che attivano soltanto una parte dei loro parametri a ogni token, sono molto più veloci di un modello denso delle stesse dimensioni: gpt-oss 120B scrive 58 token al secondo. Un 70B denso scrive a 4,8 token al secondo: è la larghezza di banda della memoria, non lo spazio disponibile, a determinare la velocità.

Centoventotto gigabyte di memoria unificata: è il vantaggio delle macchine GB10 rispetto alle schede grafiche. Ma cosa si può davvero caricare, con quale margine e a quale velocità? Abbiamo misurato 13 modelli, dal 4B al 235B, su una AI TOP ATOM fornita gratuitamente da GIGABYTE, con un protocollo fissato prima della prima misurazione. Ecco cosa riesce a gestire, cosa è piacevole nell'uso quotidiano e per chi è l'acquisto giusto.

Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda NVIDIA DGX Spark →

Di Mohamed Meguedmi·Agg. 2026-10-08·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

i
Trasparenza
Materiale fornito gratuitamente da GIGABYTE per questa serie di guide. Le misurazioni e le opinioni sono nostre; GIGABYTE non ha né riletto né approvato questo contenuto prima della pubblicazione. Questa pagina non contiene alcun link di affiliazione. I nostri dati, infografiche e foto possono essere riutilizzati liberamente con licenza CC BY 4.0, citando quelllm.fr.
L'AI TOP ATOM di GIGABYTE vista di tre quarti dal lato destro, appoggiata in piano: coperchio grigio antracite e pannello frontale a lamelle nere.
L'AI TOP ATOM di GIGABYTE: 1,2 kg e circa un litro per un chip NVIDIA GB10 e 128 GB di memoria unificata. Foto della nostra unità, sfondo neutralizzato.

#La macchina testata

Scheda della macchina testata: GIGABYTE AI TOP ATOM ATAGB10-9000, rilevata il 2026-10-06: chip NVIDIA GB10 (Grace Blackwell), 20 core Arm (10 X925 e 10 A725), 128 GB di memoria LPDDR5x a 273 GB/s, SSD da 4 TB in PCIe 5.0 (32 GT/s, 4 linee), rete 10 GbE e 2 porte QSFP (ConnectX-7, 200 Gb/s), formato di 150 × 150 mm, 1 litro e 1 200 g, alimentazione da 240 W via USB-C, DGX OS 7.5.0
La configurazione rilevata tramite script sulla nostra unità prima della prima misurazione, completata dalla scheda GIGABYTE per il formato e le porte. Il collegamento PCIe 5.0 dell'SSD è stato verificato (32 GT/s, 4 linee). Colori: blu per il chip (GB10 e 20 core Arm); verde per la memoria (128 GB) e l'archiviazione (SSD da 4 TB); grigio per la rete, il formato, l'alimentazione e il software.

La macchina è una GIGABYTE AI TOP ATOM, modello ATAGB10-9000: chip NVIDIA GB10 (20 core Arm e una GPU Blackwell che condividono 128 GB di memoria dichiarata a 273 GB/s), SSD da 4 TB su PCIe 5.0. Funziona con DGX OS 7.5.0, il sistema di NVIDIA basato su Ubuntu (driver 580.159.03, CUDA 13.0).

Sono stati utilizzati tre software. llama.cpp, un motore open source molto diffuso per eseguire i modelli in locale, compilato sul posto per il chip GB10, fornisce la tabella principale. Ollama 0.34.1 serve per il confronto con un MacBook Pro M5 Max misurato con la stessa versione. vLLM 26.09, un server progettato per rispondere a più persone contemporaneamente, gira nel contenitore fornito da NVIDIA.

Scatola nera dell'AI TOP ATOM nel suo imballo di spedizione, bloccata dalla schiuma, con le diciture GIGABYTE AI TOP e Accelerated by NVIDIA.
Il disimballaggio: l'AI TOP ATOM arriva nella sua scatola, bloccata dalla schiuma. La nostra unità è stata ricevuta il 29 settembre 2026.

#Come abbiamo effettuato le misurazioni

Le velocità di llama.cpp provengono da cinque ripetizioni, con una deviazione standard (la dispersione tra le ripetizioni) non superiore al 3%. I tempi di caricamento, la lettura di un documento da 30 000 token e i margini di memoria sono misurazioni singole; i test con più utenti sono ripetuti tre volte. Prima della prima misurazione, un test di tre minuti ha verificato che la GPU mantenesse la propria potenza di calcolo.

I file dei 13 modelli hanno un'impronta SHA-256 (una firma digitale del file) identica a quella pubblicata da Hugging Face, il sito che ospita questi modelli. Il protocollo, redatto il 5 ottobre, è stato congelato il 6 alle 13:30, prima della prima misurazione.

Un'appendice dello stesso giorno, intorno alle 16 h 50, ha anticipato alla sera la nuova misurazione a freddo e aggiunto i test ripresi qui: script ufficiale diOllama, decodifica speculativa, carico continuo e Llama 3.3 70B in NVFP4. Il metodo, le impronte dei file e i dati delle nostre tabelle sono pubblicati nella nostra pagina sul metodo.

I dati principali sono stati rimisurati a freddo la sera stessa, dopo 20 minuti di riposo e con la cache svuotata: al massimo il 2,6% di scarto, al di sotto della soglia del 3% prevista dal protocollo.

#La stessa velocità di un DGX Spark, con pochi punti percentuali di differenza

Per quanto ne sappiamo, le macchine GB10 da 128 GB condividono lo stesso chip NVIDIA e la stessa memoria; la loro costruzione, il raffreddamento e lo spazio di archiviazione possono differire. Per collocare l'ATOM, abbiamo ripetuto due riferimenti pubblicati per il DGX Spark di NVIDIA, con la stessa versione del software e le stesse impostazioni.

Con llama.cpp (build 7941, quello della tabella pubblicata dal progetto; la nostra tabella principale usa il build 11430, più recente), su sei modelli comuni, la lettura è identica entro il 2,3%; la scrittura è inferiore del 2,8% in mediana e del 4,3% al massimo. Con lo script ufficiale diOllama (versione 0.12.6, quella delle sue misurazioni pubblicate), le nostre tre misurazioni sono entro il 2%, sia in lettura sia in scrittura: gpt-oss 20B, gpt-oss 120B e Llama 3.1 70B.

Le velocità di questa guida dovrebbero quindi valere, con uno scarto di pochi punti percentuali, per le altre macchine GB10 da 128 GB; abbiamo misurato solo l'ATOM. La sua costruzione e il suo comportamento sotto carico (temperature, stabilità dopo 1 h e 2 h) sono descritti in dettaglio nella guida successiva della serie, mentre i consumi sono trattati in una guida dedicata.

#13 modelli, dal 4B al 235B: spazio occupato e velocità

→
Lettura, scrittura, token e GB
La velocità di lettura indica a quale ritmo la macchina assorbe la vostra domanda (il «prompt») o il vostro documento prima di rispondere; la velocità di scrittura, a quale ritmo viene visualizzata la risposta. La prima conta per i documenti lunghi, il codice e gli agenti, la seconda per il comfort. Entrambe sono espresse in token al secondo (in francese, un token vale circa due terzi di parola). Le memorie sono in GB, come le visualizza Linux: 1 GB = 1 024 MB.

La tabella riassume la campagna. « Memoria occupata » è la riduzione della memoria disponibile una volta caricato il modello con 32 768 token di contesto riservati. « Caricamento » è il tempo di caricamento a freddo, con la cache del disco svuotata. Le velocità provengono dallo strumento di misurazione llama-bench (llama.cpp, build 11430 del 5 ottobre 2026), prima con contesto vuoto e poi con 32 768 token già presenti; le durate effettive per un documento lungo sono riportate più avanti.

13 modelli misurati sull'AI TOP ATOM, 6 ottobre 2026 (llama.cpp b11430, DGX OS 7.5.0, driver 580.159.03). Scrittura e lettura in token al secondo.
ModelloTipoMemoria occupataChargementScrittura (vuoto → 32k)Lettura (vuoto → 32k)Uso
Gemma 3 4B (Q4_0)dense4,6 GB3 s80,8 → 63,66 239 → 5 409molto fluido
Qwen2.5-Coder 7B (Q8_0)dense10,2 GB3 s30,0 → 23,33 746 → 2 138fluide
gpt-oss 20B (MXFP4)MoE, 3,6 Md attivi13,0 GB4 s81,4 → 62,54 950 → 3 316molto fluido
Qwen3.8 27B (Q4_K_XL)dense19,1 GB5 s11,8 → 10,6865 → 717correct
Qwen3.6 35B-A3B (Q4_K_XL)MoE, 3 mld attivi22,4 GB5 s66,0 → 55,62 987 → 2 429molto fluido
GLM-4.7-Flash (Q8_0)MoE, 3 mld attivi32,6 GB6 s51,4 → 35,52 392 → 608molto fluido
Qwen3-Coder 30B-A3B (Q8_0)MoE, 3,3 mld attivi34,3 GB6 s62,6 → 33,23 377 → 1 603molto fluido
Llama 3.3 70B (Q4_K_M)dense51,1 GB8 s4,8 → 3,9405 → 269ideale per l'elaborazione in batch
gpt-oss 120B (MXFP4)MoE, 5,1 Md attivi61,7 GB10 s58,0 → 42,22 609 → 1 832molto fluido
Qwen3.5 122B-A10B (Q4_K_XL)MoE, 10 mld attivi74,5 GB12 s23,1 → 21,41 126 → 945fluide
Nemotron-3 Super 120B-A12B (Q4_K_XL)MoE, 12 mld attivi80,4 GB12 s16,9 → 16,5851 → 809correct
Qwen3.8-Flash-Next 125B (IQ4_XS)MoE, circa 6 Md attivi89,5 GB21 s27,3 → 25,21 073 → 917fluide
Qwen3-235B-A22B (Q2_K_XL)MoE, 22 mld attivi90,5 GB12 s17,7 → 11,8588 → 331adeguato; compressione forte (Q2)

Per leggere la tabella: un modello denso fa lavorare tutti i suoi parametri a ogni token, un modello MoE (« mixture of experts ») soltanto una frazione, indicata in miliardi (Md). La sigla tra parentesi indica la compressione dei pesi. Nei nostri file, Q8 occupa 8,5 bit per parametro, i formati Q4 e MXFP4 da 4,3 a 5,6 bit, e Q2_K_XL 3 bit: è la compressione più forte della tabella.

La colonna «Uso» applica i nostri riferimenti alla velocità di scrittura con contesto vuoto: molto fluida oltre 40 token al secondo, fluida da 20 a 40, adeguata da 10 a 20. Al di sotto, riserviamo il modello ai processamenti batch.

Grafico a barre della velocità di scrittura dei 13 modelli, con contesto vuoto: da 81,4 token al secondo per gpt-oss 20B a 4,8 per Llama 3.3 70B; i modelli MoE in arancione, i modelli densi in blu
Velocità di scrittura in token al secondo, con contesto vuoto. In arancione, con il pittogramma a due caselle illuminate: i modelli MoE, che attivano solo una parte dei loro parametri per ogni token. In blu, con il pittogramma pieno: i modelli densi. A parità di dimensioni, gli MoE sono molto più veloci.

Primo insegnamento: nulla in questa tabella mette in difficoltà la macchina; persino Qwen3-235B lascia 21 GB liberi con 30 000 token di contesto. Secondo insegnamento, più utile per scegliere: lo spazio non è quasi mai un limite; è la scelta del modello a determinare la velocità, da 4,8 a 81,4 token al secondo.

#Ciò che determina la velocità: i parametri attivi, non la dimensione

Per scrivere ogni token, il chip deve rileggere in memoria i pesi che servono a quel token. Con 273 GB/s di banda passante, la velocità massima si calcola semplicemente: 273 diviso il volume dei pesi letti per ogni token. Un modello denso legge tutti i suoi pesi ogni volta; un modello MoE ne legge solo una frazione, gli «esperti» scelti per quel token.

È questo che spiega il paradosso della tabella. Il file di gpt-oss 120B pesa 59 GB, ma il modello attiva solo 5,1 miliardi di parametri per token: scrive a 58,0 token al secondo. Qwen3.8 27B, il cui file è più di tre volte più leggero (16 GB), è un modello denso: attiva tutti i suoi 27 miliardi di parametri a ogni token e scrive a 11,8 token al secondo. Il modello grande è quasi cinque volte più veloce di quello piccolo.

Velocità di scrittura misurata rispetto al limite teorico (273 GB/s ÷ volume dei pesi attivi, entrambi in unità decimali: 1 GB = 1 miliardo di byte), con contesto vuoto. Calcolo eseguito da noi, a titolo indicativo. Parametri attivi: schede dei modelli per gli MoE; numero rilevato da llama.cpp per i modelli densi. Percentuali calcolate sui valori non arrotondati.
ModelloParametri attiviLimite teoricoMisuratoQuota del limite massimo
Qwen2.5-Coder 7B (denso)7,6 Md33,730,089 %
Llama 3.3 70B (denso)70,6 Md6,44,874 %
Qwen3.8 27B (denso)27,3 mld15,611,876 %
Qwen3-Coder 30B-A3B (MoE)3,3 mld77,862,681 %
gpt-oss 120B (MoE)5,1 mld98,758,059 %
Qwen3.6 35B-A3B (MoE)3 Md141,166,047 %

La tabella considera sei modelli, quelli il cui numero di parametri attivi è pubblicato o rilevato da llama.cpp. I modelli densi raggiungono dal 74 all'89% di questo limite: il GB10 sfrutta quasi tutta la sua memoria.

Sull'insieme dei tredici modelli, gli otto MoE escluso Qwen3.8-Flash-Next raggiungono dal 47 all'81%, sei di loro tra il 52 e il 62%; la scelta degli esperti e i calcoli accessori aggiungono probabilmente un tempo fisso a ogni token. Qwen3.8-Flash-Next non rientra in questo calcolo: conta 51 miliardi di parametri di tabella di consultazione oltre ai suoi 125 miliardi, il che rende inadatta la stima.

A parità di dimensioni, tuttavia, i MoE restano molto più veloci. Da qui il nostro consiglio principale: su una macchina GB10, per un modello grande, privilegiate un MoE. Anche un piccolo modello denso come Gemma 3 4B scrive molto velocemente (80,8 token al secondo), ma è molto più piccolo e serve ad altri usi.

#I modelli con più di 100 miliardi di parametri

È questa la ragione d'essere dei 128 GB. NVIDIA annuncia per la piattaforma modelli fino a 200 miliardi di parametri; le nostre misurazioni confermano questa promessa, e un 235B compresso a 3 bit ci sta persino oltre. Cinque modelli con più di 100 miliardi di parametri stanno sull'ATOM, tutti con almeno 20 GB di margine a 30 000 token di contesto.

gpt-oss 120B, il miglior compromesso tra velocità e spazio
58,0 token al secondo, 61,7 GB occupati con il suo contesto, caricato in 10 secondi. OpenAI lo pubblica direttamente in formato MXFP4: ci sta senza ulteriore compressione.
Qwen3.8-Flash-Next 125B, il più veloce dei Qwen giganti
27,3 token al secondo con circa 6 miliardi di parametri attivi, 89,5 GB occupati in IQ4_XS. Anche la sua versione Q4_K_XL, meno compressa, entra, con un margine ridotto (vedi più avanti).
Qwen3.5 122B-A10B
23,1 token al secondo, 74,5 GB; i suoi dieci miliardi di parametri attivi lo collocano dietro a gpt-oss.
Nemotron-3 Super 120B-A12B (NVIDIA)
16,9 token al secondo, 80,4 GB. Con dodici miliardi di parametri attivi, scrive più lentamente di gpt-oss ed è il modello la cui scrittura regge meglio quando il contesto si allunga: da 16,5 a 32 768 token, circa il 3% in meno.
Qwen3-235B-A22B, a parte
Ci sta in Q2_K_XL, la compressione più forte della tabella (3 bit per parametro in media): 17,7 token al secondo, 90,5 GB. Una compressione così forte riduce in genere la qualità delle risposte; non l'abbiamo misurata.

#Dove si ferma la memoria: intorno ai 100–105 GB di pesi

Il sistema vede 121,7 GB di memoria: una parte dei 128 viene riservata già all'avvio. Una volta avviata la macchina, senza nient'altro in memoria, restavano disponibili da 108 a 113 GB a seconda del momento. Per trovare il limite, abbiamo caricato due versioni più pesanti dei modelli più grandi, con lo stesso contesto di 32 768 token e un meccanismo di sicurezza che interrompe il caricamento se la memoria libera scende sotto i 3 GB.

I due caricamenti più pesanti, riusciti entrambi, 6 ottobre 2026 (llama-server b11430, contesto di 32 768 token). Margine: memoria ancora disponibile dopo aver letto un documento di 30 000 token. «Solo»: margine da 5 a 15 GB.
ModelloFileMemoria occupataMargine residuoScrittura (dopo la lettura di 4 000 → 30 000 token)Place
Qwen3.8-Flash-Next 125B (Q4_K_XL)103,7 GB107,0 GB6,0 GB24,9 → 21,9 tok/sAl limite
Qwen3-235B-A22B (Q3_K_XL, 3,5 bit)97,0 GB104,7 GB8,2 GB13,9 → 10,4 tok/sAl limite

Nessun modello ha fallito il caricamento, ma questi due lasciano un margine ridotto: c'è appena spazio per un secondo modello, un contesto molto più lungo o un'applicazione esigente affiancata. Il limite pratico si colloca quindi intorno ai 100–105 GB di pesi. Esclude, per esempio, i pesi NVFP4 (un formato compresso di NVIDIA) di Qwen3.8-Flash-Next: circa 135 GB secondo il blog Kubesimplify (27 agosto 2026), che precisa che in tal caso servono due macchine.

Questo stesso articolo mostrava già il modello su una sola macchina in GGUF (il formato di llama.cpp), ma allora esisteva soltanto la versione più compressa. Sull'ATOM funzionano le versioni IQ4_XS e Q4_K_XL, con 21 e 6 GB di margine.

→
La dimensione giusta per un uso confortevole
Punta a circa 90 GB al massimo con il tuo contesto: rimangono così una ventina di GB per il sistema, un secondo modello piccolo o un contesto più lungo. I nostri tredici modelli rispettano questo riferimento.

#Il prezzo del contesto lungo

Un documento lungo, una base di codice o una conversazione che si prolunga: ogni token già presente nel contesto rallenta il seguito. Con 32 768 token in memoria, la velocità di scrittura diminuisce dal 3 al 47% a seconda dei modelli. Abbiamo anche misurato il tempo reale necessario per leggere in un unico blocco un documento di 30 000 token, una cinquantina di pagine.

Tempo per leggere in un'unica soluzione un documento di 30 000 token (llama-server b11430, 6 ottobre 2026), quindi velocità di scrittura della risposta.
ModelloLettura di 30 000 tokenScrittura successiva
Gemma 3 4B4,7 s60,8 tok/s
gpt-oss 20B8,1 s61,6 tok/s
Qwen2.5-Coder 7B12,7 s23,3 tok/s
Qwen3.6 35B-A3B14,2 s54,4 tok/s
Qwen3-Coder 30B-A3B17,4 s33,3 tok/s
gpt-oss 120B21,8 s42,8 tok/s
GLM-4.7-Flash32,7 s35,6 tok/s
Qwen3.8 27B39,4 s10,6 tok/s
Qwen3.8-Flash-Next 125B42,9 s23,0 tok/s
Qwen3.5 122B-A10B43,6 s21,2 tok/s
Nemotron-3 Super 120B-A12B55,4 s16,2 tok/s
Qwen3-235B-A22B1 min 33 s12,1 tok/s
Llama 3.3 70B1 min 44 s4,0 tok/s

Per la maggior parte dei modelli, questi tempi sono più lunghi di quanto suggerisca la colonna «Lettura» della prima tabella. Il motivo probabile: llama-server, il server utilizzato nella pratica, elabora per impostazione predefinita il testo in batch da 512 token, contro i 2 048 della nostra configurazione di llama-bench.

Curve della velocità di scrittura in funzione del contesto già presente, da 0 a 32 768 token: un colore per modello: gpt-oss 120B da 58,0 a 42,2, Qwen3.6 35B-A3B da 66,0 a 55,6, Qwen3-Coder 30B-A3B da 62,6 a 33,2, Nemotron-3 Super 120B da 16,9 a 16,5, Qwen3.8 27B da 11,8 a 10,6, Llama 3.3 70B da 4,8 a 3,9
Velocità di scrittura in token al secondo in funzione del contesto già presente, da 0 a 32 768 token (asse orizzontale in migliaia di token). Un colore per modello, il cui nome è scritto a destra di ogni curva; il pittogramma del documento, con « → 32 768 », ricorda il contesto massimo misurato. Nemotron (−3%) e Qwen3.8 27B (−10%) mantengono quasi tutta la loro velocità; con 32 768 token in memoria, gpt-oss 120B scrive ancora 42 token al secondo e Qwen3.6 35B-A3B quasi 56.

La lettura è un punto di forza della GB10: rispetto al Mac confrontato più avanti, legge gpt-oss 120B il 31% più velocemente. Se si deposita un rapporto di una cinquantina di pagine, la risposta inizia 22 secondi dopo con gpt-oss 120B, e 1 min 44 s dopo con un 70B denso. Per l'analisi dei documenti e gli agenti di codice, questo criterio pesa molto.

#Fino a 16 utenti contemporaneamente: cosa riesce a gestire la macchina

Con vLLM abbiamo simulato 1, 8 e poi 16 utenti simultanei. Ognuno invia una richiesta di 1 024 token e riceve una risposta di 512 token; ogni punto è misurato tre volte con richieste diverse e pubblichiamo la mediana.

Più utenti simultanei, vLLM 26.09 (container NVIDIA), 6 ottobre 2026. «Per persona»: velocità di scrittura una volta avviata la risposta. «Totale»: token scritti al secondo per l'insieme degli utenti, compresa l'attesa della prima parola. «Casi più lenti»: 99º percentile, la durata al di sotto della quale terminano 99 richieste su 100, calcolata su 4-64 richieste per serie, quindi vicina al massimo osservato.
ModelloUtentiTotalPer personaPrima parola (media)Prima parola (casi più lenti)
gpt-oss 120B135,6 tok/s36,4 tok/s0,34 s0,35 s
gpt-oss 120B8113,9 tok/s14,5 tok/s0,97 s1,62 s
gpt-oss 120B16160,3 tok/s10,2 tok/s1,07 s3,71 s
gpt-oss 20B149,1 tok/s50,0 tok/s0,16 s0,16 s
gpt-oss 20B8205,9 tok/s26,5 tok/s0,49 s0,81 s
gpt-oss 20B16322,4 tok/s20,7 tok/s0,52 s1,73 s
Curve del throughput totale e del throughput per persona per 1, 8 e 16 utenti simultanei: gpt-oss 120B passa da 35,6 a 160,3 token al secondo complessivi, 10,2 per persona in 16; gpt-oss 20B passa da 49,1 a 322,4 complessivi, 20,7 per persona in 16
Velocità in token al secondo per 1, 8 e 16 utenti simultanei (vLLM). Viola: gpt-oss 20B; arancione: gpt-oss 120B. Sotto l'asse orizzontale, una sagoma rappresenta un utente, un gruppo rappresenta più utenti. Linee continue, pittogramma del gruppo: velocità totale. Linee tratteggiate, pittogramma della persona: velocità visualizzata da ciascuna persona. Con 16 utenti, gpt-oss 20B supera i 320 token al secondo complessivi.

Tra 1 e 16 utenti, il throughput totale viene moltiplicato per 4,5 con gpt-oss 120B e per 6,6 con gpt-oss 20B: quando più richieste condividono la lettura degli stessi pesi, il chip sfrutta appieno la sua potenza di calcolo.

Con 16 persone, ciascuna vede ancora la propria risposta scriversi a 10 token al secondo con gpt-oss 120B, e a 21 con gpt-oss 20B. Con il modello da 120 miliardi, la prima parola arriva in media in poco più di un secondo, e in quasi 4 secondi nei casi più lenti.

Per una sola persona, invece, vLLM non è il più veloce: senza particolari regolazioni delle prestazioni, scrive a 36,4 token al secondo su gpt-oss 120B, contro i 54,4 di llama.cpp sulle risposte lunghe. I suoi log mostrano che sul GB10 sceglie il kernel di calcolo Marlin per il formato MXFP4, cosa che probabilmente spiega lo scarto. vLLM si giustifica non appena più persone o più agenti condividono la macchina.

#Da solo davanti alla macchina: Ollama o llama.cpp?

Ollama è il modo più semplice per iniziare e funziona sul GB10 senza regolazioni. Su gpt-oss, tuttavia, non è il più veloce. Sulle risposte lunghe, la versione 0.34.1 scrive a 42,3 token al secondo su gpt-oss 120B, contro i 54,4 di llama.cpp nello stesso formato MXFP4, ovvero il 22% in meno. Su gpt-oss 20B: 58,8 contro 78,8, ovvero il 25% in meno.

Sui modelli Qwen, è il contrario. Su Qwen3.8 27B, Ollama scrive tra 22,9 e 30,5 token al secondo a seconda del passaggio, contro gli 11,8 di llama.cpp con le impostazioni predefinite; su Qwen3.6 35B-A3B, tra 90,5 e 94,9, contro 66,0. Il motivo probabile: Ollama attiva per impostazione predefinita una decodifica speculativa, che propone diversi token in anticipo e che il modello convalida in una volta sola (l'impostazione draft_num_predict compare nella configurazione di questi modelli).

Il nostro test va nella stessa direzione. Su llama-server (sei testi da 400 token, prosa e codice), la decodifica speculativa di llama.cpp (MTP, che prevede più token alla volta) porta Qwen3.8 27B da 11,7 a 21,5 token al secondo in prosa, e da 11,6 a 27,2 nel codice.

→
Ollama apre per impostazione predefinita contesti lunghi
Senza alcuna regolazione da parte nostra, Ollama 0.34.1 ha aperto contesti di 131 072 token per gpt-oss e di 262 144 per Qwen e Gemma, mentre la sua documentazione indica 4 096 come impostazione predefinita. La memoria dichiarata rimane vicina alle nostre misurazioni. Per lasciare spazio a un secondo modello, riduci il contesto con la variabile OLLAMA_CONTEXT_LENGTH.

In pratica: Ollama per iniziare e per i modelli Qwen, che accelera automaticamente; llama.cpp per ottenere il massimo da gpt-oss, oppure da Qwen3.8 attivando la sua decodifica speculativa. La scelta migliore dipende dalle impostazioni più che dalla macchina.

#A confronto con il MacBook Pro M5 Max da 128 GB

Un lettore ha misurato il suo MacBook Pro M5 Max da 128 GB (GPU da 40 core) il 16 settembre con Ollama 0.34.1, in un solo passaggio per modello; le sue rilevazioni sono pubblicate nella nostra guida dedicata. Abbiamo ripetuto le stesse serie sull'ATOM, in due passaggi: stessa versione di Ollama, stessi modelli, stesso prompt.

Stessa versione di Ollama (0.34.1), stessi modelli, stesso prompt. Scrittura in token al secondo; lettura di un documento di circa 17 000 token per l'ultima riga. Mac: un passaggio, misurato da un lettore il 16 settembre 2026. ATOM: due passaggi, il 6 ottobre 2026.
MisurazioneATOM, 1° passaggioATOM, 2º passaggioMacBook Pro M5 MaxScarto
Scrittura, gemma4:12b45,954,158,1Mac +7–+27 %
Scrittura, qwen3.8:27b30,522,936,6Mac +20 a +59 %
Scrittura, gpt-oss:20b58,158,8113,4Mac +93–+95 %
Scrittura, gpt-oss:120b42,242,379,1Mac +87%
Lettura, gpt-oss:120b1 816—1 388ATOM +31 %

Il Mac scrive più velocemente su tutti e quattro i modelli, quasi il doppio sui due gpt-oss, i cui passaggi concordano: il suo chip dispone di 614 GB/s di banda passante, più del doppio rispetto al GB10. Su gemma4 e qwen3.8, lo scarto varia da un passaggio all'altro; la decodifica speculativa, il cui guadagno dipende dal testo generato, è una possibile spiegazione.

L'ATOM legge più velocemente, probabilmente grazie alla potenza di calcolo della sua GPU, su testi simili ma non identici (16 850 e 16 689 token). Con llama.cpp, la differenza nella scrittura si riduce: 54,4 token al secondo su gpt-oss 120B, contro 79,1 per il Mac con Ollama.

#Per chi l'ATOM è la scelta giusta

Quanto segue deriva dalle nostre misurazioni sull'ATOM.

L'ATOM è la scelta giusta se vuoi modelli di grandi dimensioni a casa tua
Cinque modelli con più di 100 miliardi di parametri ci stanno comodamente. Per quanto ne sappiamo, nessuna scheda grafica consumer si avvicina a questi 128 GB.
… se lavori su documenti lunghi o codice
30 000 token letti in 22 secondi con gpt-oss 120B.
… se la condividono più persone o agenti
160 token al secondo complessivi per 16 utenti su gpt-oss 120B.
… se volete l'ecosistema NVIDIA
CUDA 13, vLLM nel contenitore di NVIDIA e llama.cpp compilato per il chip GB10 hanno funzionato da noi con DGX OS 7.5.0.
Se siete da soli e puntate innanzitutto sulla velocità di scrittura
Confronta con il MacBook Pro M5 Max: grazie ai suoi 614 GB/s, scrive più velocemente su gpt-oss, mentre l'ATOM legge un documento lungo il 31% più velocemente su gpt-oss 120B. Confronta anche i prezzi.
Se i vostri modelli restano sotto i 35 GB
La versione da 64 GB dell'ATOM, annunciata per il 23 ottobre 2026, dovrebbe essere sufficiente (calcolo ricavato dalle nostre misurazioni, non misurato su questa versione).

#64 o 128 GB?

Il 2 ottobre 2026, NVIDIA ha annunciato DGX Spark da 64 GB per modelli fino a 100 miliardi di parametri, disponibili il 23 ottobre presso Acer, ASUS, Dell, GIGABYTE, HP e MSI, a partire da 4 999 dollari. Il 5 ottobre GIGABYTE ha confermato una AI TOP ATOM 64 GB con lo stesso design. Non l'abbiamo misurata.

Le nostre misurazioni permettono un calcolo. I modelli fino a Qwen3-Coder 30B-A3B occupano meno di 35 GB con 32 768 token di contesto e ci starebbero; Llama 3.3 70B (51 GB) sarebbe al limite. gpt-oss 120B (62 GB) e i modelli più grandi non ci starebbero. A parità di larghezza di banda, cosa che bisognerà verificare, le velocità dovrebbero essere simili.

Per un modello con più di 100 miliardi di parametri su una sola macchina, la versione da 128 GB è la scelta obbligata. Secondo NVIDIA, anche due macchine da 64 GB collegate mettono in comune la memoria; non lo abbiamo testato.

#I prezzi rilevati

L'8 ottobre 2026, la versione da 4 TB in PCIe 4.0 (ATAGB10-9001, stesso chip GB10 e gli stessi 128 GB) era indicata a 6 346,27 € IVA inclusa sul negozio ufficiale AORUS, esaurita; era disponibile su Amazon.fr, venduta da Amazon UK (un esemplare). La versione testata, da 4 TB in PCIe 5.0 (ATAGB10-9000), costava 7 999,95 € da LDLC e Materiel.net, non disponibile.

Prezzi e disponibilità di queste macchine cambiano rapidamente: verificatele prima di acquistare.

#Il nostro giudizio

L'ATOM è un'ottima scelta per eseguire a casa un modello da 120 miliardi di parametri, condividerlo con un team o leggere rapidamente documenti lunghi. Ci ha fornito le prestazioni di riferimento della piattaforma, senza limitazioni termiche rilevate nelle nostre misurazioni, anche durante un'ora di carico continuo con 16 utenti. Se il budget è importante, la versione PCIe 4.0 mantiene lo stesso chip e la stessa memoria.

#Ciò che non abbiamo misurato

La qualità delle risposte
Questa guida misura ciò che riesce a gestire e a quale velocità, non il valore di ogni modello.
Le temperature, il rumore e i consumi
La prossima guida della serie illustra in dettaglio le temperature sotto carico prolungato; il consumo ha una guida dedicata, misurato sul chip (solo GPU). Per il rumore, citiamo le misurazioni di Hardware & Co.
I contesti oltre 32 768 token
Diversi modelli accettano contesti molto più lunghi; questa guida si ferma a 32 768 token, e il tutorial 70B della serie arriva fino a 131 072 token per Llama 3.3 70B e gpt-oss 120B.
Le altre macchine GB10 e la versione da 64 GB
I nostri numeri sono in linea con quelli pubblicati per il DGX Spark di NVIDIA, ma abbiamo misurato soltanto l'ATOM 128 GB.

Aggiornamenti e correzioni: questa pagina sarà rivista se una nuova versione di DGX OS, di llama.cpp o di Ollama modifica questi risultati; ogni correzione sarà datata.

#FAQ

FAQ
Qual è il modello più grande che si può far funzionare su una macchina GB10 da 128 GB?+
Sulla nostra AI TOP ATOM, il modello più grande testato è Qwen3-235B-A22B: 90,5 GB occupati in Q2_K_XL (3 bit per parametro) e 21 GB di margine con 30 000 token di contesto. Tiene anche la sua versione Q3_K_XL, con 8 GB di margine. Non abbiamo misurato la qualità delle risposte: a 3 bit, un modello si allontana maggiormente dalla versione originale rispetto a 4 o 5 bit, ma questo non indica quale risponda meglio.
Un modello 70B è utilizzabile quotidianamente su una GB10?+
Lo gestisce senza difficoltà (51 GB occupati) e scrive 4,8 token al secondo; legge 30 000 token in 1 min 44 s. È ideale per l'elaborazione in batch: nella versione NVFP4 con vLLM, otto richieste simultanee totalizzano 37,7 token al secondo e ogni risposta, una volta iniziata, viene scritta a 5,0 token al secondo. Un piccolo modello ausiliario (draft) lo porta a 12 token al secondo (vedi il nostro tutorial sul 70B). In conversazione, gpt-oss 120B è molto più piacevole.
Le velocità di questa guida valgono per un DGX Spark di NVIDIA o per un'altra marca?+
Molto probabilmente, con uno scarto di pochi punti percentuali, ma abbiamo misurato solo l'ATOM. Per quanto ne sappiamo, le macchine GB10 da 128 GB condividono lo stesso chip e la stessa memoria. Riproducendo due riferimenti pubblicati per il DGX Spark, con llama.cpp e con Ollama, le nostre velocità di lettura differiscono al massimo del 2,3% e quelle di scrittura del 4,3%.
Meglio scegliere la versione da 64 GB o da 128 GB?+
Se i vostri modelli occupano meno di 35 GB con il loro contesto, come gpt-oss 20B o Qwen3.6 35B-A3B nelle nostre misurazioni, la versione da 64 GB dovrebbe bastare; è un calcolo, non l'abbiamo misurata. Per un modello con più di 100 miliardi di parametri su una sola macchina, come gpt-oss 120B (62 GB), è necessaria la versione da 128 GB.
Ollama è la scelta migliore su una macchina GB10?+
Per iniziare, sì: funziona senza configurazione. Su gpt-oss 120B, tuttavia, llama.cpp scrive più velocemente (54,4 contro 42,3 token al secondo su risposte lunghe). Sui modelli Qwen, Ollama prevale con le impostazioni predefinite, probabilmente grazie alla decodifica speculativa che attiva; llama.cpp gli si avvicina quando si attiva la sua. La scelta migliore dipende quindi soprattutto dalle impostazioni.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.