NVIDIA DGX Spark: il mini-PC IA da 128 GB a confronto con le GPU
Il DGX Spark è la scommessa di NVIDIA sull'IA locale da scrivania: un chip Grace Blackwell, 128 GB di memoria unificata e un formato che trova posto su un angolo del tavolo. Sulla carta, esegue modelli che nessuna scheda grafica consumer può caricare da sola. Questa guida fa il punto sul dgx spark llm nella pratica: cosa entra in memoria, le velocità reali di inferenza e il confronto con una RTX 5090 e un Mac Studio per capire se questo mini-PC merita un posto a casa tua.
Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda NVIDIA DGX Spark →
Per questa configurazione: NVIDIA DGX Spark.
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Cosa è il DGX Spark
Il DGX Spark è un computer compatto costruito intorno al superchip NVIDIA GB10 Grace Blackwell. Combina sullo stesso chip una GPU Blackwell e una CPU ARM Grace (20 core), collegate a un unico pool di 128 GB di memoria LPDDR5X condivisa tra le due. È questa architettura a memoria unificata — la stessa filosofia di Apple Silicon — a rendere la macchina così interessante per l'IA locale.
Mentre una scheda grafica classica isola la propria VRAM (massimo 24 o 32 GB nei modelli di fascia consumer), il DGX Spark permette alla GPU di indirizzare direttamente i 128 GB. In pratica, il vincolo che blocca tutti quando usano una GPU — «il modello entra nella VRAM?» — scompare quasi. Il fattore limitante diventa la larghezza di banda della memoria, non la capacità.
- Chip
- NVIDIA GB10 Grace Blackwell (GPU Blackwell + CPU ARM a 20 core)
- Memoria
- 128 GB LPDDR5X unificata, condivisa CPU/GPU
- Larghezza di banda
- ~273 GB/s (LPDDR5X), il vero collo di bottiglia
- Rete
- ConnectX (200 GbE) per collegare due Spark e puntare a modelli molto grandi
- Formato
- Mini-PC desktop, ~150 W, silenzioso rispetto a un PC tower multi-GPU
#128 GB unificati: cosa si ottiene
Per avere un'idea, ecco la VRAM approssimativa necessaria per un modello con quantizzazione Q4_K_M, la più comune per l'inferenza locale: un 7B rientra in circa 5 GB, un 14B in circa 9 GB, un 32B in circa 19 GB e un 70B in circa 40 GB. Su una RTX 5090 con i suoi 32 GB, un 70B Q4 quindi non rientra interamente nella VRAM: bisogna trasferirne una parte alla CPU tramite offload, il che fa crollare la velocità.
Con 128 GB di memoria unificata, il DGX Spark carica senza sforzo un 70B in Q4, Q5 o persino Q8, mantiene un margine per un contesto lungo (32k token e oltre) e lascia aperta la possibilità di usare modelli con oltre 100 miliardi di parametri con quantizzazione aggressiva. È la classe di modelli che, finora, richiedeva un Mac Studio di fascia alta oppure un sistema multi-GPU costoso e dai consumi elevati.
- 70B Q4 (~40 GB)
- Agevole, con ampio margine per il contesto
- 70B Q8 (~75 GB)
- Possibile — qualità quasi FP16 su un modello grande
- MoE tipo 120B in Q4
- Entra in memoria; la banda passante determina la velocità
- Vari modelli caricati
- Un 32B più un 14B in parallelo per routing o multi-agent
#Quali modelli esegue
Il punto di forza del DGX Spark è la fascia 30B–120B, proprio quella in cui le GPU consumer si fermano per mancanza di VRAM. Ecco gli usi tipici per ciascuna famiglia di modelli.
- Qwen 3.8 27B
- Il modello generalista di punta del 2026 (visione, 262k ctx); su questa macchina gira in Q8 a piena qualità, con un ampio margine di contesto
- Qwen 3.6 35B-A3B / Qwen3-Coder 30B
- MoE veloci per il ragionamento e il codice, che entrano interamente in memoria anche in Q8
- GLM 4.7 Flash (MoE 30B-A3B, MIT)
- Eccellente per gli agenti, caricato a piena qualità senza acrobazie
- Grande MoE 100B+ quantizzato
- Le architetture Mixture-of-Experts sfruttano appieno l'ampia memoria unificata
- Modelli multimodali
- Gemma 4 e Qwen 3.8 (visione + testo), che richiedono molta memoria, trovano spazio senza compromessi
Per i piccoli modelli (7B–14B), il DGX Spark funziona ovviamente, ma è uno spreco: una RTX 4070 o un Mac mini M4 li fa girare più velocemente e a un costo molto inferiore. La macchina si giustifica solo se punti regolarmente ai modelli di grandi dimensioni.
#Performance reali in inferenza
Nell'inferenza locale contano due valori: la velocità di generazione (token al secondo, ciò che scorre sullo schermo) e il tempo di prefill (il ritardo prima del primo token, che dipende dalla lunghezza del prompt). La banda passante della memoria determina soprattutto la velocità di generazione.
Sul DGX Spark, un modello 70B in Q4 genera tipicamente una decina di token al secondo — abbastanza per usarlo comodamente come assistente, leggendo il testo man mano che viene generato, meno per carichi di lavoro batch ad alto throughput. I modelli più piccoli (14B–32B) raggiungono velocità nettamente superiori. Questo profilo è coerente con una banda passante di circa 273 GB/s: è il limite che separa il DGX Spark dalle schede GDDR7, molto più veloci sotto questo aspetto.
#DGX Spark vs RTX 5090
È il confronto più eloquente e contrappone due filosofie. La RTX 5090 offre 32 GB di VRAM GDDR7 con una larghezza di banda di circa 1792 GB/s: una velocità della memoria circa sei-sette volte superiore a quella del DGX Spark. Con tutto ciò che rientra nei suoi 32 GB, la 5090 surclassa lo Spark in token al secondo.
Ma la 5090 incontra un limite netto: oltre ~32 GB deve trasferire parte del carico alla CPU e le prestazioni crollano. Un modello 70B Q4 (~40 GB) non entra interamente nella sua memoria. Il DGX Spark, invece, gestisce quello stesso 70B senza difficoltà — più lentamente, ma tenendolo tutto in memoria. La scelta si riduce a una domanda: il tuo carico di lavoro sta sotto i 32 GB?
- Resti ≤ 32 GB (fino a ~32B Q4)
- RTX 5090: molto più veloce e versatile (gioco, rendering, CUDA)
- Punti a 70B e oltre
- DGX Spark: il modello entra in memoria dove la 5090 non ce la fa
- Consumo / rumore
- DGX Spark: ~150 W e silenzioso, rispetto a un PC tower con una 5090, caldo e rumoroso
- Ecosistema CUDA completo
- Entrambi; Spark aggiunge lo stack DGX/NVIDIA completo, da un'estremità all'altra
#DGX Spark vs Mac Studio
Il vero rivale del DGX Spark non è una scheda grafica, è il Mac Studio. I due condividono la stessa idea — una grande quantità di memoria unificata in un case compatto e sobrio — e si rivolgono allo stesso pubblico: gli sviluppatori che vogliono grandi modelli in locale senza assemblare un rig.
Il Mac Studio (M-Ultra) arriva fino a 512 GB di memoria unificata, con una larghezza di banda spesso superiore nelle configurazioni di fascia alta, il che lo rende formidabile con i modelli molto grandi. Il suo punto forte: macOS, Metal e un ecosistema maturo (Ollama, LM Studio, MLX). Il punto forte del DGX Spark: CUDA nativo. Se la tua pipeline dipende da librerie CUDA, da TensorRT o da strumenti NVIDIA, lo Spark parla nativamente la stessa lingua dei tuoi server di produzione.
- Memoria massima
- Mac Studio fino a 512 GB; DGX Spark 128 GB (estendibile collegando 2 unità)
- Ecosistema software
- Mac: Metal/MLX maturi; Spark: CUDA nativo, continuità con i server NVIDIA
- Portabilità del codice IA
- Spark esegue senza difficoltà il codice scritto per GPU NVIDIA nel cloud o nei data center
- Uso da ufficio
- Il Mac Studio è una postazione di lavoro completa; lo Spark è una stazione dedicata all’IA
#Installarci Ollama
Il DGX Spark gira su una base Linux (DGX OS, derivato da Ubuntu) con lo stack CUDA preinstallato. Ollama vi funziona come su qualsiasi macchina Linux con GPU NVIDIA: il daemon rileva la GPU e serve i modelli sulla sua porta abituale.
- 01Installare OllamaScript ufficiale con un solo comando. Configura il servizio systemd e rileva automaticamente la GPU Blackwell tramite CUDA.
- 02Verificare il rilevamento della GPUVerifica che la GPU venga rilevata correttamente prima di avviare un modello di grandi dimensioni, altrimenti l'inferenza verrebbe eseguita sulla CPU.
- 03Scaricare un modello di grandi dimensioniScarica un grande MoE del 2026 alla massima qualità (un Qwen3-Coder 30B in Q8, o il modello di punta Qwen 3.8 27B e il suo contesto di 262k) per sfruttare la memoria: è esattamente il caso d'uso previsto per questa macchina.
- 04Avviare e collegare un'interfacciaIl daemon è in ascolto per impostazione predefinita su http://localhost:11434; configura Open WebUI o LM Studio in modo che si colleghino a questo indirizzo.
Il demone Ollama espone un'API compatibile sulla porta 11434. Per sfruttare la memoria, privilegia modelli che le GPU tradizionali non possono caricare da sole e aumenta la finestra di contesto, visto che hai spazio a disposizione. Nota che Qwen 3.8 27B tende a ragionare eccessivamente con l'impostazione di ragionamento predefinita: imposta il suo livello di ragionamento su basso (low) per ottenere risposte più dirette.
#Un chip, otto macchine: i cloni certificati
NVIDIA ha fatto del GB10 una piattaforma: oltre al suo DGX Spark Founders Edition, sette produttori vendono la stessa base certificata con il proprio marchio. Stesso chip, stessi 128 GB — le differenze riguardano lo storage, lo chassis, il prezzo e il canale di vendita.
| Macchina | Produttore | Da ricordare |
|---|---|---|
| DGX Spark Founders Edition | NVIDIA | Il riferimento, ~3 999 $ |
| Ascent GX10 | Asus | Il migliore in termini di prezzo (~2 999 $) |
| Veriton GN100 | Acer | Un unico SKU con 4 TB di spazio di archiviazione |
| AI TOP ATOM | Gigabyte | Fornito con la suite software AI TOP |
| EdgeXpert MS-C931 | MSI | Canale industriale/edge |
| Pro Max GB10 | Dell | Canale aziendale |
| ThinkStation PGX | Lenovo | Canale workstation |
| ZGX Nano | HP | Canale workstation |
Un dettaglio che cambia tutto per i modelli più grandi: la porta ConnectX integrata permette di collegare due unità e di eseguire in locale modelli della classe 400B. Nessun'altra macchina destinata al grande pubblico offre questa possibilità.
#Domande frequenti
Che cos'è esattamente il GB10 del DGX Spark?+
Qual è la differenza tra il DGX Spark e i suoi cloni Asus, Acer o Gigabyte?+
È possibile veramente eseguire un modello 400B con due macchine?+
DGX Spark o macchina Strix Halo?+
A chi si rivolge una macchina GB10?+
#Per chi questo formato ha senso
Il DGX Spark non è una macchina destinata al grande pubblico. È interessante soprattutto per profili specifici, per i quali il limite della VRAM è il vero problema quotidiano.
- Sviluppatori IA con CUDA
- Prototipare localmente codice destinato alle GPU NVIDIA di produzione, senza sorprese nel porting
- Ricercatori e team R&D
- Fine-tuning leggero e inferenza di modelli di grandi dimensioni senza prenotare tempo di utilizzo delle GPU nel cloud
- Utenti avanzati di modelli da 70B in su
- Chi si scontra continuamente con il limite di 24–32 GB di una scheda consumer
- Uffici sensibili al rumore/consumo
- Una workstation silenziosa e a basso consumo anziché un rig multi-GPU
Al contrario, se giochi, se esegui soprattutto modelli ≤ 32B o se hai un budget limitato, una RTX 5090 (o persino una 4070/4080) o un Mac mini M4 offrirà un rapporto prestazioni/prezzo molto migliore. Il DGX Spark si giustifica quando la necessità di una grande quantità di memoria ha la priorità sulla velocità di elaborazione pura.
#Per approfondire
Il DGX Spark si apprezza meglio confrontandolo con le alternative già trattate sul sito. Queste guide permettono di approfondire la riflessione:
- Quale LLM usare su una RTX 5090 (32 GB)?
- Il confronto dettagliato della scheda consumer più veloce, per valutare il compromesso tra velocità di elaborazione e capacità.
- Quale LLM su Mac Studio?
- L'altra grande macchina a memoria unificata, fino a 512 GB — il vero rivale del DGX Spark.
- Scegliere la GPU per l'IA locale
- Per valutare il tuo bisogno di VRAM prima di spendere, e capire dove si colloca ogni opzione.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.