Intermedio 14 minMini-PC

NVIDIA DGX Spark: il mini-PC IA da 128 GB a confronto con le GPU

Il DGX Spark è la scommessa di NVIDIA sull'IA locale da scrivania: un chip Grace Blackwell, 128 GB di memoria unificata e un formato che trova posto su un angolo del tavolo. Sulla carta, esegue modelli che nessuna scheda grafica consumer può caricare da sola. Questa guida fa il punto sul dgx spark llm nella pratica: cosa entra in memoria, le velocità reali di inferenza e il confronto con una RTX 5090 e un Mac Studio per capire se questo mini-PC merita un posto a casa tua.

Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda NVIDIA DGX Spark →

Di Samir K.·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: NVIDIA DGX Spark.

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Cosa è il DGX Spark

Il DGX Spark è un computer compatto costruito intorno al superchip NVIDIA GB10 Grace Blackwell. Combina sullo stesso chip una GPU Blackwell e una CPU ARM Grace (20 core), collegate a un unico pool di 128 GB di memoria LPDDR5X condivisa tra le due. È questa architettura a memoria unificata — la stessa filosofia di Apple Silicon — a rendere la macchina così interessante per l'IA locale.

Mentre una scheda grafica classica isola la propria VRAM (massimo 24 o 32 GB nei modelli di fascia consumer), il DGX Spark permette alla GPU di indirizzare direttamente i 128 GB. In pratica, il vincolo che blocca tutti quando usano una GPU — «il modello entra nella VRAM?» — scompare quasi. Il fattore limitante diventa la larghezza di banda della memoria, non la capacità.

Chip
NVIDIA GB10 Grace Blackwell (GPU Blackwell + CPU ARM a 20 core)
Memoria
128 GB LPDDR5X unificata, condivisa CPU/GPU
Larghezza di banda
~273 GB/s (LPDDR5X), il vero collo di bottiglia
Rete
ConnectX (200 GbE) per collegare due Spark e puntare a modelli molto grandi
Formato
Mini-PC desktop, ~150 W, silenzioso rispetto a un PC tower multi-GPU
i
Non è un sostituto per i datacenter
Il DGX Spark è pensato per il prototipaggio, il fine-tuning leggero e l'inferenza locale di grandi modelli — non per l'addestramento su larga scala né per l'erogazione del servizio con carichi elevati. NVIDIA lo presenta come una stazione personale per lo sviluppo di IA.

#128 GB unificati: cosa si ottiene

Per avere un'idea, ecco la VRAM approssimativa necessaria per un modello con quantizzazione Q4_K_M, la più comune per l'inferenza locale: un 7B rientra in circa 5 GB, un 14B in circa 9 GB, un 32B in circa 19 GB e un 70B in circa 40 GB. Su una RTX 5090 con i suoi 32 GB, un 70B Q4 quindi non rientra interamente nella VRAM: bisogna trasferirne una parte alla CPU tramite offload, il che fa crollare la velocità.

Con 128 GB di memoria unificata, il DGX Spark carica senza sforzo un 70B in Q4, Q5 o persino Q8, mantiene un margine per un contesto lungo (32k token e oltre) e lascia aperta la possibilità di usare modelli con oltre 100 miliardi di parametri con quantizzazione aggressiva. È la classe di modelli che, finora, richiedeva un Mac Studio di fascia alta oppure un sistema multi-GPU costoso e dai consumi elevati.

70B Q4 (~40 GB)
Agevole, con ampio margine per il contesto
70B Q8 (~75 GB)
Possibile — qualità quasi FP16 su un modello grande
MoE tipo 120B in Q4
Entra in memoria; la banda passante determina la velocità
Vari modelli caricati
Un 32B più un 14B in parallelo per routing o multi-agent
→
La memoria non è la velocità
Caricare un modello e farlo funzionare velocemente sono due cose diverse. I 128 GB garantiscono che il modello trovi spazio in memoria; sono i circa 273 GB/s di larghezza di banda a determinare i token al secondo. Con i modelli molto grandi, aspettati un'inferenza fluida per la lettura, non raffiche di generazione.

#Quali modelli esegue

Il punto di forza del DGX Spark è la fascia 30B–120B, proprio quella in cui le GPU consumer si fermano per mancanza di VRAM. Ecco gli usi tipici per ciascuna famiglia di modelli.

Qwen 3.8 27B
Il modello generalista di punta del 2026 (visione, 262k ctx); su questa macchina gira in Q8 a piena qualità, con un ampio margine di contesto
Qwen 3.6 35B-A3B / Qwen3-Coder 30B
MoE veloci per il ragionamento e il codice, che entrano interamente in memoria anche in Q8
GLM 4.7 Flash (MoE 30B-A3B, MIT)
Eccellente per gli agenti, caricato a piena qualità senza acrobazie
Grande MoE 100B+ quantizzato
Le architetture Mixture-of-Experts sfruttano appieno l'ampia memoria unificata
Modelli multimodali
Gemma 4 e Qwen 3.8 (visione + testo), che richiedono molta memoria, trovano spazio senza compromessi

Per i piccoli modelli (7B–14B), il DGX Spark funziona ovviamente, ma è uno spreco: una RTX 4070 o un Mac mini M4 li fa girare più velocemente e a un costo molto inferiore. La macchina si giustifica solo se punti regolarmente ai modelli di grandi dimensioni.

i
GB10: un superchip da data center a casa
Il cuore dello Spark è il GB10 Grace Blackwell: 20 core ARM (10 Cortex-X925 + 10 A725) saldati a una GPU Blackwell tramite un collegamento NVLink-C2C, circa 1 petaFLOP in FP4 e 128 GB di memoria unificata. È letteralmente l'architettura dei server GB200 ridotta alle dimensioni di un libro tascabile — con l'ecosistema CUDA completo, il che ne fa l'unico ponte diretto tra «sperimentare a casa» e «effettuare il deployment come in produzione».

#Performance reali in inferenza

Nell'inferenza locale contano due valori: la velocità di generazione (token al secondo, ciò che scorre sullo schermo) e il tempo di prefill (il ritardo prima del primo token, che dipende dalla lunghezza del prompt). La banda passante della memoria determina soprattutto la velocità di generazione.

Sul DGX Spark, un modello 70B in Q4 genera tipicamente una decina di token al secondo — abbastanza per usarlo comodamente come assistente, leggendo il testo man mano che viene generato, meno per carichi di lavoro batch ad alto throughput. I modelli più piccoli (14B–32B) raggiungono velocità nettamente superiori. Questo profilo è coerente con una banda passante di circa 273 GB/s: è il limite che separa il DGX Spark dalle schede GDDR7, molto più veloci sotto questo aspetto.

!
Non confrontare i token/sec fuori contesto
Un valore in token/sec ha senso solo insieme al modello esatto, alla quantizzazione, alla dimensione del contesto e al motore di inferenza. I valori sopra sono ordini di grandezza per orientarsi, non garanzie. Misura le prestazioni sul tuo carico di lavoro prima di decidere un acquisto.

#DGX Spark vs RTX 5090

È il confronto più eloquente e contrappone due filosofie. La RTX 5090 offre 32 GB di VRAM GDDR7 con una larghezza di banda di circa 1792 GB/s: una velocità della memoria circa sei-sette volte superiore a quella del DGX Spark. Con tutto ciò che rientra nei suoi 32 GB, la 5090 surclassa lo Spark in token al secondo.

Ma la 5090 incontra un limite netto: oltre ~32 GB deve trasferire parte del carico alla CPU e le prestazioni crollano. Un modello 70B Q4 (~40 GB) non entra interamente nella sua memoria. Il DGX Spark, invece, gestisce quello stesso 70B senza difficoltà — più lentamente, ma tenendolo tutto in memoria. La scelta si riduce a una domanda: il tuo carico di lavoro sta sotto i 32 GB?

Resti ≤ 32 GB (fino a ~32B Q4)
RTX 5090: molto più veloce e versatile (gioco, rendering, CUDA)
Punti a 70B e oltre
DGX Spark: il modello entra in memoria dove la 5090 non ce la fa
Consumo / rumore
DGX Spark: ~150 W e silenzioso, rispetto a un PC tower con una 5090, caldo e rumoroso
Ecosistema CUDA completo
Entrambi; Spark aggiunge lo stack DGX/NVIDIA completo, da un'estremità all'altra

#DGX Spark vs Mac Studio

Il vero rivale del DGX Spark non è una scheda grafica, è il Mac Studio. I due condividono la stessa idea — una grande quantità di memoria unificata in un case compatto e sobrio — e si rivolgono allo stesso pubblico: gli sviluppatori che vogliono grandi modelli in locale senza assemblare un rig.

Il Mac Studio (M-Ultra) arriva fino a 512 GB di memoria unificata, con una larghezza di banda spesso superiore nelle configurazioni di fascia alta, il che lo rende formidabile con i modelli molto grandi. Il suo punto forte: macOS, Metal e un ecosistema maturo (Ollama, LM Studio, MLX). Il punto forte del DGX Spark: CUDA nativo. Se la tua pipeline dipende da librerie CUDA, da TensorRT o da strumenti NVIDIA, lo Spark parla nativamente la stessa lingua dei tuoi server di produzione.

Memoria massima
Mac Studio fino a 512 GB; DGX Spark 128 GB (estendibile collegando 2 unità)
Ecosistema software
Mac: Metal/MLX maturi; Spark: CUDA nativo, continuità con i server NVIDIA
Portabilità del codice IA
Spark esegue senza difficoltà il codice scritto per GPU NVIDIA nel cloud o nei data center
Uso da ufficio
Il Mac Studio è una postazione di lavoro completa; lo Spark è una stazione dedicata all’IA
i
Il criterio che spesso decide
Se stai prototipando codice destinato a essere eseguito su GPU NVIDIA in produzione, il DGX Spark elimina le sorprese nel porting. Se cerchi soprattutto un'inferenza locale comoda e una macchina versatile, il Mac Studio è più flessibile. Il resto è una questione di banda passante e budget.

#Installarci Ollama

Il DGX Spark gira su una base Linux (DGX OS, derivato da Ubuntu) con lo stack CUDA preinstallato. Ollama vi funziona come su qualsiasi macchina Linux con GPU NVIDIA: il daemon rileva la GPU e serve i modelli sulla sua porta abituale.

  1. 01
    Installare Ollama
    Script ufficiale con un solo comando. Configura il servizio systemd e rileva automaticamente la GPU Blackwell tramite CUDA.
  2. 02
    Verificare il rilevamento della GPU
    Verifica che la GPU venga rilevata correttamente prima di avviare un modello di grandi dimensioni, altrimenti l'inferenza verrebbe eseguita sulla CPU.
  3. 03
    Scaricare un modello di grandi dimensioni
    Scarica un grande MoE del 2026 alla massima qualità (un Qwen3-Coder 30B in Q8, o il modello di punta Qwen 3.8 27B e il suo contesto di 262k) per sfruttare la memoria: è esattamente il caso d'uso previsto per questa macchina.
  4. 04
    Avviare e collegare un'interfaccia
    Il daemon è in ascolto per impostazione predefinita su http://localhost:11434; configura Open WebUI o LM Studio in modo che si colleghino a questo indirizzo.
Terminale — installazione
# Installer Ollama (Linux / DGX OS)
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier que le GPU Blackwell est détecté
nvidia-smi

# Tirer et lancer un gros MoE 2026 en pleine qualité (exploite la mémoire unifiée)
ollama run qwen3-coder:30b-a3b-q8_0

Il demone Ollama espone un'API compatibile sulla porta 11434. Per sfruttare la memoria, privilegia modelli che le GPU tradizionali non possono caricare da sole e aumenta la finestra di contesto, visto che hai spazio a disposizione. Nota che Qwen 3.8 27B tende a ragionare eccessivamente con l'impostazione di ragionamento predefinita: imposta il suo livello di ragionamento su basso (low) per ottenere risposte più dirette.

Terminale — contesto esteso
# Servir Qwen 3.8 27B avec un grand contexte depuis un Modelfile
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 131072
EOF

ollama create qwen38-128k -f Modelfile
ollama run qwen38-128k
→
Collegare due Spark in cascata
La porta di rete ConnectX 200 GbE consente di collegare due DGX Spark per sommare la memoria e puntare a modelli oltre i 128 GB. È il percorso di espansione previsto da NVIDIA se un solo dispositivo non basta più.

#Un chip, otto macchine: i cloni certificati

NVIDIA ha fatto del GB10 una piattaforma: oltre al suo DGX Spark Founders Edition, sette produttori vendono la stessa base certificata con il proprio marchio. Stesso chip, stessi 128 GB — le differenze riguardano lo storage, lo chassis, il prezzo e il canale di vendita.

Gli 8 sistemi GB10 certificati (agosto 2026)
MacchinaProduttoreDa ricordare
DGX Spark Founders EditionNVIDIAIl riferimento, ~3 999 $
Ascent GX10AsusIl migliore in termini di prezzo (~2 999 $)
Veriton GN100AcerUn unico SKU con 4 TB di spazio di archiviazione
AI TOP ATOMGigabyteFornito con la suite software AI TOP
EdgeXpert MS-C931MSICanale industriale/edge
Pro Max GB10DellCanale aziendale
ThinkStation PGXLenovoCanale workstation
ZGX NanoHPCanale workstation

Un dettaglio che cambia tutto per i modelli più grandi: la porta ConnectX integrata permette di collegare due unità e di eseguire in locale modelli della classe 400B. Nessun'altra macchina destinata al grande pubblico offre questa possibilità.

#Domande frequenti

Che cos'è esattamente il GB10 del DGX Spark?+
Un «superchip»: un processore ARM Grace da 20 core e una GPU Blackwell fabbricati per lavorare insieme, collegati tramite NVLink-C2C (molto più veloce di un bus PCIe), che condividono 128 GB di memoria unificata LPDDR5X. Fornisce circa 1 petaFLOP in FP4 — l'architettura dei server IA di NVIDIA, su scala di un mini-PC.
Qual è la differenza tra il DGX Spark e i suoi cloni Asus, Acer o Gigabyte?+
Nessuna differenza nel chip: gli 8 sistemi includono lo stesso GB10 e gli stessi 128 GB. Le differenze sono lo spazio di archiviazione (fino a 4 TB nei modelli Acer), il case, il software fornito, il supporto e soprattutto il prezzo — l'Asus Ascent GX10 costa circa 1.000 $ in meno rispetto alla Founders Edition.
È possibile veramente eseguire un modello 400B con due macchine?+
Sì, è un caso d'uso ufficiale: due unità collegate tramite la loro porta ConnectX a 200 Gb/s mettono in comune la memoria per servire modelli di classe 400B (i MoE molto grandi di classe 400B+ quantizzati). È una soluzione unica nel mercato consumer: il livello successivo è un server da diverse decine di migliaia di euro.
DGX Spark o macchina Strix Halo?+
Entrambi offrono 128 GB di memoria unificata e una generazione di testo comparabile (le loro larghezze di banda della memoria sono simili). Il GB10 è superiore nell'elaborazione dei prompt, nel fine-tuning e nell'ecosistema CUDA; Strix Halo è superiore per il prezzo (spesso costa la metà), Windows e la versatilità. Il nostro confronto dedicato dà un responso per ciascun profilo — verdetto: parità.
A chi si rivolge una macchina GB10?+
Agli sviluppatori di IA che vogliono realizzare in locale prototipi di ciò che distribuiranno su hardware NVIDIA in produzione, ai team che fanno fine-tuning e a chi punta a modelli molto grandi tramite il clustering. Per la chat e l'assistenza alla programmazione quotidiane, una macchina Strix Halo offre un servizio simile a metà prezzo.

#Per chi questo formato ha senso

Il DGX Spark non è una macchina destinata al grande pubblico. È interessante soprattutto per profili specifici, per i quali il limite della VRAM è il vero problema quotidiano.

Sviluppatori IA con CUDA
Prototipare localmente codice destinato alle GPU NVIDIA di produzione, senza sorprese nel porting
Ricercatori e team R&D
Fine-tuning leggero e inferenza di modelli di grandi dimensioni senza prenotare tempo di utilizzo delle GPU nel cloud
Utenti avanzati di modelli da 70B in su
Chi si scontra continuamente con il limite di 24–32 GB di una scheda consumer
Uffici sensibili al rumore/consumo
Una workstation silenziosa e a basso consumo anziché un rig multi-GPU

Al contrario, se giochi, se esegui soprattutto modelli ≤ 32B o se hai un budget limitato, una RTX 5090 (o persino una 4070/4080) o un Mac mini M4 offrirà un rapporto prestazioni/prezzo molto migliore. Il DGX Spark si giustifica quando la necessità di una grande quantità di memoria ha la priorità sulla velocità di elaborazione pura.

!
L'inganno del numero magico
«128 GB» fa impressione, ma non noleggiare questa capacità per far girare un 8B. Acquista questa macchina per ciò che ti permette davvero di fare — eseguire in locale modelli della fascia 70B–120B — oppure pagherai cara una capacità che non utilizzerai mai.

#Per approfondire

Il DGX Spark si apprezza meglio confrontandolo con le alternative già trattate sul sito. Queste guide permettono di approfondire la riflessione:

Quale LLM usare su una RTX 5090 (32 GB)?
Il confronto dettagliato della scheda consumer più veloce, per valutare il compromesso tra velocità di elaborazione e capacità.
Quale LLM su Mac Studio?
L'altra grande macchina a memoria unificata, fino a 512 GB — il vero rivale del DGX Spark.
Scegliere la GPU per l'IA locale
Per valutare il tuo bisogno di VRAM prima di spendere, e capire dove si colloca ogni opzione.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.