Strix Halo vs DGX Spark : il duello delle macchine 128 GB
Nel 2026, due macchine con 128 GB di memoria unificata si contendono un posto sulla scrivania degli appassionati di LLM locali: il Ryzen AI Max+ 395 di AMD (nome in codice Strix Halo) e il DGX Spark di NVIDIA. Sulla carta, stessa capacità di memoria, stessa promessa: caricare modelli da 70B e grandi MoE senza ricorrere a più GPU. In pratica, il confronto Strix Halo vs DGX Spark si gioca meno sulla generazione di token che sull'elaborazione del prompt, dove il divario raggiunge un fattore 5. Questo confronto presenta i numeri e il prezzo e indica quale scegliere in base al tuo utilizzo reale.
Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda NVIDIA DGX Spark →
Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Due macchine da 128 GB, due filosofie
Il Ryzen AI Max+ 395 è un'APU x86: CPU Zen 5 (16 core), iGPU Radeon 8060S (RDNA 3.5, 40 CU) e NPU XDNA 2, che condividono fino a 128 GB di LPDDR5X su un bus da 256 bit. Si trova in mini-PC (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) e in alcuni laptop. È una piattaforma per il mercato consumer, con Windows o Linux, che esegue Ollama e LM Studio come qualsiasi PC.
Il DGX Spark è una macchina di tutt'altro tipo: un chip GB10 (architettura Grace Blackwell) con una CPU ARM a 20 core e una GPU Blackwell dotata di Tensor Cores, anch'esse abbinate a 128 GB di memoria LPDDR5X unificata. È un dispositivo pensato prima di tutto per l'ecosistema NVIDIA, fornito con DGX OS (una versione personalizzata di Ubuntu) e l'intero stack CUDA. Prezzo ufficiale annunciato: 4.699 dollari.
#1. Le specifiche a confronto
L'aspetto che sorprende di più a prima vista: la larghezza di banda della memoria è quasi identica. Ed è proprio questa a determinare la velocità di generazione dei token. Questo spiega perché, in chat, le due macchine offrano prestazioni molto simili.
- Memoria
- 128 GB di memoria unificata LPDDR5X su entrambe le piattaforme. Sufficienti per un 70B Q4 (~40 GB) più il contesto, oppure un MoE come Qwen3-235B con una quantizzazione aggressiva.
- Larghezza di banda
- Strix Halo: ~256 GB/s teorici (256 bit, LPDDR5X-8000). DGX Spark: ~273 GB/s. Differenza reale trascurabile per la generazione.
- Calcolo su GPU
- Radeon 8060S RDNA 3.5, 40 CU, senza Tensor Cores dedicati. Sul versante Spark: GPU Blackwell con Tensor Cores e supporto FP4 nativo — un ordine di grandezza superiore in potenza di calcolo grezza.
- CPU
- AMD: Zen 5, 16 core x86. NVIDIA: ARM Grace, 20 core. L'architettura x86 rimane più semplice per il software destinato al grande pubblico.
- OS
- Strix Halo: Windows 11 o Linux a scelta. DGX Spark: DGX OS (Ubuntu) con driver e CUDA preinstallati.
- Consumo
- Strix Halo: potenza di 55-120 W a seconda del telaio. DGX Spark: ~240 W assorbiti alla presa sotto carico, alimentatore dedicato.
#2. Token/sec: un confronto serrato
Nel decoding puro, entrambe le macchine sono limitate dalla banda passante della memoria, non dal calcolo. Risultato: numeri simili, con un leggero vantaggio per Spark grazie a una banda passante leggermente superiore e a kernel CUDA estremamente ottimizzati. Ecco misure rappresentative pubblicate dalla comunità nel 2026, in quantizzazione Q4 equivalente, prompt breve.
- Qwen3-30B-A3B (MoE) — Strix Halo
- ~100 tok/s in generazione. Il MoE attiva solo 3B di parametri, da cui l'elevata velocità nonostante le dimensioni.
- Qwen3-30B-A3B (MoE) — DGX Spark
- ~100-115 tok/s. Differenza ridotta: entrambe le macchine sono limitate dalla memoria con questo MoE leggero.
- Modello denso 70B Q4 — Strix Halo
- ~4-5 tok/s. Un 70B denso satura la banda passante; l'utilizzo resta possibile, ma lento.
- Modello denso 70B Q4 — DGX Spark
- ~5-6 tok/s. Anche qui, il limite è la memoria. La differenza si misura in frazioni di token/s.
- Modello 8B Q4 — entrambi
- 50-70 tok/s, una velocità più che sufficiente per una chat interattiva.
La conclusione di questa sezione è controintuitiva: se guardi soltanto i token/sec in chat, le due macchine sono quasi equivalenti e lo Strix Halo — molto meno costoso — sembra vincere. Ma questo numero racconta solo metà della storia.
#3. Elaborazione del prompt: la vera differenza
L'elaborazione del prompt (o prefill) è la fase in cui il modello legge e codifica il tuo prompt di ingresso prima di generare il primo token. A differenza della generazione, questa fase è limitata dal calcolo, non dalla memoria. È qui che i Tensor Cores del DGX Spark fanno tutta la differenza.
- Strix Halo — prefill
- ~340 tok/s di elaborazione prompt su un modello tipico da 30B. L'iGPU RDNA 3.5 non ha unità matriciali dedicate, raggiunge rapidamente il limite.
- DGX Spark — prefill
- circa 5 volte più veloce sugli stessi modelli, grazie ai Tensor Cores Blackwell e al supporto FP4. Con contesti molto lunghi, il divario può aumentare ulteriormente.
Perché è importante? Perché, appena vai oltre una breve chat, il prefill domina il tempo di risposta percepito. Un sistema RAG che inserisce 8.000 token di contesto, un agente che rilegge tutta la propria cronologia a ogni turno, l'analisi di un documento lungo, l'elaborazione in batch: in tutti questi casi, aspetti il prefill prima di vedere qualsiasi risultato.
Esempio concreto: un prompt di 4.000 token. A 340 tok/s, lo Strix Halo impiega circa 12 secondi solo per il prefill prima di iniziare a rispondere. Il DGX Spark, circa 5 volte più veloce, completa la stessa fase in 2-3 secondi. In una sessione RAG intensiva con decine di richieste, questa differenza finisce per dominare l'esperienza d'uso.
#4. Prezzo e disponibilità
È in questo ambito che Strix Halo torna in vantaggio, e non di poco. Il rapporto prezzo/memoria è il suo punto di forza decisivo.
- DGX Spark
- 4.699 dollari, prezzo ufficiale NVIDIA. Disponibilità tramite NVIDIA e partner (Dell, Asus, HP, Lenovo). Destinato a professionisti e sviluppatori.
- Strix Halo — mini-PC
- Framework Desktop, GMKtec EVO-X2, Beelink GTR9: a seconda della configurazione da 128 GB, il prezzo si colloca generalmente tra circa 1.700 e circa 2.500 dollari/euro. Circa la metà del prezzo dello Spark, a parità di memoria.
- Strix Halo — laptop
- Alcuni portatili (es. HP ZBook Ultra, Asus ROG Flow Z13) integrano l'APU, un vantaggio raro per usare LLM con 128 GB di memoria in mobilità.
- Disponibilità
- Strix Halo è liberamente acquistabile presso diversi assemblatori dalla metà del 2026. Il DGX Spark segue un calendario NVIDIA con maggiori vincoli a seconda delle regioni.
#5. Ecosistema software
Al di là dell'hardware, lo stack software incide molto sulla facilità d'uso quotidiana — ed è qui che NVIDIA sfrutta gli anni di vantaggio accumulati con CUDA.
- DGX Spark — CUDA
- Tutto l'ecosistema NVIDIA funziona nativamente: vLLM, TensorRT-LLM, PyTorch, i container NGC. Per il fine-tuning, il serving in batch o la ricerca, è l'ambiente meglio documentato e collaudato.
- Strix Halo — ROCm / Vulkan
- L'inferenza funziona bene tramite Ollama e llama.cpp (backend Vulkan o ROCm). Il fine-tuning e i framework avanzati richiedono ancora più lavoro manuale su RDNA 3.5 rispetto a CUDA.
- Semplicità per l'utente comune
- Vantaggio Strix Halo per l'utente comune: Windows, Ollama in un solo comando, LM Studio con un clic. Spark richiede di essere a proprio agio su Linux/Ubuntu.
- Serving per più client
- Vantaggio DGX Spark: vLLM e TensorRT-LLM offrono batching e un throughput aggregato nettamente superiori per servire un team o un'app.
#6. Quale profilo per quale macchina
- 01Usi soprattutto la chat locale e modelli MoEStrix Halo. I token/sec in generazione sono al livello di Spark, il prezzo è la metà e Windows + Ollama rendono l'uso semplicissimo. Un Qwen3-30B-A3B a circa 100 t/s è un ottimo modello per l'uso quotidiano.
- 02Stai costruendo un RAG o agenti con un contesto lungoDGX Spark. L'elaborazione del prompt, 5 volte più veloce, trasforma l'esperienza quando inserisci ripetutamente contesti di grandi dimensioni. È lo scenario in cui il sovrapprezzo si giustifica.
- 03Vuoi fare fine-tuning o ricercaDGX Spark. Lo stack CUDA (PyTorch, TensorRT-LLM, container NGC) dispone di strumenti incomparabilmente migliori rispetto a ROCm su APU per l'addestramento.
- 04Stai cercando il migliore rapporto memoria/euroStrix Halo, senza esitare. 128 GB di memoria unificata (prezzo molto variabile, da verificare), generalmente più economico dello Spark, con la versatilità x86 di un vero PC desktop.
- 05Vuoi 128 GB in mobilitàStrix Halo, tramite un laptop dotato di APU — una categoria che il DGX Spark, dispositivo desktop, non copre.
#Verdetto
Verdetto netto: ex aequo. Questo duello non ha un unico vincitore, e non è un espediente retorico — è il risultato delle misurazioni. I due chip offrono 128 GB di memoria unificata e una velocità di generazione comparabile; ciascuno vince metà del confronto. Strix Halo prevale nel rapporto prezzo/memoria, nella versatilità (è anche un eccellente PC) e nella chat interattiva; GB10 prevale nell'elaborazione del prompt, nel fine-tuning, nel clustering e nell'ecosistema CUDA. Due filosofie, due vincitori — l'unica perdente è la GPU classica con VRAM limitata.
- Il numero che inganna
- ~100 tok/s in generazione per entrambi su Qwen3-30B → sembra un pareggio, con un vantaggio di prezzo per Strix Halo.
- Il numero che fa la differenza
- Elaborazione del prompt ~340 tok/s (Strix Halo) contro ~5 volte più (DGX Spark). È lui a decidere appena si lascia il chat breve.
- La regola semplice
- Contesto breve + budget limitato → Strix Halo. Contesto lungo, agenti, RAG, fine-tuning → DGX Spark.
#Domande frequenti
Strix Halo o DGX Spark: quale scegliere nel 2026?+
Perché un verdetto di parità e non un vincitore?+
Perché la generazione di testo è simile su entrambi?+
Qual è la differenza reale di prezzo?+
#Per approfondire
Per analizzare ogni macchina e il contesto hardware intorno a questo duello:
- Ryzen AI Max+ 395 (Strix Halo)
- La guida dedicata all'APU AMD: mini-PC e laptop disponibili, modelli 70B+ accessibili e prestazioni reali rispetto alle GPU dedicate e ai Mac.
- NVIDIA DGX Spark
- Il mini-PC IA da 128 GB analizzato a confronto con le GPU tradizionali: riferimenti sulle prestazioni, casi d'uso e limiti.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per capire perché un 70B entra in 40 GB in Q4 e cosa costa ogni livello in termini di qualità su queste macchine a memoria unificata.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.