Intermedio 14 minConfronto

Strix Halo vs DGX Spark : il duello delle macchine 128 GB

Nel 2026, due macchine con 128 GB di memoria unificata si contendono un posto sulla scrivania degli appassionati di LLM locali: il Ryzen AI Max+ 395 di AMD (nome in codice Strix Halo) e il DGX Spark di NVIDIA. Sulla carta, stessa capacità di memoria, stessa promessa: caricare modelli da 70B e grandi MoE senza ricorrere a più GPU. In pratica, il confronto Strix Halo vs DGX Spark si gioca meno sulla generazione di token che sull'elaborazione del prompt, dove il divario raggiunge un fattore 5. Questo confronto presenta i numeri e il prezzo e indica quale scegliere in base al tuo utilizzo reale.

Stai scegliendo un computer? Le nostre scelte per budget → · La nostra scheda NVIDIA DGX Spark →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Due macchine da 128 GB, due filosofie

Il Ryzen AI Max+ 395 è un'APU x86: CPU Zen 5 (16 core), iGPU Radeon 8060S (RDNA 3.5, 40 CU) e NPU XDNA 2, che condividono fino a 128 GB di LPDDR5X su un bus da 256 bit. Si trova in mini-PC (Framework Desktop, GMKtec EVO-X2, Beelink GTR9) e in alcuni laptop. È una piattaforma per il mercato consumer, con Windows o Linux, che esegue Ollama e LM Studio come qualsiasi PC.

Il DGX Spark è una macchina di tutt'altro tipo: un chip GB10 (architettura Grace Blackwell) con una CPU ARM a 20 core e una GPU Blackwell dotata di Tensor Cores, anch'esse abbinate a 128 GB di memoria LPDDR5X unificata. È un dispositivo pensato prima di tutto per l'ecosistema NVIDIA, fornito con DGX OS (una versione personalizzata di Ubuntu) e l'intero stack CUDA. Prezzo ufficiale annunciato: 4.699 dollari.

i
Stessa memoria, obiettivi opposti
Strix Halo punta sul prezzo e sulla versatilità x86; il DGX Spark punta sulle prestazioni di calcolo e sull'ecosistema CUDA. Entrambi caricano gli stessi modelli di grandi dimensioni, ma li eseguono a velocità diverse e con budget diversi.

#1. Le specifiche a confronto

L'aspetto che sorprende di più a prima vista: la larghezza di banda della memoria è quasi identica. Ed è proprio questa a determinare la velocità di generazione dei token. Questo spiega perché, in chat, le due macchine offrano prestazioni molto simili.

Memoria
128 GB di memoria unificata LPDDR5X su entrambe le piattaforme. Sufficienti per un 70B Q4 (~40 GB) più il contesto, oppure un MoE come Qwen3-235B con una quantizzazione aggressiva.
Larghezza di banda
Strix Halo: ~256 GB/s teorici (256 bit, LPDDR5X-8000). DGX Spark: ~273 GB/s. Differenza reale trascurabile per la generazione.
Calcolo su GPU
Radeon 8060S RDNA 3.5, 40 CU, senza Tensor Cores dedicati. Sul versante Spark: GPU Blackwell con Tensor Cores e supporto FP4 nativo — un ordine di grandezza superiore in potenza di calcolo grezza.
CPU
AMD: Zen 5, 16 core x86. NVIDIA: ARM Grace, 20 core. L'architettura x86 rimane più semplice per il software destinato al grande pubblico.
OS
Strix Halo: Windows 11 o Linux a scelta. DGX Spark: DGX OS (Ubuntu) con driver e CUDA preinstallati.
Consumo
Strix Halo: potenza di 55-120 W a seconda del telaio. DGX Spark: ~240 W assorbiti alla presa sotto carico, alimentatore dedicato.

#2. Token/sec: un confronto serrato

Nel decoding puro, entrambe le macchine sono limitate dalla banda passante della memoria, non dal calcolo. Risultato: numeri simili, con un leggero vantaggio per Spark grazie a una banda passante leggermente superiore e a kernel CUDA estremamente ottimizzati. Ecco misure rappresentative pubblicate dalla comunità nel 2026, in quantizzazione Q4 equivalente, prompt breve.

Qwen3-30B-A3B (MoE) — Strix Halo
~100 tok/s in generazione. Il MoE attiva solo 3B di parametri, da cui l'elevata velocità nonostante le dimensioni.
Qwen3-30B-A3B (MoE) — DGX Spark
~100-115 tok/s. Differenza ridotta: entrambe le macchine sono limitate dalla memoria con questo MoE leggero.
Modello denso 70B Q4 — Strix Halo
~4-5 tok/s. Un 70B denso satura la banda passante; l'utilizzo resta possibile, ma lento.
Modello denso 70B Q4 — DGX Spark
~5-6 tok/s. Anche qui, il limite è la memoria. La differenza si misura in frazioni di token/s.
Modello 8B Q4 — entrambi
50-70 tok/s, una velocità più che sufficiente per una chat interattiva.
→
Il MoE è l'alleato dei 128 GB
Un modello Mixture-of-Experts come Qwen3-30B-A3B esegue i calcoli solo con i suoi esperti attivi a ogni token. Su queste due macchine, è il punto di equilibrio ideale: un modello grande caricato in memoria, ma con la velocità di un modello piccolo. Privilegia i MoE se vuoi qualità E un'elevata velocità di generazione.

La conclusione di questa sezione è controintuitiva: se guardi soltanto i token/sec in chat, le due macchine sono quasi equivalenti e lo Strix Halo — molto meno costoso — sembra vincere. Ma questo numero racconta solo metà della storia.

#3. Elaborazione del prompt: la vera differenza

L'elaborazione del prompt (o prefill) è la fase in cui il modello legge e codifica il tuo prompt di ingresso prima di generare il primo token. A differenza della generazione, questa fase è limitata dal calcolo, non dalla memoria. È qui che i Tensor Cores del DGX Spark fanno tutta la differenza.

Strix Halo — prefill
~340 tok/s di elaborazione prompt su un modello tipico da 30B. L'iGPU RDNA 3.5 non ha unità matriciali dedicate, raggiunge rapidamente il limite.
DGX Spark — prefill
circa 5 volte più veloce sugli stessi modelli, grazie ai Tensor Cores Blackwell e al supporto FP4. Con contesti molto lunghi, il divario può aumentare ulteriormente.

Perché è importante? Perché, appena vai oltre una breve chat, il prefill domina il tempo di risposta percepito. Un sistema RAG che inserisce 8.000 token di contesto, un agente che rilegge tutta la propria cronologia a ogni turno, l'analisi di un documento lungo, l'elaborazione in batch: in tutti questi casi, aspetti il prefill prima di vedere qualsiasi risultato.

!
La trappola del benchmark con prompt brevi
Molti test pubblicano soltanto i token/s in generazione con un prompt di 20 token e concludono che Strix Halo è all'altezza. È vero nella chat, falso nel RAG o nell'uso di agenti. Se il tuo utilizzo comporta l'invio di contesti lunghi, l'elaborazione del prompt sul DGX Spark cambia radicalmente l'esperienza: misura questa fase separatamente prima di acquistare.

Esempio concreto: un prompt di 4.000 token. A 340 tok/s, lo Strix Halo impiega circa 12 secondi solo per il prefill prima di iniziare a rispondere. Il DGX Spark, circa 5 volte più veloce, completa la stessa fase in 2-3 secondi. In una sessione RAG intensiva con decine di richieste, questa differenza finisce per dominare l'esperienza d'uso.

#4. Prezzo e disponibilità

È in questo ambito che Strix Halo torna in vantaggio, e non di poco. Il rapporto prezzo/memoria è il suo punto di forza decisivo.

DGX Spark
4.699 dollari, prezzo ufficiale NVIDIA. Disponibilità tramite NVIDIA e partner (Dell, Asus, HP, Lenovo). Destinato a professionisti e sviluppatori.
Strix Halo — mini-PC
Framework Desktop, GMKtec EVO-X2, Beelink GTR9: a seconda della configurazione da 128 GB, il prezzo si colloca generalmente tra circa 1.700 e circa 2.500 dollari/euro. Circa la metà del prezzo dello Spark, a parità di memoria.
Strix Halo — laptop
Alcuni portatili (es. HP ZBook Ultra, Asus ROG Flow Z13) integrano l'APU, un vantaggio raro per usare LLM con 128 GB di memoria in mobilità.
Disponibilità
Strix Halo è liberamente acquistabile presso diversi assemblatori dalla metà del 2026. Il DGX Spark segue un calendario NVIDIA con maggiori vincoli a seconda delle regioni.
i
Il vero compromesso in termini di prezzo
Per circa il prezzo di un DGX Spark, puoi acquistare un mini-PC Strix Halo da 128 GB E una RTX 4090 da 24 GB a parte. Se ti servono soprattutto chat e modelli che entrano in 24 GB, questa combinazione può superare lo Spark su quasi tutti i fronti, tranne nell'elaborazione dei prompt su modelli molto grandi.

#5. Ecosistema software

Al di là dell'hardware, lo stack software incide molto sulla facilità d'uso quotidiana — ed è qui che NVIDIA sfrutta gli anni di vantaggio accumulati con CUDA.

DGX Spark — CUDA
Tutto l'ecosistema NVIDIA funziona nativamente: vLLM, TensorRT-LLM, PyTorch, i container NGC. Per il fine-tuning, il serving in batch o la ricerca, è l'ambiente meglio documentato e collaudato.
Strix Halo — ROCm / Vulkan
L'inferenza funziona bene tramite Ollama e llama.cpp (backend Vulkan o ROCm). Il fine-tuning e i framework avanzati richiedono ancora più lavoro manuale su RDNA 3.5 rispetto a CUDA.
Semplicità per l'utente comune
Vantaggio Strix Halo per l'utente comune: Windows, Ollama in un solo comando, LM Studio con un clic. Spark richiede di essere a proprio agio su Linux/Ubuntu.
Serving per più client
Vantaggio DGX Spark: vLLM e TensorRT-LLM offrono batching e un throughput aggregato nettamente superiori per servire un team o un'app.

#6. Quale profilo per quale macchina

  1. 01
    Usi soprattutto la chat locale e modelli MoE
    Strix Halo. I token/sec in generazione sono al livello di Spark, il prezzo è la metà e Windows + Ollama rendono l'uso semplicissimo. Un Qwen3-30B-A3B a circa 100 t/s è un ottimo modello per l'uso quotidiano.
  2. 02
    Stai costruendo un RAG o agenti con un contesto lungo
    DGX Spark. L'elaborazione del prompt, 5 volte più veloce, trasforma l'esperienza quando inserisci ripetutamente contesti di grandi dimensioni. È lo scenario in cui il sovrapprezzo si giustifica.
  3. 03
    Vuoi fare fine-tuning o ricerca
    DGX Spark. Lo stack CUDA (PyTorch, TensorRT-LLM, container NGC) dispone di strumenti incomparabilmente migliori rispetto a ROCm su APU per l'addestramento.
  4. 04
    Stai cercando il migliore rapporto memoria/euro
    Strix Halo, senza esitare. 128 GB di memoria unificata (prezzo molto variabile, da verificare), generalmente più economico dello Spark, con la versatilità x86 di un vero PC desktop.
  5. 05
    Vuoi 128 GB in mobilità
    Strix Halo, tramite un laptop dotato di APU — una categoria che il DGX Spark, dispositivo desktop, non copre.

i
Due chip, una stessa rivoluzione
Fermati un secondo a riflettere: nel 2024, far girare un 70B a casa richiedeva un sistema multi-GPU assemblato da un appassionato. Nel 2026, AMD e NVIDIA vendono ciascuna un chip con 128 GB di memoria unificata che lo fa girare in silenzio sotto la tua scrivania. Qualunque schieramento tu scelga, a vincere è stata l'IA locale.

#Verdetto

Verdetto netto: ex aequo. Questo duello non ha un unico vincitore, e non è un espediente retorico — è il risultato delle misurazioni. I due chip offrono 128 GB di memoria unificata e una velocità di generazione comparabile; ciascuno vince metà del confronto. Strix Halo prevale nel rapporto prezzo/memoria, nella versatilità (è anche un eccellente PC) e nella chat interattiva; GB10 prevale nell'elaborazione del prompt, nel fine-tuning, nel clustering e nell'ecosistema CUDA. Due filosofie, due vincitori — l'unica perdente è la GPU classica con VRAM limitata.

Il numero che inganna
~100 tok/s in generazione per entrambi su Qwen3-30B → sembra un pareggio, con un vantaggio di prezzo per Strix Halo.
Il numero che fa la differenza
Elaborazione del prompt ~340 tok/s (Strix Halo) contro ~5 volte più (DGX Spark). È lui a decidere appena si lascia il chat breve.
La regola semplice
Contesto breve + budget limitato → Strix Halo. Contesto lungo, agenti, RAG, fine-tuning → DGX Spark.
→
Prova il tuo carico reale, non un benchmark generico
Prima di acquistare, cronometra l'esecuzione del tuo prompt tipico: lunghezza dell'input, frequenza delle richieste, dimensione del modello desiderato. Se i tuoi prompt superano regolarmente qualche migliaio di token, l'elaborazione dei prompt sullo Spark ne giustifica il prezzo. Altrimenti, Strix Halo è la scelta razionale.

#Domande frequenti

Strix Halo o DGX Spark: quale scegliere nel 2026?+
Ex aequo: la scelta dipende dal tuo profilo, non da una classifica. Prompt brevi, chat, assistenza nella programmazione, budget limitato, necessità di un PC versatile: Strix Halo. Prompt lunghi, fine-tuning, workflow CUDA, intenzione di creare un cluster: GB10/DGX Spark. A parità d'uso, chi sceglie l'uno o l'altro non rimpiangerà l'alternativa.
Perché un verdetto di parità e non un vincitore?+
Perché le due piattaforme condividono lo stesso limite strutturale — una banda passante di memoria nell'ordine di 256-273 GB/s che limita la velocità di generazione — e si distinguono in base a criteri contrapposti (prezzo e versatilità contro potenza di calcolo ed ecosistema). Designare un unico vincitore significherebbe decidere al posto tuo quale uso farne.
Perché la generazione di testo è simile su entrambi?+
La generazione token per token è limitata dalla larghezza di banda della memoria, non dalla potenza di calcolo. Con ~256 GB/s (Strix Halo) contro ~273 GB/s (GB10), i due sistemi leggono il modello a velocità simili: da qui valori comparabili di token/s sullo stesso modello quantizzato. Il divario aumenta invece enormemente nell'elaborazione del prompt, dove la GPU Blackwell domina.
Qual è la differenza reale di prezzo?+
A parità di memoria, il prezzo è circa il doppio: le macchine Strix Halo da 128 GB partono da circa 1.700–2.000 $ (Bosgame, Beelink, Framework), mentre i sistemi GB10 vanno da circa 2.999 $ (Asus Ascent GX10) a circa 3.999 $ (DGX Spark Founders). È il punto centrale dell'argomento a favore di Strix Halo — e ciò che si paga con il GB10 sono CUDA e la capacità di calcolo.

#Per approfondire

Per analizzare ogni macchina e il contesto hardware intorno a questo duello:

Ryzen AI Max+ 395 (Strix Halo)
La guida dedicata all'APU AMD: mini-PC e laptop disponibili, modelli 70B+ accessibili e prestazioni reali rispetto alle GPU dedicate e ai Mac.
NVIDIA DGX Spark
Il mini-PC IA da 128 GB analizzato a confronto con le GPU tradizionali: riferimenti sulle prestazioni, casi d'uso e limiti.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per capire perché un 70B entra in 40 GB in Q4 e cosa costa ogni livello in termini di qualità su queste macchine a memoria unificata.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.