Ryzen AI 9 HX: la NPU da 50 TOPS serve davvero per gli LLM ?
Il Ryzen AI 9 HX 370 sfoggia con orgoglio 50 TOPS sulla sua NPU XDNA 2 — un numero che il marketing di AMD ama sbandierare nei confronti di Intel e Apple. La vera domanda per chi vuole eseguire un LLM locale è: questa NPU serve a qualcosa, oppure bisogna continuare a contare sulla GPU integrata Radeon 890M? Questa guida mette onestamente alla prova lo stack Ryzen AI per i LLM (LM Studio Ryzen AI, Lemonade SDK), lo confronta con l'esecuzione sulla sola CPU e sull'iGPU e dà il verdetto — senza abbellimenti.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Perché un NPU per un LLM locale?
Una NPU (Neural Processing Unit) è un acceleratore dedicato alle operazioni matriciali INT8 e INT4 tipiche dell'inferenza. Sul Ryzen AI 9 HX 370, il blocco XDNA 2 eroga fino a 50 TOPS INT8 con un consumo di circa 2 W. A prima vista, il compromesso è imbattibile per l'uso su un portatile — un LLM che gira senza far partire le ventole e senza scaricare la batteria in 40 minuti.
La parola chiave Ryzen AI 9 HX LLM NPU appare ovunque nelle demo AMD, ma in realtà l'ecosistema software è giovane. La maggior parte degli stack LLM (llama.cpp, Ollama, vLLM) ignora completamente la NPU ed esegue tutto sulla CPU con AVX-512 o sulla GPU integrata tramite Vulkan / ROCm. Per sfruttare XDNA 2, è necessario utilizzare runtime specifici compilati da AMD o dalla comunità.
#XDNA 2 in pratica: cosa dice il silicio
L'architettura XDNA 2 integrata in Strix Point (generazione Ryzen AI 300) raddoppia i TOPS rispetto a XDNA 1 (16 → 50 TOPS) e introduce il supporto nativo per il formato a virgola mobile a blocchi FP8 e FP16. È la prima NPU AMD in grado di gestire un LLM in modo decente, ma con due vincoli importanti.
- Banda passante della memoria
- Il NPU condivide la memoria di sistema (LPDDR5X-7500 o 8000 sulle macchine Strix Point). Si tratta di circa 120-128 GB/s, condivisi con CPU, GPU e sistema operativo. Il NPU non potrà mai sfruttare appieno la sua capacità teorica di calcolo.
- Quantizzazione obbligatoria
- La pipeline ufficiale AMD richiede modelli quantizzati in INT4 o INT8 tramite il formato ONNX ottimizzato. I GGUF Q4_K_M classici non funzionano così come sono: serve una conversione.
- Precompilazione ONNX
- Ogni modello deve essere compilato per XDNA 2 (sottografi assegnati alla NPU, il resto alla CPU). È questo il passaggio che scoraggia il 95 % degli utenti.
- Nessun supporto multiutente
- La NPU può essere utilizzata da un solo processo alla volta. Se un LLM la occupa, nessun'altra IA di Windows (Studio Effects, Recall se lo utilizzi) può servirsene in parallelo.
#Requisiti hardware e software
- CPU
- Ryzen AI 9 HX 370, HX 365 o HX PRO 370 (Strix Point, nome in codice Krackan). I Ryzen AI 7/5 funzionano con un NPU meno potente ma con lo stesso stack software.
- RAM
- Almeno 32 GB di LPDDR5X per un uso confortevole. 64 GB se vuoi provare un modello 14B sull'iGPU in parallelo.
- OS
- Windows 11 24H2 o successivo. Esistono driver Linux per le NPU XDNA (il driver è integrato nel kernel upstream dalla versione 6.11), ma gli strumenti disponibili nello spazio utente sono molto indietro.
- Driver NPU
- AMD Ryzen AI Software 1.3 o successivo (download separato su amd.com, non incluso nel driver Adrenalin).
- Archiviazione
- ~20 GB liberi per i modelli ONNX precompilati (più voluminosi dei loro equivalenti GGUF).
#1. LM Studio Ryzen AI: la via più semplice
AMD distribuisce un fork ufficiale di LM Studio preconfigurato per XDNA 2. È il percorso consigliato per chi vuole provare senza toccare Python né ONNX Runtime.
- 01Scaricare il binarioVai su amd.com/lmstudio (pagina ufficiale « LM Studio for Ryzen AI »). Il binario Windows è firmato AMD.
- 02Installazione classicaL'installatore mette LM Studio in Program Files e configura automaticamente il runtime ONNX RyzenAI Execution Provider.
- 03Scegliere un modello ottimizzato per NPUNella scheda Discover, filtra in base al badge « Ryzen AI ». Troverai Qwen 3.5 9B, Granite 4.2 3B, Granite 4.2 8B precompilati per XDNA 2 (suffisso -hybrid).
- 04Caricare e testareAl caricamento, LM Studio mostra un selettore di runtime: GPU, CPU o «Ryzen AI Hybrid» (NPU + iGPU). Scegli Hybrid per sfruttare la NPU.
- 05Verifica che la NPU sia effettivamente in usoApri Gestione attività → scheda Prestazioni → NPU. La curva deve salire al 60-95% durante la generazione. Se rimane a 0, il runtime è passato alla CPU.
#2. Lemonade SDK: per andare oltre LM Studio
Lemonade SDK è lo strumento ufficiale di AMD per gli sviluppatori. Ha due obiettivi: (1) compilare i tuoi modelli GGUF/HF nel formato ONNX ibrido, (2) esporre un'API compatibile con OpenAI utilizzabile da Open WebUI, Continue.dev, ecc.
#3. Ripiegare sulla Radeon 890M: spesso la scelta migliore
Il Ryzen AI 9 HX 370 integra anche una iGPU Radeon 890M (RDNA 3.5, 16 CU). Con LM Studio standard o Ollama, questa iGPU è utilizzabile tramite Vulkan e a volte supera la NPU in termini di puro throughput. Ecco come usarla.
- Assegnazione VRAM dinamica
- La Radeon 890M condivide la RAM di sistema. Nel BIOS UEFI cerca « UMA Frame Buffer Size » e imposta almeno 8 GB (16 GB se possibile) prima di qualsiasi test con un LLM.
- Driver
- Adrenalin 24.10 o successivo per beneficiare del percorso Vulkan ottimizzato per il calcolo. I driver OEM Lenovo/Asus sono spesso indietro di 2 versioni.
- ROCm su Linux
- ROCm 6.3+ supporta ufficialmente Strix Point da aprile 2026. Su Ubuntu 24.04 è fattibile, ma l'iGPU rimane limitata dalla banda passante della memoria condivisa.
#Benchmark: NPU vs iGPU vs CPU
Valori approssimativi rilevati su un Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 GB LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt breve (~50 token), generazione di 256 token, temperatura 0.7. Media di 5 esecuzioni.
- Qwen 3.5 9B — CPU AVX-512
- 4,1 tok/s · 28 W per il package · ventola udibile
- Qwen 3.5 9B — Radeon 890M (Vulkan)
- 9,8 tok/s · 35 W package · ventola a regime sostenuto
- Qwen 3.5 9B ibrido — NPU + iGPU (LM Studio Ryzen AI)
- 11,2 tok/s · 18 W per il package · ventola poco rumorosa
- Granite 4.2 3B — solo NPU
- 24 tok/s · 9 W package · ventilatore spento
- Granite 4.2 8B — NPU + iGPU
- 13,5 tok/s · 19 W per il package · ventola poco rumorosa
- Gemma 4 12B — Radeon 890M (Vulkan)
- 4,2 tok/s · 38 W · troppo grande per la sola NPU
#Casi d'uso in cui la NPU eccelle
- Chatbot di assistenza permanente
- Un Granite 4.2 3B o Qwen 3.5 4B su NPU costa circa 5 W e rimane disponibile 24 ore senza impatto significativo sulla batteria. Ideale per l'integrazione in un'app di produttività.
- Riepilogo automatico di email / documenti
- Attività batch breve, contesto di 4-8k token, modelli 3B-8B. Perfetta per la NPU: ventola spenta, elaborazione silenziosa in background mentre lavori.
- Riconoscimento vocale in tempo reale + riassunto
- Whisper (sulla GPU integrata) + Granite 4.2 8B (sulla NPU) in pipeline — possibile proprio perché i due blocchi sono indipendenti.
- Modalità aereo prolungata
- Con alimentazione a batteria, l'uso di NPU + iGPU consente 4-5 ore di utilizzo attivo di un LLM, contro 1 ora e 30 minuti con una configurazione basata solo su CPU/iGPU.
#Insidie e limitazioni da conoscere
- Contesto limitato
- La maggior parte dei modelli precompilati AMD ha un limite di 4096 token di contesto. Per 32k o più, devi ricompilare, e questo consuma molta più memoria.
- Nessun modello > 8B sulla sola NPU
- Oltre gli 8B, anche in INT4, la NPU non ha una larghezza di banda sufficiente. Oltre i 13B, subentra necessariamente l'iGPU.
- Modelli non disponibili
- Qwen 3.5, DeepSeek e Gemma 4 non sono tutti precompilati ufficialmente. Controlla l'hub Ryzen AI prima di acquistare una configurazione pensando di eseguire un modello specifico.
- Aggiornamento di Windows che compromette il funzionamento
- Alcuni aggiornamenti cumulativi di 24H2 hanno temporaneamente disattivato l'enumerazione della NPU. Mantieni aggiornato il pacchetto AMD Ryzen AI Software e controlla Gestione dispositivi dopo ogni aggiornamento cumulativo.
- Nessun fine-tuning
- XDNA 2 esegue solo inferenza. Per addestrare o fare fine-tuning con LoRA, serve una GPU dedicata — punto.
#Per approfondire
Tre percorsi per approfondire, a seconda della tua prossima mossa :
- Comprendere le quantizzazioni
- La NPU XDNA 2 gestisce solo INT4/INT8. La guida «Scegliere la quantizzazione (Q4, Q5, Q8, FP16)» spiega perché Q4_K_M rimane lo standard per CPU/GPU e cosa cambia con INT4 sulla NPU.
- Confrontare con una vera configurazione GPU
- Se sei indeciso tra questo e un computer fisso, la guida «Scegliere la GPU per l'IA locale» confronta RTX 4070, 4090 e M-Max e indica le soglie d'acquisto in base all'uso.
- Configurazione Ollama più classica
- Per restare sullo stack standard con la tua Radeon 890M, la guida all'installazione di Ollama su Windows copre la configurazione Vulkan e la gestione della VRAM/RAM condivisa.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.