Intermedio 13 minNPU

Ryzen AI 9 HX: la NPU da 50 TOPS serve davvero per gli LLM ?

Il Ryzen AI 9 HX 370 sfoggia con orgoglio 50 TOPS sulla sua NPU XDNA 2 — un numero che il marketing di AMD ama sbandierare nei confronti di Intel e Apple. La vera domanda per chi vuole eseguire un LLM locale è: questa NPU serve a qualcosa, oppure bisogna continuare a contare sulla GPU integrata Radeon 890M? Questa guida mette onestamente alla prova lo stack Ryzen AI per i LLM (LM Studio Ryzen AI, Lemonade SDK), lo confronta con l'esecuzione sulla sola CPU e sull'iGPU e dà il verdetto — senza abbellimenti.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Perché un NPU per un LLM locale?

Una NPU (Neural Processing Unit) è un acceleratore dedicato alle operazioni matriciali INT8 e INT4 tipiche dell'inferenza. Sul Ryzen AI 9 HX 370, il blocco XDNA 2 eroga fino a 50 TOPS INT8 con un consumo di circa 2 W. A prima vista, il compromesso è imbattibile per l'uso su un portatile — un LLM che gira senza far partire le ventole e senza scaricare la batteria in 40 minuti.

La parola chiave Ryzen AI 9 HX LLM NPU appare ovunque nelle demo AMD, ma in realtà l'ecosistema software è giovane. La maggior parte degli stack LLM (llama.cpp, Ollama, vLLM) ignora completamente la NPU ed esegue tutto sulla CPU con AVX-512 o sulla GPU integrata tramite Vulkan / ROCm. Per sfruttare XDNA 2, è necessario utilizzare runtime specifici compilati da AMD o dalla comunità.

i
Cosa XDNA 2 sa davvero fare
La NPU è progettata per l'inferenza INT8/INT4 su modelli piccoli con contesto breve. Non sostituisce la GPU per addestrare, eseguire il fine-tuning o far girare un modello 32B. Pensa a un «assistente leggero da 3B–8B che risponde in background», non a una «workstation per l'IA».

#XDNA 2 in pratica: cosa dice il silicio

L'architettura XDNA 2 integrata in Strix Point (generazione Ryzen AI 300) raddoppia i TOPS rispetto a XDNA 1 (16 → 50 TOPS) e introduce il supporto nativo per il formato a virgola mobile a blocchi FP8 e FP16. È la prima NPU AMD in grado di gestire un LLM in modo decente, ma con due vincoli importanti.

Banda passante della memoria
Il NPU condivide la memoria di sistema (LPDDR5X-7500 o 8000 sulle macchine Strix Point). Si tratta di circa 120-128 GB/s, condivisi con CPU, GPU e sistema operativo. Il NPU non potrà mai sfruttare appieno la sua capacità teorica di calcolo.
Quantizzazione obbligatoria
La pipeline ufficiale AMD richiede modelli quantizzati in INT4 o INT8 tramite il formato ONNX ottimizzato. I GGUF Q4_K_M classici non funzionano così come sono: serve una conversione.
Precompilazione ONNX
Ogni modello deve essere compilato per XDNA 2 (sottografi assegnati alla NPU, il resto alla CPU). È questo il passaggio che scoraggia il 95 % degli utenti.
Nessun supporto multiutente
La NPU può essere utilizzata da un solo processo alla volta. Se un LLM la occupa, nessun'altra IA di Windows (Studio Effects, Recall se lo utilizzi) può servirsene in parallelo.

#Requisiti hardware e software

CPU
Ryzen AI 9 HX 370, HX 365 o HX PRO 370 (Strix Point, nome in codice Krackan). I Ryzen AI 7/5 funzionano con un NPU meno potente ma con lo stesso stack software.
RAM
Almeno 32 GB di LPDDR5X per un uso confortevole. 64 GB se vuoi provare un modello 14B sull'iGPU in parallelo.
OS
Windows 11 24H2 o successivo. Esistono driver Linux per le NPU XDNA (il driver è integrato nel kernel upstream dalla versione 6.11), ma gli strumenti disponibili nello spazio utente sono molto indietro.
Driver NPU
AMD Ryzen AI Software 1.3 o successivo (download separato su amd.com, non incluso nel driver Adrenalin).
Archiviazione
~20 GB liberi per i modelli ONNX precompilati (più voluminosi dei loro equivalenti GGUF).
!
Verifica la NPU prima di tutto
In Gestione dispositivi → Processori neurali → "AMD Ryzen AI NPU" deve comparire senza triangolo giallo. Altrimenti hai un driver generico del chipset: installa il pacchetto dedicato AMD Ryzen AI Software.

#1. LM Studio Ryzen AI: la via più semplice

AMD distribuisce un fork ufficiale di LM Studio preconfigurato per XDNA 2. È il percorso consigliato per chi vuole provare senza toccare Python né ONNX Runtime.

  1. 01
    Scaricare il binario
    Vai su amd.com/lmstudio (pagina ufficiale « LM Studio for Ryzen AI »). Il binario Windows è firmato AMD.
  2. 02
    Installazione classica
    L'installatore mette LM Studio in Program Files e configura automaticamente il runtime ONNX RyzenAI Execution Provider.
  3. 03
    Scegliere un modello ottimizzato per NPU
    Nella scheda Discover, filtra in base al badge « Ryzen AI ». Troverai Qwen 3.5 9B, Granite 4.2 3B, Granite 4.2 8B precompilati per XDNA 2 (suffisso -hybrid).
  4. 04
    Caricare e testare
    Al caricamento, LM Studio mostra un selettore di runtime: GPU, CPU o «Ryzen AI Hybrid» (NPU + iGPU). Scegli Hybrid per sfruttare la NPU.
  5. 05
    Verifica che la NPU sia effettivamente in uso
    Apri Gestione attività → scheda Prestazioni → NPU. La curva deve salire al 60-95% durante la generazione. Se rimane a 0, il runtime è passato alla CPU.
Verificare la NPU dalla riga di comando
# Lister les périphériques de calcul disponibles
Get-PnpDevice -Class "ComputeAccelerator" | Format-Table FriendlyName, Status

# Doit afficher : AMD Ryzen AI NPU - OK

#2. Lemonade SDK: per andare oltre LM Studio

Lemonade SDK è lo strumento ufficiale di AMD per gli sviluppatori. Ha due obiettivi: (1) compilare i tuoi modelli GGUF/HF nel formato ONNX ibrido, (2) esporre un'API compatibile con OpenAI utilizzabile da Open WebUI, Continue.dev, ecc.

Installazione Lemonade SDK
# Python 3.11 recommandé
python -m venv .venv
.\.venv\Scripts\Activate.ps1

# Installation du SDK
pip install lemonade-sdk[npu]

# Test : lister les modèles déjà disponibles
lemonade list
Avviare un server compatibile con OpenAI
# Charge Qwen 3.5 9B précompilé en mode hybride NPU+iGPU
lemonade serve --model qwen3.5-9b-instruct-hybrid --port 8000

# L'endpoint http://localhost:8000/v1/chat/completions est désormais utilisable
# par toute app qui parle OpenAI (Open WebUI, Continue, etc.)
→
Compilare un modello personalizzato
Per i tuoi modelli, il comando `lemonade onnx-export --source granite-4.2-8b-instruct --target hybrid` genera una cartella ONNX precompilata. Prevedi 15-30 minuti di compilazione la prima volta e circa 8-12 GB di spazio su disco per un modello 8B in INT4.

#3. Ripiegare sulla Radeon 890M: spesso la scelta migliore

Il Ryzen AI 9 HX 370 integra anche una iGPU Radeon 890M (RDNA 3.5, 16 CU). Con LM Studio standard o Ollama, questa iGPU è utilizzabile tramite Vulkan e a volte supera la NPU in termini di puro throughput. Ecco come usarla.

Ollama su Radeon 890M (Vulkan)
# Installation Ollama Windows (build avec Vulkan)
winget install Ollama.Ollama

# Forcer le backend Vulkan
$env:OLLAMA_VULKAN = "1"

# Lancer un Qwen 3.5 9B
ollama serve
ollama run qwen3.5:9b
Assegnazione VRAM dinamica
La Radeon 890M condivide la RAM di sistema. Nel BIOS UEFI cerca « UMA Frame Buffer Size » e imposta almeno 8 GB (16 GB se possibile) prima di qualsiasi test con un LLM.
Driver
Adrenalin 24.10 o successivo per beneficiare del percorso Vulkan ottimizzato per il calcolo. I driver OEM Lenovo/Asus sono spesso indietro di 2 versioni.
ROCm su Linux
ROCm 6.3+ supporta ufficialmente Strix Point da aprile 2026. Su Ubuntu 24.04 è fattibile, ma l'iGPU rimane limitata dalla banda passante della memoria condivisa.

#Benchmark: NPU vs iGPU vs CPU

Valori approssimativi rilevati su un Asus Zenbook S 14 (Ryzen AI 9 HX 370, 32 GB LPDDR5X-7500, Windows 11 24H2, AMD Ryzen AI Software 1.3, Adrenalin 24.10.1). Prompt breve (~50 token), generazione di 256 token, temperatura 0.7. Media di 5 esecuzioni.

Qwen 3.5 9B — CPU AVX-512
4,1 tok/s · 28 W per il package · ventola udibile
Qwen 3.5 9B — Radeon 890M (Vulkan)
9,8 tok/s · 35 W package · ventola a regime sostenuto
Qwen 3.5 9B ibrido — NPU + iGPU (LM Studio Ryzen AI)
11,2 tok/s · 18 W per il package · ventola poco rumorosa
Granite 4.2 3B — solo NPU
24 tok/s · 9 W package · ventilatore spento
Granite 4.2 8B — NPU + iGPU
13,5 tok/s · 19 W per il package · ventola poco rumorosa
Gemma 4 12B — Radeon 890M (Vulkan)
4,2 tok/s · 38 W · troppo grande per la sola NPU
i
Cosa mostrano questi numeri
Il NPU non è il più veloce in assoluto — l'iGPU può stargli dietro su 7B-8B. Ma a parità di throughput, il NPU consuma 2× meno e scalda 2× meno. È il suo vero valore: mantenere una sessione LLM di 3 ore sulla batteria senza degradazione termica.

#Casi d'uso in cui la NPU eccelle

Chatbot di assistenza permanente
Un Granite 4.2 3B o Qwen 3.5 4B su NPU costa circa 5 W e rimane disponibile 24 ore senza impatto significativo sulla batteria. Ideale per l'integrazione in un'app di produttività.
Riepilogo automatico di email / documenti
Attività batch breve, contesto di 4-8k token, modelli 3B-8B. Perfetta per la NPU: ventola spenta, elaborazione silenziosa in background mentre lavori.
Riconoscimento vocale in tempo reale + riassunto
Whisper (sulla GPU integrata) + Granite 4.2 8B (sulla NPU) in pipeline — possibile proprio perché i due blocchi sono indipendenti.
Modalità aereo prolungata
Con alimentazione a batteria, l'uso di NPU + iGPU consente 4-5 ore di utilizzo attivo di un LLM, contro 1 ora e 30 minuti con una configurazione basata solo su CPU/iGPU.
→
Combina NPU e iGPU in modo intelligente
La modalità «Hybrid» di LM Studio Ryzen AI distribuisce automaticamente i layer: i blocchi Attention sull'NPU (INT4 denso), i FFN sull'iGPU (dove la banda passante della memoria viene sfruttata meglio). È questa modalità a offrire il miglior compromesso tra prestazioni e consumi, non l'NPU da solo.

#Insidie e limitazioni da conoscere

Contesto limitato
La maggior parte dei modelli precompilati AMD ha un limite di 4096 token di contesto. Per 32k o più, devi ricompilare, e questo consuma molta più memoria.
Nessun modello > 8B sulla sola NPU
Oltre gli 8B, anche in INT4, la NPU non ha una larghezza di banda sufficiente. Oltre i 13B, subentra necessariamente l'iGPU.
Modelli non disponibili
Qwen 3.5, DeepSeek e Gemma 4 non sono tutti precompilati ufficialmente. Controlla l'hub Ryzen AI prima di acquistare una configurazione pensando di eseguire un modello specifico.
Aggiornamento di Windows che compromette il funzionamento
Alcuni aggiornamenti cumulativi di 24H2 hanno temporaneamente disattivato l'enumerazione della NPU. Mantieni aggiornato il pacchetto AMD Ryzen AI Software e controlla Gestione dispositivi dopo ogni aggiornamento cumulativo.
Nessun fine-tuning
XDNA 2 esegue solo inferenza. Per addestrare o fare fine-tuning con LoRA, serve una GPU dedicata — punto.
!
La NPU non sostituisce una GPU dedicata
Se il tuo obiettivo è eseguire Qwen 3.6 35B, un modello 70B o fare fine-tuning, il Ryzen AI 9 HX 370 non è la macchina adatta. Un PC fisso con RTX 4070 / 4080 / 4090 resta imbattibile. La NPU è una soluzione per la mobilità — non un sostituto della GPU.

#Per approfondire

Tre percorsi per approfondire, a seconda della tua prossima mossa :

Comprendere le quantizzazioni
La NPU XDNA 2 gestisce solo INT4/INT8. La guida «Scegliere la quantizzazione (Q4, Q5, Q8, FP16)» spiega perché Q4_K_M rimane lo standard per CPU/GPU e cosa cambia con INT4 sulla NPU.
Confrontare con una vera configurazione GPU
Se sei indeciso tra questo e un computer fisso, la guida «Scegliere la GPU per l'IA locale» confronta RTX 4070, 4090 e M-Max e indica le soglie d'acquisto in base all'uso.
Configurazione Ollama più classica
Per restare sullo stack standard con la tua Radeon 890M, la guida all'installazione di Ollama su Windows copre la configurazione Vulkan e la gestione della VRAM/RAM condivisa.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.