NPU: cos'è e serve per un LLM locale ?
Un NPU (Neural Processing Unit) è un processore a basso consumo, integrato nel chip della maggior parte dei portatili venduti dal 2024, dedicato a piccole attività di IA eseguite in modo continuativo: sfocatura dello sfondo, sottotitoli in tempo reale, ricerca di foto. Il suo indicatore di punta, i TOPS, non dice quasi nulla sulla sua capacità di eseguire un LLM locale: la velocità di generazione dipende dalla larghezza di banda della memoria e il NPU condivide la stessa RAM lenta del processore.
Una NPU, acronimo di Neural Processing Unit, è un processore specializzato nei calcoli delle reti neurali, integrato nel chip della maggior parte dei computer portatili venduti dal 2024. Esegue continuamente piccole attività di IA, come la sfocatura dello sfondo o i sottotitoli in tempo reale, consumando pochi watt. Il suo dato di punta, i TOPS, viene usato come argomento di vendita su tutte le etichette dei «PC IA». Al 20 settembre 2026, però, dice ben poco sulla capacità di una macchina di eseguire un LLM in locale. Ecco perché e cosa bisogna guardare al suo posto.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Che cos'è una NPU?
Una rete neurale si riduce, dal punto di vista del calcolo, a immense serie di moltiplicazioni di matrici su numeri a bassa precisione, ripetute miliardi di volte. Un processore classico sa farlo, lentamente, con una manciata di operazioni alla volta. Una scheda grafica lo fa velocemente, in parallelo su migliaia di unità, consumando da decine a centinaia di watt. Una NPU è una porzione di silicio progettata per fare soltanto questo e nient'altro: unità di calcolo fisse per interi a 8 e 4 bit, piccole memorie collocate immediatamente accanto per evitare costosi trasferimenti avanti e indietro e uno scheduler che sposta i dati il meno possibile. Il risultato di questa specializzazione estrema: una velocità di punta modesta rispetto a una GPU, ma un'efficienza per watt nettamente superiore, che conta moltissimo quando il dispositivo è alimentato a batteria.
L'idea è più antica dell'etichetta di marketing che la accompagna oggi. Apple integra un Neural Engine nei suoi iPhone dal 2017 e in tutti i suoi Mac Apple Silicon fin dal loro lancio; i chip Pixel di Google incorporano un blocco TPU da diverse generazioni. Ciò che è realmente cambiato nel 2024 è che Intel, AMD e Qualcomm hanno tutti inserito, nello stesso momento, una NPU di notevole capacità nei loro processori per portatili destinati al grande pubblico, e che Microsoft ha subito subordinato alla sua presenza un'intera gamma di funzioni di Windows, sotto il nome commerciale Copilot+ PC. È questa convergenza, più che la tecnologia stessa, a spiegare l'ondata di etichette «PC IA» sugli scaffali da due anni.
#CPU, GPU, NPU: le differenze
| CPU | GPU | NPU | |
|---|---|---|---|
| Progettato per | Logica generale, bassa latenza | Calcolo massivamente parallelo, grafica | Inferenza di reti neurali, esclusivamente |
| Consumo sotto carico IA | 15 à 125 W | Da 30 W (integrato) a 575 W (RTX 5090) | 1 à 10 W |
| Memoria utilizzata | La RAM del sistema | La propria VRAM, oppure la RAM se integrato | La RAM del sistema |
| Supporto software | Universale | Molto ampio: CUDA, ROCm, Metal, Vulkan | Limitato, specifico di ciascun produttore |
| Ambito d'impiego | L'orchestrazione, i piccoli modelli come soluzione di ripiego | I LLM, la generazione di immagini, l'addestramento | L'IA leggera e sempre attiva, con alimentazione a batteria |
I tre chip sono complementari, non concorrenti: ciascuno esiste perché offre un compromesso diverso tra velocità, consumo e versatilità. Su un «PC IA», la NPU gestisce gli effetti della webcam durante quattro ore di videoconferenza mentre la GPU rimane inattiva, risparmiando una buona parte dell'autonomia della batteria che un uso continuo della GPU avrebbe consumato. Chiedi alla stessa macchina di eseguire un assistente con 14 miliardi di parametri e tutto il lavoro passa alla GPU, perché è lì che si trovano sia la banda passante di memoria necessaria sia un supporto software maturo: nessun runtime rivolto al grande pubblico sa oggi eseguire un LLM di queste dimensioni su una NPU.
#I TOPS: cosa misurano, cosa nascondono
TOPS significa «mille miliardi di operazioni al secondo» (Tera Operations Per Second), quasi sempre misurate con numeri interi a 8 bit per mantenere la comparabilità tra schede tecniche. È una potenza di calcolo di picco, misurata in laboratorio in condizioni favorevoli. Non dice nulla sulla velocità con cui i dati arrivano dalla memoria a queste unità di calcolo, ed è proprio questo che limita un modello linguistico nella pratica: un NPU a corto di dati passa la maggior parte del tempo ad aspettare, che i TOPS siano elevati o meno.
| Famiglia di chip | NPU annunciata | Idoneo per Copilot+ (40 TOPS e oltre) |
|---|---|---|
| Intel Core Ultra serie 1 (Meteor Lake) | ≈ 11 TOPS | No |
| Apple M4 (Neural Engine) | 38 TOPS | Non applicabile (macOS) |
| Qualcomm Snapdragon X Elite e X Plus | 45 TOPS | Sì |
| Intel Core Ultra 200V (Lunar Lake) | 48 TOPS | Sì |
| AMD Ryzen AI 300 | 50 TOPS | Sì |
| AMD Ryzen AI Max+ 395 (Strix Halo) | 50 TOPS | Sì |
| Intel Core Ultra 300 (Panther Lake, CES gennaio 2026) | Fino a 50 TOPS (NPU 5) | Sì |
| AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES gennaio 2026) | Fino a 60 TOPS | Sì |
| Qualcomm Snapdragon X2 Elite (CES gennaio 2026) | 80 TOPS | Sì |
Questa nuova generazione, presentata al CES a gennaio 2026 e già disponibile nei computer portatili in vendita al 28 settembre 2026, porta il valore dichiarato ben oltre la soglia minima di Copilot+: lo Snapdragon X2 Elite quasi raddoppia il punteggio del suo predecessore, arrivando a 80 TOPS contro i 45 precedenti. Nulla di tutto questo cambia la conclusione di questa pagina: l'argomento che segue, sulla larghezza di banda della memoria condivisa, si applica allo stesso modo a questi nuovi chip, per quanto impressionante possa sembrare il loro valore in TOPS sull'etichetta.
#Perché una NPU non accelera i tuoi LLM
Per produrre un solo token, un modello deve rileggere la maggior parte dei suoi pesi in memoria, dal primo all'ultimo parametro attivo. Un modello da 14 miliardi di parametri in Q4 pesa circa 9 GB: generare 20 token al secondo equivale quindi a far transitare 180 GB al secondo tra la memoria e le unità di calcolo. Il calcolo aritmetico stesso, la moltiplicazione vera e propria, ha un costo ridotto rispetto a questo trasferimento continuo. La velocità di generazione dipende quindi dalla larghezza di banda della memoria disponibile, non dalla potenza di calcolo in TOPS o in TFLOPS dichiarata nella scheda prodotto, il che spiega perché due chip con TOPS molto diversi possano scrivere testo esattamente alla stessa velocità.
| Dove si trova il modello | Larghezza di banda | Limite per un modello da 9 GB |
|---|---|---|
| LPDDR5X dei portatili (memoria condivisa dalla NPU e dalla GPU integrata) | ≈ 70–135 GB/s | ≈ 8–15 tok/s |
| Memoria unificata del Ryzen AI Max+ 395 | 256 GB/s | ≈ 28 tok/s |
| RTX 4070 (GDDR6X) | 504 GB/s | ≈ 56 tok/s |
| RTX 5070 Ti (GDDR7) | 896 GB/s | ≈ 100 tok/s |
| RTX 5090 (GDDR7) | 1 792 GB/s | ≈ 200 tok/s |
Una NPU da 50 TOPS, così come una NPU da 80 TOPS presente nei chip più recenti, si trova nella prima riga della tabella. Attinge alla stessa memoria LPDDR5X condivisa con il processore: qualunque sia il numero di TOPS dichiarato, non può fisicamente andare più veloce di quanto questa memoria consenta. Un portatile da 45 TOPS e un portatile da 80 TOPS genereranno quindi testo esattamente alla stessa velocità se la loro memoria rimane identica per capacità e velocità di trasferimento.
Una NPU può davvero aiutare nella lettura del prompt, una fase che richiede soprattutto potenza di calcolo anziché larghezza di banda, perché il modello elabora in una sola volta tutto il testo già presente invece di produrlo parola dopo parola. Le configurazioni ibride che affidano questa lettura alla NPU e la generazione alla GPU integrata riducono l'attesa prima che venga visualizzata la prima parola e il consumo complessivo, su modelli piccoli ben supportati. È un vantaggio in termini di autonomia e reattività percepita, misurabile nella latenza, non un modo per eseguire modelli più grandi o aumentare la velocità di generazione continua del testo.
#Il vero limite: il software
- Ollama, llama.cpp, LM Studio
- Girano sulla GPU o sulla CPU. Su un portatile Copilot+ usano la GPU integrata o il processore e ignorano la NPU.
- Windows
- I modelli integrati di Microsoft e il suo ambiente Foundry Local puntano alla NPU tramite ONNX Runtime, con una selezione di piccoli modelli.
- AMD
- Ryzen AI Software e il server Lemonade eseguono alcuni modelli ONNX in modalità ibrida, usando la NPU e la GPU integrata.
- Intel
- OpenVINO può utilizzare la NPU per i modelli supportati.
- Qualcomm
- La toolchain QNN e AI Hub forniscono modelli già convertiti per la NPU Hexagon.
- Apple
- Core ML utilizza il Neural Engine, ma gli strumenti per LLM realmente utilizzati su Mac (MLX, llama.cpp, Ollama) passano attraverso la GPU, tramite Metal.
Il punto in comune tra tutti questi strumenti: usare la NPU significa scegliere da un breve elenco di modelli già convertiti e validati dal produttore, generalmente da 1 a 8 miliardi di parametri, anziché scaricare un qualsiasi GGUF trovato su Hugging Face ed eseguirlo direttamente. Questa conversione richiede un formato e una catena di strumenti diversi per ogni produttore, il che spiega perché nessun progetto della comunità abbia ancora unificato il supporto alle NPU come llama.cpp ha fatto per le GPU.
- Ryzen AI 9 HX: cosa offre veramente la NPU con un LLM locale
- Snapdragon X Elite: LLM locale su PC ARM
#Che cosa valutare invece prima di acquistare
- 01La memoria che la GPU può utilizzareLa VRAM di una scheda dedicata, oppure la memoria unificata di un Mac o di una macchina Strix Halo. È questa memoria a determinare quali modelli possono essere caricati.
- 02La banda passante di questa memoriaÈ questa a determinare direttamente il numero di token generati al secondo.
- 03Percorso softwareNVIDIA senza alcuna difficoltà, Apple Silicon quasi altrettanto bene, AMD correttamente supportata su Linux.
- 04I TOPS della NPUUtili se vuoi le funzionalità Copilot+ di Windows e una lunga autonomia durante le videoconferenze. Oggi non hanno alcun effetto sui LLM a pesi aperti.
- Hardware per l'IA locale: le nostre schede sui computer
- Mini-PC Ryzen AI Max+ 395: il caso in cui la memoria unificata cambia le cose
- Quale GPU per un LLM locale?
- Microsoft: i dispositivi Copilot+ e la loro NPU
- Fonte: Wikipedia, storia e architettura delle NPU
- Fonte: comunicato AMD, Ryzen AI 400 (CES 2026)
#FAQ
Che cosa significa NPU?+
Una NPU è migliore di una GPU per l'IA?+
Ollama o LM Studio usano la NPU?+
Serve un NPU per eseguire un'IA localmente?+
Quanti TOPS servono?+
I nuovi chip NPU del 2026 cambiano qualcosa per l'IA locale?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.