Principiante 11 minNPU

NPU: cos'è e serve per un LLM locale ?

Risposta diretta

Un NPU (Neural Processing Unit) è un processore a basso consumo, integrato nel chip della maggior parte dei portatili venduti dal 2024, dedicato a piccole attività di IA eseguite in modo continuativo: sfocatura dello sfondo, sottotitoli in tempo reale, ricerca di foto. Il suo indicatore di punta, i TOPS, non dice quasi nulla sulla sua capacità di eseguire un LLM locale: la velocità di generazione dipende dalla larghezza di banda della memoria e il NPU condivide la stessa RAM lenta del processore.

Una NPU, acronimo di Neural Processing Unit, è un processore specializzato nei calcoli delle reti neurali, integrato nel chip della maggior parte dei computer portatili venduti dal 2024. Esegue continuamente piccole attività di IA, come la sfocatura dello sfondo o i sottotitoli in tempo reale, consumando pochi watt. Il suo dato di punta, i TOPS, viene usato come argomento di vendita su tutte le etichette dei «PC IA». Al 20 settembre 2026, però, dice ben poco sulla capacità di una macchina di eseguire un LLM in locale. Ecco perché e cosa bisogna guardare al suo posto.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-28·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Che cos'è una NPU?

Una rete neurale si riduce, dal punto di vista del calcolo, a immense serie di moltiplicazioni di matrici su numeri a bassa precisione, ripetute miliardi di volte. Un processore classico sa farlo, lentamente, con una manciata di operazioni alla volta. Una scheda grafica lo fa velocemente, in parallelo su migliaia di unità, consumando da decine a centinaia di watt. Una NPU è una porzione di silicio progettata per fare soltanto questo e nient'altro: unità di calcolo fisse per interi a 8 e 4 bit, piccole memorie collocate immediatamente accanto per evitare costosi trasferimenti avanti e indietro e uno scheduler che sposta i dati il meno possibile. Il risultato di questa specializzazione estrema: una velocità di punta modesta rispetto a una GPU, ma un'efficienza per watt nettamente superiore, che conta moltissimo quando il dispositivo è alimentato a batteria.

L'idea è più antica dell'etichetta di marketing che la accompagna oggi. Apple integra un Neural Engine nei suoi iPhone dal 2017 e in tutti i suoi Mac Apple Silicon fin dal loro lancio; i chip Pixel di Google incorporano un blocco TPU da diverse generazioni. Ciò che è realmente cambiato nel 2024 è che Intel, AMD e Qualcomm hanno tutti inserito, nello stesso momento, una NPU di notevole capacità nei loro processori per portatili destinati al grande pubblico, e che Microsoft ha subito subordinato alla sua presenza un'intera gamma di funzioni di Windows, sotto il nome commerciale Copilot+ PC. È questa convergenza, più che la tecnologia stessa, a spiegare l'ondata di etichette «PC IA» sugli scaffali da due anni.

#CPU, GPU, NPU: le differenze

CPUGPUNPU
Progettato perLogica generale, bassa latenzaCalcolo massivamente parallelo, graficaInferenza di reti neurali, esclusivamente
Consumo sotto carico IA15 à 125 WDa 30 W (integrato) a 575 W (RTX 5090)1 à 10 W
Memoria utilizzataLa RAM del sistemaLa propria VRAM, oppure la RAM se integratoLa RAM del sistema
Supporto softwareUniversaleMolto ampio: CUDA, ROCm, Metal, VulkanLimitato, specifico di ciascun produttore
Ambito d'impiegoL'orchestrazione, i piccoli modelli come soluzione di ripiegoI LLM, la generazione di immagini, l'addestramentoL'IA leggera e sempre attiva, con alimentazione a batteria

I tre chip sono complementari, non concorrenti: ciascuno esiste perché offre un compromesso diverso tra velocità, consumo e versatilità. Su un «PC IA», la NPU gestisce gli effetti della webcam durante quattro ore di videoconferenza mentre la GPU rimane inattiva, risparmiando una buona parte dell'autonomia della batteria che un uso continuo della GPU avrebbe consumato. Chiedi alla stessa macchina di eseguire un assistente con 14 miliardi di parametri e tutto il lavoro passa alla GPU, perché è lì che si trovano sia la banda passante di memoria necessaria sia un supporto software maturo: nessun runtime rivolto al grande pubblico sa oggi eseguire un LLM di queste dimensioni su una NPU.

#I TOPS: cosa misurano, cosa nascondono

TOPS significa «mille miliardi di operazioni al secondo» (Tera Operations Per Second), quasi sempre misurate con numeri interi a 8 bit per mantenere la comparabilità tra schede tecniche. È una potenza di calcolo di picco, misurata in laboratorio in condizioni favorevoli. Non dice nulla sulla velocità con cui i dati arrivano dalla memoria a queste unità di calcolo, ed è proprio questo che limita un modello linguistico nella pratica: un NPU a corto di dati passa la maggior parte del tempo ad aspettare, che i TOPS siano elevati o meno.

Dati dei costruttori · i metodi di misura variano, una differenza di alcuni punti non è significativa
Famiglia di chipNPU annunciataIdoneo per Copilot+ (40 TOPS e oltre)
Intel Core Ultra serie 1 (Meteor Lake)≈ 11 TOPSNo
Apple M4 (Neural Engine)38 TOPSNon applicabile (macOS)
Qualcomm Snapdragon X Elite e X Plus45 TOPSSì
Intel Core Ultra 200V (Lunar Lake)48 TOPSSì
AMD Ryzen AI 30050 TOPSSì
AMD Ryzen AI Max+ 395 (Strix Halo)50 TOPSSì
Intel Core Ultra 300 (Panther Lake, CES gennaio 2026)Fino a 50 TOPS (NPU 5)Sì
AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES gennaio 2026)Fino a 60 TOPSSì
Qualcomm Snapdragon X2 Elite (CES gennaio 2026)80 TOPSSì

Questa nuova generazione, presentata al CES a gennaio 2026 e già disponibile nei computer portatili in vendita al 28 settembre 2026, porta il valore dichiarato ben oltre la soglia minima di Copilot+: lo Snapdragon X2 Elite quasi raddoppia il punteggio del suo predecessore, arrivando a 80 TOPS contro i 45 precedenti. Nulla di tutto questo cambia la conclusione di questa pagina: l'argomento che segue, sulla larghezza di banda della memoria condivisa, si applica allo stesso modo a questi nuovi chip, per quanto impressionante possa sembrare il loro valore in TOPS sull'etichetta.

#Perché una NPU non accelera i tuoi LLM

Per produrre un solo token, un modello deve rileggere la maggior parte dei suoi pesi in memoria, dal primo all'ultimo parametro attivo. Un modello da 14 miliardi di parametri in Q4 pesa circa 9 GB: generare 20 token al secondo equivale quindi a far transitare 180 GB al secondo tra la memoria e le unità di calcolo. Il calcolo aritmetico stesso, la moltiplicazione vera e propria, ha un costo ridotto rispetto a questo trasferimento continuo. La velocità di generazione dipende quindi dalla larghezza di banda della memoria disponibile, non dalla potenza di calcolo in TOPS o in TFLOPS dichiarata nella scheda prodotto, il che spiega perché due chip con TOPS molto diversi possano scrivere testo esattamente alla stessa velocità.

Limite massimo teorico = banda passante ÷ dimensione del modello (Qwen 3 14B in Q4, 9 GB nel catalogo QuelLLM). I sistemi reali si avvicinano a questo limite senza raggiungerlo.
Dove si trova il modelloLarghezza di bandaLimite per un modello da 9 GB
LPDDR5X dei portatili (memoria condivisa dalla NPU e dalla GPU integrata)≈ 70–135 GB/s≈ 8–15 tok/s
Memoria unificata del Ryzen AI Max+ 395256 GB/s≈ 28 tok/s
RTX 4070 (GDDR6X)504 GB/s≈ 56 tok/s
RTX 5070 Ti (GDDR7)896 GB/s≈ 100 tok/s
RTX 5090 (GDDR7)1 792 GB/s≈ 200 tok/s

Una NPU da 50 TOPS, così come una NPU da 80 TOPS presente nei chip più recenti, si trova nella prima riga della tabella. Attinge alla stessa memoria LPDDR5X condivisa con il processore: qualunque sia il numero di TOPS dichiarato, non può fisicamente andare più veloce di quanto questa memoria consenta. Un portatile da 45 TOPS e un portatile da 80 TOPS genereranno quindi testo esattamente alla stessa velocità se la loro memoria rimane identica per capacità e velocità di trasferimento.

Una NPU può davvero aiutare nella lettura del prompt, una fase che richiede soprattutto potenza di calcolo anziché larghezza di banda, perché il modello elabora in una sola volta tutto il testo già presente invece di produrlo parola dopo parola. Le configurazioni ibride che affidano questa lettura alla NPU e la generazione alla GPU integrata riducono l'attesa prima che venga visualizzata la prima parola e il consumo complessivo, su modelli piccoli ben supportati. È un vantaggio in termini di autonomia e reattività percepita, misurabile nella latenza, non un modo per eseguire modelli più grandi o aumentare la velocità di generazione continua del testo.

#Il vero limite: il software

Ollama, llama.cpp, LM Studio
Girano sulla GPU o sulla CPU. Su un portatile Copilot+ usano la GPU integrata o il processore e ignorano la NPU.
Windows
I modelli integrati di Microsoft e il suo ambiente Foundry Local puntano alla NPU tramite ONNX Runtime, con una selezione di piccoli modelli.
AMD
Ryzen AI Software e il server Lemonade eseguono alcuni modelli ONNX in modalità ibrida, usando la NPU e la GPU integrata.
Intel
OpenVINO può utilizzare la NPU per i modelli supportati.
Qualcomm
La toolchain QNN e AI Hub forniscono modelli già convertiti per la NPU Hexagon.
Apple
Core ML utilizza il Neural Engine, ma gli strumenti per LLM realmente utilizzati su Mac (MLX, llama.cpp, Ollama) passano attraverso la GPU, tramite Metal.

Il punto in comune tra tutti questi strumenti: usare la NPU significa scegliere da un breve elenco di modelli già convertiti e validati dal produttore, generalmente da 1 a 8 miliardi di parametri, anziché scaricare un qualsiasi GGUF trovato su Hugging Face ed eseguirlo direttamente. Questa conversione richiede un formato e una catena di strumenti diversi per ogni produttore, il che spiega perché nessun progetto della comunità abbia ancora unificato il supporto alle NPU come llama.cpp ha fatto per le GPU.

#Che cosa valutare invece prima di acquistare

  1. 01
    La memoria che la GPU può utilizzare
    La VRAM di una scheda dedicata, oppure la memoria unificata di un Mac o di una macchina Strix Halo. È questa memoria a determinare quali modelli possono essere caricati.
  2. 02
    La banda passante di questa memoria
    È questa a determinare direttamente il numero di token generati al secondo.
  3. 03
    Percorso software
    NVIDIA senza alcuna difficoltà, Apple Silicon quasi altrettanto bene, AMD correttamente supportata su Linux.
  4. 04
    I TOPS della NPU
    Utili se vuoi le funzionalità Copilot+ di Windows e una lunga autonomia durante le videoconferenze. Oggi non hanno alcun effetto sui LLM a pesi aperti.

#FAQ

Che cosa significa NPU?+
Neural Processing Unit, ovvero unità di elaborazione neurale. È un blocco del processore dedicato all'esecuzione efficiente di reti neurali, presente nella maggior parte dei chip recenti di computer portatili e telefoni, accanto alla CPU e alla GPU. Gestisce continuamente piccole attività di IA, come la sfocatura dello sfondo in videoconferenza, senza far scaldare la batteria né scaricarla rapidamente.
Una NPU è migliore di una GPU per l'IA?+
Consuma nettamente meno energia per piccoli compiti continuativi, nell’ordine di 1–10 W contro 30 W e oltre per una GPU. Una GPU resta molto più veloce e molto meglio supportata dai software per i modelli di grandi dimensioni, gli LLM e i generatori di immagini. Non sono concorrenti: semplicemente non svolgono lo stesso lavoro né operano su modelli delle stesse dimensioni.
Ollama o LM Studio usano la NPU?+
No, al 28 settembre 2026. Vengono eseguiti sulla GPU, tramite CUDA, ROCm, Metal o Vulkan a seconda dell'hardware, o sul processore come ultima risorsa. Utilizzare la NPU richiede gli strumenti specifici di ogni produttore: ONNX Runtime per Windows, Ryzen AI Software per AMD, OpenVINO per Intel, ciascuno con un elenco limitato di modelli già convertiti.
Serve un NPU per eseguire un'IA localmente?+
No, assolutamente no. Qualsiasi macchina dotata di una GPU adeguata o di sufficiente memoria unificata esegue modelli locali senza alcuna NPU, come già accadeva prima del 2024. Quest'ultima è richiesta solo per attivare le funzioni Copilot+ specifiche di Windows, non per Ollama, LM Studio o qualsiasi altro comune strumento di inferenza.
Quanti TOPS servono?+
40 TOPS è la soglia per la certificazione Copilot+ PC di Microsoft. I chip usciti al CES di gennaio 2026, Panther Lake, Ryzen AI 400 e Snapdragon X2 Elite, raggiungono ora 50, 60 e fino a 80 TOPS. Al di sopra della soglia Copilot+, la differenza non ha quasi alcun effetto pratico percepibile, e assolutamente nessuno sulla velocità di generazione di un LLM in locale.
I nuovi chip NPU del 2026 cambiano qualcosa per l'IA locale?+
No, non per gli LLM. Panther Lake, Ryzen AI 400 e Snapdragon X2 Elite fanno aumentare i TOPS dichiarati, ma la NPU continua ad attingere alla stessa memoria di sistema del processore, senza un aumento della larghezza di banda associato. Il collo di bottiglia che limita la velocità di generazione di un modello linguistico rimane esattamente lo stesso della generazione precedente di chip.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.