Principiante 10 minConcetti

CUDA: cos'è e serve installarlo per l'IA ?

Risposta diretta

CUDA è la piattaforma software proprietaria che NVIDIA ha lanciato nel 2007 per sfruttare le sue GPU per il calcolo generico, non solo per la grafica. Funziona solo su hardware NVIDIA e costituisce la base di quasi tutti i software di IA. Per l'inferenza con Ollama o LM Studio, basta un driver NVIDIA aggiornato: le librerie CUDA sono già incluse. Il Toolkit completo serve soltanto per compilare codice dai sorgenti.

CUDA è la piattaforma software di NVIDIA che permette di utilizzare una scheda grafica per calcoli di uso generale, e non più soltanto per visualizzare immagini. Lanciata nel 2007, funziona solo su hardware NVIDIA. Quasi tutti i software di IA la scelgono come prima piattaforma di riferimento, il che spiega perché le schede GeForce siano la strada più semplice per l'IA locale. Al 20 settembre 2026, un equivoco resta molto diffuso: per eseguire Ollama o LM Studio, non devi «installare CUDA». Questa pagina spiega che cos'è CUDA, cosa occorre realmente installare e come leggere i numeri di versione.

Di Mohamed Meguedmi·Agg. 2026-09-28·Testato su Windows, macOS e Linux

#CUDA, cos'è?

Una scheda grafica contiene migliaia di piccoli processori progettati per applicare la stessa operazione a moltissimi dati contemporaneamente, anziché eseguire un'operazione complessa alla volta come una CPU. In origine, si potevano sfruttare solo attraverso le interfacce grafiche: bisognava mascherare un calcolo da immagine per farlo passare attraverso la pipeline 3D. CUDA, acronimo di Compute Unified Device Architecture, ha eliminato questo espediente fin dal suo lancio nel 2007. Un programmatore scrive codice ordinario, in C, in C++ o richiamato da Python, e questo viene eseguito direttamente su quei processori, senza passare per il rendering grafico.

Nell'uso comune, «CUDA» indica quattro cose contemporaneamente: il modello di programmazione, il compilatore nvcc, la parte del driver che esegue il codice e un insieme di librerie ottimizzate come cuBLAS per l'algebra lineare e cuDNN per le reti neurali. I framework come PyTorch si basano su queste librerie e le applicazioni di IA si basano a loro volta sui framework: è una struttura a strati successivi, in cui ogni livello nasconde la complessità di quello sottostante. Quando uno strumento si dichiara «compatibile con CUDA», significa concretamente che i suoi calcoli più onerosi, in primo luogo le moltiplicazioni di matrici e le convoluzioni, finiscono per essere eseguiti in queste librerie proprietarie di NVIDIA anziché in codice generico.

#E i 'core CUDA'?

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

È il nome commerciale che NVIDIA dà ai processori paralleli di una GPU, le sue unità di calcolo di base. Una RTX 4060 ne conta 3.072, una RTX 5090 ne conta 21.760, quasi sette volte di più, secondo le schede tecniche del produttore. Più core significano più calcoli al secondo, un fattore che incide direttamente sulla generazione di immagini, sull'addestramento di un modello e sulla lettura del prompt da parte di un LLM, la fase in cui la GPU deve elaborare in una sola volta tutto il testo già scritto.

Questo conta molto meno per ciò che si percepisce maggiormente nell'uso quotidiano di un LLM: la velocità di scrittura, token dopo token. Qui il limite è la velocità con cui i pesi vengono letti in memoria, non quella con cui vengono moltiplicati una volta letti. Una scheda con meno core ma con una VRAM più capiente e più veloce scriverà quindi spesso più rapidamente, nell'uso pratico, di una scheda più potente sulla carta ma con una memoria più limitata.

#Driver, librerie, Toolkit: cosa bisogna installare?

ComponenteCos'èChi ne ha bisogno
Driver NVIDIAFa comunicare il sistema e la scheda; contiene la parte di esecuzione di CUDAChiunque possieda una scheda NVIDIA
Librerie di esecuzionecuBLAS, cuDNN e gli altriGià incluse nella maggior parte delle applicazioni e nei pacchetti PyTorch: quasi mai le installi tu stesso
CUDA ToolkitIl compilatore nvcc, gli header, gli strumenti di profilazioneSolo chi compila codice CUDA, ad esempio llama.cpp dalle sorgenti
→
In sintesi
Per Ollama, LM Studio, ComfyUI Desktop o un semplice pip install torch: aggiorna il driver, e basta. Installare il Toolkit da diversi gigabyte «per ogni evenienza» è il passaggio inutile più frequente nei tutorial di IA locale.

#Leggi i numeri di versione

Due comandi, due informazioni diverse
nvidia-smi        # version du pilote, et version MAXIMALE de CUDA qu'il sait exécuter
nvcc --version    # version du Toolkit, s'il est installé

Questi due numeri differiscono legittimamente, e il primo inganna quasi tutti. Quando nvidia-smi mostra « CUDA Version: 13.0 », significa che il driver può eseguire software compilato per CUDA fino alla versione 13.0. Non significa che il Toolkit sia installato. E un software compilato per una versione più vecchia di CUDA funziona senza problemi con un driver recente.

i
CUDA 13 ha cambiato un'abitudine
Per CUDA 13.x, NVIDIA richiede un driver versione 580 o successiva, secondo le sue note di rilascio ufficiali. Inoltre, a partire dalla stessa versione 13.0, il driver video di Windows non è più incluso nel pacchetto del Toolkit: ora bisogna installarlo separatamente dal sito NVIDIA. È una causa frequente di errori di compilazione per chi riutilizza un vecchio pacchetto del Toolkit scaricato prima di questo cambiamento.

#Capacità di calcolo, generazione per generazione

Ogni GPU NVIDIA ha un numero di «capacità di calcolo» (compute capability) che identifica la sua architettura e le istruzioni che supporta nativamente. I software vengono compilati per capacità specifiche, generalmente un intervallo di versioni coperto da uno stesso pacchetto, e i progetti abbandonano regolarmente il supporto per quelle più vecchie con il susseguirsi degli aggiornamenti. È questo, molto più della velocità di calcolo pura, a mettere fine alla carriera di una scheda nell'IA locale: una RTX 2060 continua a funzionare fisicamente per anni dopo l'acquisto, ma alcuni strumenti recenti non si lasciano installare su di essa perché manca il codice compilato per la sua generazione.

Schede tratte dal database hardware QuelLLM · 20/09/2026
GenerazioneSchedeCapacità di calcoloSituazione dell'IA locale nel 2026
PascalGTX 1060, 1070, 1080 Ti6.1Consente di eseguire gli strumenti basati su llama.cpp; nessuna accelerazione FP16; supporto abbandonato da alcuni framework recenti
TuringGTX 1660, da RTX 2060 a 2080 Ti7.5Minimo richiesto da vLLM (7.0); buona compatibilità
AmpereDalla RTX 3050 alla 3090 Ti8.6Pienamente supportata; introduce il BF16
Ada LovelaceDa RTX 4060 a RTX 40908.9Pienamente supportata; introduce il supporto FP8
BlackwellRTX 5050 a 509012.0Pieno supporto da parte dei software recenti; le versioni precedenti devono essere aggiornate o ricompilate; introduce il FP4

L'ultima riga spiega l'ondata di messaggi «la mia RTX 50 non viene rilevata»: un binario compilato prima dell'esistenza di questa architettura non contiene alcun codice per la capacità di calcolo 12.0. La soluzione è una versione più recente dello strumento, oppure una versione di PyTorch compilata per una versione recente di CUDA.

!
La trappola «Blackwell»: due famiglie incompatibili con lo stesso nome
NVIDIA vende due chip diversi con il nome Blackwell e confonderli compromette un'installazione. Le GeForce RTX 50 destinate al grande pubblico usano la capacità di calcolo 12.x (sm_120). Le schede per datacenter B100 e B200 usano la capacità 10.x (sm_100). Si tratta di due famiglie distinte: un binario compilato per sm_100 non può essere eseguito su una RTX 5090, e viceversa. Se un tutorial di fine-tuning menziona «Blackwell» senza specificare sm_120 o sm_100, verifica prima di installare un pacchetto precompilato: è una fonte frequente di errori «no kernel image is available» sulle schede più recenti destinate al grande pubblico.

#CUDA contro ROCm, Metal e Vulkan

PiattaformaProduttoreHardwareStato per gli LLM locali
CUDANVIDIAGPU NVIDIALa piattaforma di riferimento: tutti la supportano per prima
ROCmAMDRadeon recenti e InstinctBuono su Linux sulle schede supportate; lista di schede più ristretta
MetalAppleApple SiliconEccellente con llama.cpp e MLX
VulkanKhronos, standard apertoQuasi tutte le GPU, incluse quelle integrateFunziona praticamente ovunque con llama.cpp; in generale più lento della soluzione nativa
SYCL / oneAPIIntelIntel Arc e GPU integrateFunzionale, con l'ecosistema più ridotto

Il vantaggio di CUDA non dipende dal fatto che le altre piattaforme sarebbero incapaci di eseguire i calcoli. Dipende da quasi vent'anni di librerie, strumenti e codice collaudato, sviluppati dal 2007, una GPU dopo l'altra, secondo la pagina ufficiale del progetto. Per l'inferenza con gli strumenti comuni, il divario si è molto ridotto: llama.cpp funziona sulle cinque piattaforme, con prestazioni simili a parità di quantizzazione su hardware comparabile. Per l'addestramento, il fine-tuning e il codice di ricerca appena pubblicato su GitHub, invece, CUDA resta l'unica strada che funziona fin dal primo giorno: è quasi sempre la prima piattaforma di destinazione, talvolta l'unica, dei repository che accompagnano un nuovo articolo scientifico, spesso diversi mesi prima che compaia un porting verso le altre piattaforme, ammesso che compaia mai.

#Cosa cambia quando si acquista

Vuoi che tutto funzioni senza dover risolvere problemi tecnici
Prendi una scheda NVIDIA e dai priorità alla capacità della VRAM rispetto al numero di core CUDA indicato sulla confezione: è questa a determinare se un modello si carica, non la potenza di calcolo bruta.
Esegui soprattutto modelli GGUF in Ollama o LM Studio
Un Mac Apple Silicon, o una Radeon recente su Linux con ROCm, è una scelta legittima: llama.cpp supporta adeguatamente entrambe le piattaforme e perdi poco in termini di comodità d'uso quotidiana.
Prevedi di fare fine-tuning, utilizzare vLLM o seguire repository di ricerca
L'assenza di CUDA ti costerà tempo ogni settimana, tra le dipendenze che non si compilano e i notebook pubblicati dando per scontata la disponibilità di una GPU NVIDIA.
Acquisti una scheda usata
Evita qualsiasi scheda con una compute capability inferiore a 7.5, indipendentemente dal prezzo indicato: oltre alla lentezza, alcuni framework recenti si rifiutano categoricamente di installarsi.

#FAQ

Che cosa significa CUDA?+
Compute Unified Device Architecture. NVIDIA l'ha lanciata nel 2007 per consentire di programmare le sue GPU per impieghi generali, con linguaggi come C, C++ o Python, e non più soltanto di controllarle attraverso un'interfaccia grafica. È stato questo passaggio a rendere possibile, un decennio più tardi, l'essor del deep learning su scheda grafica, poiché in precedenza bisognava mascherare ogni calcolo da operazione di visualizzazione per eseguirlo su una GPU.
Serve installare CUDA per far funzionare un'IA localmente?+
In generale no. Ollama, LM Studio e le applicazioni simili includono già le librerie CUDA di cui hanno bisogno per l'inferenza: basta un driver NVIDIA aggiornato, non c'è altro da scaricare. Il CUDA Toolkit completo, che pesa diversi gigabyte, è necessario solo per compilare un software a partire dal codice sorgente, ad esempio llama.cpp con l'accelerazione GPU attivata manualmente.
CUDA funziona su una scheda AMD o Intel?+
No, mai: CUDA è una tecnologia proprietaria che funziona solo su hardware NVIDIA, per una scelta commerciale del produttore. L'equivalente di AMD si chiama ROCm, quello di Apple è Metal, quello di Intel è oneAPI, e Vulkan resta l'opzione compatibile con più produttori, supportata dalla maggior parte degli strumenti basati su llama.cpp, anche su hardware meno recente o GPU integrate.
Perché nvidia-smi e nvcc non mostrano la stessa versione?+
nvidia-smi indica la versione massima di CUDA che il driver installato è in grado di eseguire, non ciò che è realmente installato sul computer. nvcc, invece, indica la versione del CUDA Toolkit effettivamente presente, se ce n'è uno. I due numeri sono indipendenti e un software compilato per una versione precedente di CUDA continua a funzionare senza problemi con un driver più recente.
Avere più core CUDA è meglio per un LLM?+
Questo accelera soprattutto la lettura del prompt e la generazione di immagini, due attività che richiedono molta potenza di calcolo pura. La velocità con cui un LLM scrive, ciò che si percepisce maggiormente durante l'uso, dipende invece soprattutto dalla capacità e dalla larghezza di banda della memoria della scheda: per i modelli linguistici eseguiti in locale, la VRAM conta quindi spesso più del numero grezzo di core CUDA dichiarato.
Le RTX 50 e le schede Blackwell per datacenter hanno la stessa compute capability?+
No, e questa confusione compromette spesso un'installazione. Le GeForce RTX 50 destinate al grande pubblico utilizzano la compute capability 12.x (sm_120); le schede per datacenter B100 e B200 utilizzano la 10.x (sm_100). Un binario o un pacchetto precompilato per l'una non può essere eseguito sull'altra: un tutorial di fine-tuning che menziona solo «Blackwell» senza specificare quale va verificato prima di installare qualsiasi cosa.

Hardware consigliato: RTX 5070 Ti 16 GB — scheda NVIDIA recente con 16 GB di VRAM, supporto CUDA. Tutto l'hardware per l'IA →

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.