CUDA: cos'è e serve installarlo per l'IA ?
CUDA è la piattaforma software proprietaria che NVIDIA ha lanciato nel 2007 per sfruttare le sue GPU per il calcolo generico, non solo per la grafica. Funziona solo su hardware NVIDIA e costituisce la base di quasi tutti i software di IA. Per l'inferenza con Ollama o LM Studio, basta un driver NVIDIA aggiornato: le librerie CUDA sono già incluse. Il Toolkit completo serve soltanto per compilare codice dai sorgenti.
CUDA è la piattaforma software di NVIDIA che permette di utilizzare una scheda grafica per calcoli di uso generale, e non più soltanto per visualizzare immagini. Lanciata nel 2007, funziona solo su hardware NVIDIA. Quasi tutti i software di IA la scelgono come prima piattaforma di riferimento, il che spiega perché le schede GeForce siano la strada più semplice per l'IA locale. Al 20 settembre 2026, un equivoco resta molto diffuso: per eseguire Ollama o LM Studio, non devi «installare CUDA». Questa pagina spiega che cos'è CUDA, cosa occorre realmente installare e come leggere i numeri di versione.
#CUDA, cos'è?
Una scheda grafica contiene migliaia di piccoli processori progettati per applicare la stessa operazione a moltissimi dati contemporaneamente, anziché eseguire un'operazione complessa alla volta come una CPU. In origine, si potevano sfruttare solo attraverso le interfacce grafiche: bisognava mascherare un calcolo da immagine per farlo passare attraverso la pipeline 3D. CUDA, acronimo di Compute Unified Device Architecture, ha eliminato questo espediente fin dal suo lancio nel 2007. Un programmatore scrive codice ordinario, in C, in C++ o richiamato da Python, e questo viene eseguito direttamente su quei processori, senza passare per il rendering grafico.
Nell'uso comune, «CUDA» indica quattro cose contemporaneamente: il modello di programmazione, il compilatore nvcc, la parte del driver che esegue il codice e un insieme di librerie ottimizzate come cuBLAS per l'algebra lineare e cuDNN per le reti neurali. I framework come PyTorch si basano su queste librerie e le applicazioni di IA si basano a loro volta sui framework: è una struttura a strati successivi, in cui ogni livello nasconde la complessità di quello sottostante. Quando uno strumento si dichiara «compatibile con CUDA», significa concretamente che i suoi calcoli più onerosi, in primo luogo le moltiplicazioni di matrici e le convoluzioni, finiscono per essere eseguiti in queste librerie proprietarie di NVIDIA anziché in codice generico.
#E i 'core CUDA'?
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
È il nome commerciale che NVIDIA dà ai processori paralleli di una GPU, le sue unità di calcolo di base. Una RTX 4060 ne conta 3.072, una RTX 5090 ne conta 21.760, quasi sette volte di più, secondo le schede tecniche del produttore. Più core significano più calcoli al secondo, un fattore che incide direttamente sulla generazione di immagini, sull'addestramento di un modello e sulla lettura del prompt da parte di un LLM, la fase in cui la GPU deve elaborare in una sola volta tutto il testo già scritto.
Questo conta molto meno per ciò che si percepisce maggiormente nell'uso quotidiano di un LLM: la velocità di scrittura, token dopo token. Qui il limite è la velocità con cui i pesi vengono letti in memoria, non quella con cui vengono moltiplicati una volta letti. Una scheda con meno core ma con una VRAM più capiente e più veloce scriverà quindi spesso più rapidamente, nell'uso pratico, di una scheda più potente sulla carta ma con una memoria più limitata.
#Driver, librerie, Toolkit: cosa bisogna installare?
| Componente | Cos'è | Chi ne ha bisogno |
|---|---|---|
| Driver NVIDIA | Fa comunicare il sistema e la scheda; contiene la parte di esecuzione di CUDA | Chiunque possieda una scheda NVIDIA |
| Librerie di esecuzione | cuBLAS, cuDNN e gli altri | Già incluse nella maggior parte delle applicazioni e nei pacchetti PyTorch: quasi mai le installi tu stesso |
| CUDA Toolkit | Il compilatore nvcc, gli header, gli strumenti di profilazione | Solo chi compila codice CUDA, ad esempio llama.cpp dalle sorgenti |
#Leggi i numeri di versione
Questi due numeri differiscono legittimamente, e il primo inganna quasi tutti. Quando nvidia-smi mostra « CUDA Version: 13.0 », significa che il driver può eseguire software compilato per CUDA fino alla versione 13.0. Non significa che il Toolkit sia installato. E un software compilato per una versione più vecchia di CUDA funziona senza problemi con un driver recente.
#Capacità di calcolo, generazione per generazione
Ogni GPU NVIDIA ha un numero di «capacità di calcolo» (compute capability) che identifica la sua architettura e le istruzioni che supporta nativamente. I software vengono compilati per capacità specifiche, generalmente un intervallo di versioni coperto da uno stesso pacchetto, e i progetti abbandonano regolarmente il supporto per quelle più vecchie con il susseguirsi degli aggiornamenti. È questo, molto più della velocità di calcolo pura, a mettere fine alla carriera di una scheda nell'IA locale: una RTX 2060 continua a funzionare fisicamente per anni dopo l'acquisto, ma alcuni strumenti recenti non si lasciano installare su di essa perché manca il codice compilato per la sua generazione.
| Generazione | Schede | Capacità di calcolo | Situazione dell'IA locale nel 2026 |
|---|---|---|---|
| Pascal | GTX 1060, 1070, 1080 Ti | 6.1 | Consente di eseguire gli strumenti basati su llama.cpp; nessuna accelerazione FP16; supporto abbandonato da alcuni framework recenti |
| Turing | GTX 1660, da RTX 2060 a 2080 Ti | 7.5 | Minimo richiesto da vLLM (7.0); buona compatibilità |
| Ampere | Dalla RTX 3050 alla 3090 Ti | 8.6 | Pienamente supportata; introduce il BF16 |
| Ada Lovelace | Da RTX 4060 a RTX 4090 | 8.9 | Pienamente supportata; introduce il supporto FP8 |
| Blackwell | RTX 5050 a 5090 | 12.0 | Pieno supporto da parte dei software recenti; le versioni precedenti devono essere aggiornate o ricompilate; introduce il FP4 |
L'ultima riga spiega l'ondata di messaggi «la mia RTX 50 non viene rilevata»: un binario compilato prima dell'esistenza di questa architettura non contiene alcun codice per la capacità di calcolo 12.0. La soluzione è una versione più recente dello strumento, oppure una versione di PyTorch compilata per una versione recente di CUDA.
#CUDA contro ROCm, Metal e Vulkan
| Piattaforma | Produttore | Hardware | Stato per gli LLM locali |
|---|---|---|---|
| CUDA | NVIDIA | GPU NVIDIA | La piattaforma di riferimento: tutti la supportano per prima |
| ROCm | AMD | Radeon recenti e Instinct | Buono su Linux sulle schede supportate; lista di schede più ristretta |
| Metal | Apple | Apple Silicon | Eccellente con llama.cpp e MLX |
| Vulkan | Khronos, standard aperto | Quasi tutte le GPU, incluse quelle integrate | Funziona praticamente ovunque con llama.cpp; in generale più lento della soluzione nativa |
| SYCL / oneAPI | Intel | Intel Arc e GPU integrate | Funzionale, con l'ecosistema più ridotto |
Il vantaggio di CUDA non dipende dal fatto che le altre piattaforme sarebbero incapaci di eseguire i calcoli. Dipende da quasi vent'anni di librerie, strumenti e codice collaudato, sviluppati dal 2007, una GPU dopo l'altra, secondo la pagina ufficiale del progetto. Per l'inferenza con gli strumenti comuni, il divario si è molto ridotto: llama.cpp funziona sulle cinque piattaforme, con prestazioni simili a parità di quantizzazione su hardware comparabile. Per l'addestramento, il fine-tuning e il codice di ricerca appena pubblicato su GitHub, invece, CUDA resta l'unica strada che funziona fin dal primo giorno: è quasi sempre la prima piattaforma di destinazione, talvolta l'unica, dei repository che accompagnano un nuovo articolo scientifico, spesso diversi mesi prima che compaia un porting verso le altre piattaforme, ammesso che compaia mai.
- Ollama su GPU AMD con ROCm
- llama.cpp con Vulkan, il backend universale
- Su Mac: MLX o llama.cpp?
- Fonte: Wikipedia, storia e architettura di CUDA
- Fonte: tabella delle capacità di calcolo CUDA per GPU (GPUSmith)
#Cosa cambia quando si acquista
- Vuoi che tutto funzioni senza dover risolvere problemi tecnici
- Prendi una scheda NVIDIA e dai priorità alla capacità della VRAM rispetto al numero di core CUDA indicato sulla confezione: è questa a determinare se un modello si carica, non la potenza di calcolo bruta.
- Esegui soprattutto modelli GGUF in Ollama o LM Studio
- Un Mac Apple Silicon, o una Radeon recente su Linux con ROCm, è una scelta legittima: llama.cpp supporta adeguatamente entrambe le piattaforme e perdi poco in termini di comodità d'uso quotidiana.
- Prevedi di fare fine-tuning, utilizzare vLLM o seguire repository di ricerca
- L'assenza di CUDA ti costerà tempo ogni settimana, tra le dipendenze che non si compilano e i notebook pubblicati dando per scontata la disponibilità di una GPU NVIDIA.
- Acquisti una scheda usata
- Evita qualsiasi scheda con una compute capability inferiore a 7.5, indipendentemente dal prezzo indicato: oltre alla lentezza, alcuni framework recenti si rifiutano categoricamente di installarsi.
#FAQ
Che cosa significa CUDA?+
Serve installare CUDA per far funzionare un'IA localmente?+
CUDA funziona su una scheda AMD o Intel?+
Perché nvidia-smi e nvcc non mostrano la stessa versione?+
Avere più core CUDA è meglio per un LLM?+
Le RTX 50 e le schede Blackwell per datacenter hanno la stessa compute capability?+
Hardware consigliato: RTX 5070 Ti 16 GB — scheda NVIDIA recente con 16 GB di VRAM, supporto CUDA. Tutto l'hardware per l'IA →
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.