Quale LLM per 32 GB di VRAM ?
Con 32 GB di VRAM, puoi caricare interamente un modello denso da 27 a 32B in Q4 (da 16 a 20 GB) con un contesto lungo, un MoE da 30-35B (da 19 a 21 GB) o gpt-oss-20b (14 GB) con un ampio margine. La soglia che non rientra in questa capacità è quella dei 70B: da 40 a 43 GB in Q4, quindi necessariamente in parte nella RAM di sistema, dove la velocità crolla. Calcola sempre anche la cache del contesto, oltre ai pesi.
32 GB di VRAM sono la soglia a partire dalla quale non occorre più scegliere tra dimensione del modello e lunghezza del contesto. Questa pagina indica cosa entra davvero in memoria, cosa cambia in base alla scheda (RTX 5090 o Radeon AI PRO R9700), perché un 70B o un 123B non diventa agevole da usare e quando la memoria unificata di un Mac o una seconda scheda è un acquisto migliore.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#32 GB di VRAM: cosa cambia con questa capacità rispetto a 24 GB
Un modello in Q4 occupa circa 0,6 GB per miliardo di parametri, più la cache del contesto, che cresce con la lunghezza della conversazione. Con 24 GB, un modello denso da 27 a 32B in Q4 (da 16 a 20 GB) entra in memoria, ma il contesto deve restare breve. Con 32 GB, restano da 12 a 16 GB per il contesto, le attivazioni e il sistema: è questa memoria disponibile che rende possibili finestre da 32.000 a 128.000 token su un 27B, oppure un MoE da 30-35B con un buon margine.
| Modello | Pesi Q4 | Memoria restante per il contesto e il sistema | Verdetto |
|---|---|---|---|
| gpt-oss-20b | 14 GB | 18 GB | Margine molto ampio, contesto lungo |
| Qwen 3.5 27B / Qwen 3.8 27B | 16 GB | 16 GB | Utilizzo agevole, possibilità di un contesto lungo |
| Gemma 4 31B | 18 GB | 14 GB | Comodo |
| Qwen 3 32B | 19-20 GB | 12 GB | Va bene, contesto da monitorare |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 13 GB | Buono, molto veloce per le sue dimensioni |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 11 GB | Bene, contesto medio |
| Llama 3.3 70B | 43 GB | negativo | Non entra nella VRAM: offload obbligatorio |
Questi valori indicano le dimensioni dei file, non il fabbisogno totale: il calcolatore del sito aggiunge la cache per un determinato modello e contesto. La cache può anche essere quantizzata in q8_0, il che, secondo la FAQ di Ollama, ne dimezza all'incirca le dimensioni rispetto a f16, a condizione di attivare Flash Attention.
- Calcolatore di memoria per un modello e il suo contesto
- Quantizzare la cache KV per risparmiare memoria
#Quali schede offrono 32 GB e perché la banda passante conta
Due schede per computer desktop si distinguono. La GeForce RTX 5090 integra 32 GB di GDDR7 su un bus da 512 bit, con 1.792 GB/s di larghezza di banda secondo NVIDIA. La Radeon AI PRO R9700 di AMD offre anch'essa 32 GB, ma in GDDR6 su un bus da 256 bit, a 640 GB/s secondo AMD, per un computer desktop e un uso professionale. La capacità è identica; la velocità di generazione non lo è.
| Scheda | Memoria | Larghezza di banda | Limite per un modello da 19 GB |
|---|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7, 512 bit | 1 792 GB/s | circa 94 t/s |
| Radeon AI PRO R9700 | 32 GB GDDR6, 256 bit | 640 GB/s | circa 34 t/s |
Il limite teorico si calcola dividendo la banda passante per i pesi letti a ogni token; non viene mai raggiunto pienamente, ma il rapporto resta valido: a parità di modello, la RTX 5090 genera a una velocità più che doppia rispetto alla R9700. Per una scheda AMD contano anche il driver e lo stack software (ROCm, Vulkan); la guida dedicata alle schede AMD ne descrive in dettaglio i limiti. Le singole schede hanno pagine dedicate: quella della RTX 5090 fornisce i dettagli della scheda.
Due altre soluzioni permettono di raggiungere 32 GB. Due schede da 16 GB si ripartiscono un modello con llama.cpp, ma il collegamento PCIe rallenta gli scambi e il modello deve poter essere suddiviso correttamente; la guida multi-GPU spiega il metodo. Un Mac con almeno 32 GB di memoria unificata è una terza opzione, con una larghezza di banda inferiore ma senza il limite della VRAM dedicata.
I prezzi cambiano velocemente: il monitoraggio del sito rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
- Monitoraggio dei prezzi delle schede grafiche per l'IA locale
- LLM su RTX 5090
- Configurazione multi-GPU con llama.cpp
#I modelli da preferire su 32 GB
- Modelli densi da 27 a 32B
- La scelta per la qualità: Qwen 3.5 27B o 3.8 27B (16 GB in Q4), Gemma 4 31B (18 GB), Qwen 3 32B (da 19 a 20 GB). Lasciano spazio per un contesto lungo e si prestano bene a quantizzazioni più fini (Q5, Q6) se vuoi una qualità maggiore.
- MoE 30-35B
- Qwen3-Coder 30B-A3B (19 GB) e Qwen 3.6 35B-A3B (21 GB) attivano solo circa 3 miliardi di parametri per token: offrono la migliore velocità in rapporto alle dimensioni e sono la scelta giusta per il codice e gli agenti.
- gpt-oss-20b
- 14 GB nella libreria Ollama; la pagina di Ollama indica che può funzionare su sistemi dotati di almeno 16 GB di memoria. Con 32 GB, lascia spazio per un contesto enorme e permette di mantenere caricato contemporaneamente un secondo modello.
- Modello per il codice da 24B
- Devstral Small 2 24B (14 GB): uno specialista degli agenti di programmazione che lascia spazio a due modelli residenti.
Per scegliere, poniti tre domande. Il modello deve gestire un contesto lungo (documenti, repository di codice)? Scegli un modello denso da 27B in Q4, che lascia 16 GB per la cache. Serve velocità (agenti, cicli di chiamate agli strumenti)? Il MoE. Vuoi semplicemente una qualità maggiore rispetto a quella ottenibile con 24 GB? Passa da Q4 a Q6 su un modello da 27 a 32B: lo spazio c'è.
#Verifica che il modello rientri davvero nella memoria della scheda
Un modello che «si carica» non è necessariamente interamente sulla GPU. Ollama distribuisce silenziosamente i layer tra la scheda e la RAM quando la VRAM non basta, e la velocità cala senza messaggi di errore. La FAQ ufficiale indica che il comando ollama ps mostra nella colonna Processor dove è stato caricato il modello: 100 % GPU significa che è interamente sulla GPU, mentre una ripartizione come 30 %/70 % CPU/GPU segnala che una parte del modello è stata spostata nella RAM.
- 01Caricare il modello con il contesto desideratoAvvia il modello con la lunghezza di contesto effettivamente necessaria per il tuo utilizzo, non con il valore predefinito: è la cache del contesto a far superare la capacità di memoria disponibile.
- 02Leggere la colonna ProcessorEsegui ollama ps in un altro terminale. Punta al 100 % GPU; qualsiasi quota di elaborazione affidata alla CPU riduce la velocità.
- 03Ridurre se necessarioSe il modello non rientra nella memoria disponibile, riduci il contesto, attiva la quantizzazione della cache in q8_0 con Flash Attention oppure passa a una quantizzazione più leggera.
- 04Controllare la VRAM rimanenteSu Windows o Linux, nvidia-smi mostra la memoria utilizzata; lascia un margine di uno o due GB per la gestione dello schermo e i picchi di utilizzo.
- 05Misurare le prestazioni nel tuo caso d'usoConfronta il throughput con un prompt breve e con il tuo prompt reale: è il secondo numero a contare.
#70B e 123B: perché l'offload non rende questi modelli utilizzabili
Llama 3.3 70B pesa 43 GB nella libreria Ollama, Mistral Large 123B 73 GB. Con 32 GB di VRAM, occorre quindi lasciare almeno 11 GB del 70B e 41 GB del 123B nella RAM di sistema. A ogni token, questi strati vengono letti dal processore alla velocità della memoria di sistema: circa 102 GB/s al massimo per una DDR5-6400 a doppio canale (6.400 MT/s × 8 byte × 2). Dividendo per 41 GB, il limite massimo del 123B è di circa 2,5 token al secondo; per il 70B, con 11 GB in RAM, è di circa 9 token al secondo. Sono limiti massimi, non misure: mostrano soprattutto che la velocità di generazione non diminuisce in modo progressivo, ma a gradini, non appena gli strati lasciano la scheda.
| Modello | Dimensione in Ollama | Quota nella RAM di sistema | Limite RAM (102 GB/s) |
|---|---|---|---|
| Llama 3.3 70B | 43 GB | circa 11 GB (34 %) | circa 9 t/s |
| Mistral Large 123B | 73 GB | circa 41 GB (56 %) | circa 2,5 t/s |
Questo calcolo presuppone che la scheda mantenga 32 GB di pesi; in pratica, anche la cache del contesto occupa spazio, quindi una quota maggiore dei pesi viene trasferita nella RAM e il limite massimo si abbassa. I MoE si comportano meglio: llama.cpp offre un'opzione per mantenere gli esperti di alcuni livelli sul processore (--n-cpu-moe), per le configurazioni che non possono caricare l'intero modello sulla GPU. Permette di utilizzare un modello che altrimenti non starebbe in memoria, ma un utente del repository llama.cpp segnala una perdita di velocità di circa l'80% quando tutti gli esperti vengono spostati sulla CPU: è una soluzione di ultima istanza.
Il valore di --n-cpu-moe dipende dalla memoria a tua disposizione; va trovato per tentativi. Per un modello 70B denso, con 32 GB la soluzione giusta è quasi sempre un modello più piccolo o più memoria, non l'offload.
#Eseguire il fine-tuning di un modello con 32 GB: cosa è possibile e cosa no
Il fine-tuning con QLoRA mantiene i pesi del modello a 4 bit e addestra solo piccoli adattatori. I soli pesi di un 70B occupano già 40 GB, quindi il fine-tuning con QLoRA di un 70B non rientra in 32 GB. Un 32B a 4 bit occupa circa 19-20 GB: restano 12 GB per le attivazioni, l'ottimizzatore e gli adattatori, il che è fattibile con un contesto breve e un batch di 1, senza margine di sicurezza. Un modello da 7 a 14B lascia un buon margine. Sono ordini di grandezza da confermare nello strumento che usi.
#32 GB di VRAM o un'altra soluzione: la tabella per decidere
| Esigenza | Soluzione | Perché |
|---|---|---|
| Modelli densi 27-32B, contesto lungo, velocità massima | Scheda NVIDIA da 32 GB | Banda passante elevata, ecosistema CUDA |
| Stessa capacità con minor consumo elettrico | Radeon AI PRO R9700 | Anche 32 GB, velocità teorica più bassa |
| Modelli da 64 GB e oltre, uso occasionale | Mac con memoria unificata di 64 GB o più | Capacità senza offload, velocità più bassa |
| Budget limitato, MoE di 30B | Una scheda da 24 GB basta spesso | Il MoE da 19 GB rientra nella memoria disponibile con un contesto moderato |
- Quale LLM per 24 GB di VRAM
- Mac Studio per configurazioni da 64 a 512 GB
- Fonte: NVIDIA, annuncio delle RTX 50
- Fonte: AMD, Radeon AI PRO R9700
- Fonte: libreria Ollama, Mistral Large
#Domande frequenti
Qual è il miglior LLM per 32 GB di VRAM?+
Sono sufficienti 32 GB di VRAM per Mistral Large 123B?+
RTX 5090 o Mac Studio 64 GB per l'IA locale?+
Una seconda scheda da 16 GB vale una scheda da 32 GB?+
È possibile caricare due modelli contemporaneamente su 32 GB?+
Quale quantizzazione scegliere con 32 GB?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.