Avanzato 11 minPer VRAM

Quale LLM per 32 GB di VRAM ?

Risposta diretta

Con 32 GB di VRAM, puoi caricare interamente un modello denso da 27 a 32B in Q4 (da 16 a 20 GB) con un contesto lungo, un MoE da 30-35B (da 19 a 21 GB) o gpt-oss-20b (14 GB) con un ampio margine. La soglia che non rientra in questa capacità è quella dei 70B: da 40 a 43 GB in Q4, quindi necessariamente in parte nella RAM di sistema, dove la velocità crolla. Calcola sempre anche la cache del contesto, oltre ai pesi.

32 GB di VRAM sono la soglia a partire dalla quale non occorre più scegliere tra dimensione del modello e lunghezza del contesto. Questa pagina indica cosa entra davvero in memoria, cosa cambia in base alla scheda (RTX 5090 o Radeon AI PRO R9700), perché un 70B o un 123B non diventa agevole da usare e quando la memoria unificata di un Mac o una seconda scheda è un acquisto migliore.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#32 GB di VRAM: cosa cambia con questa capacità rispetto a 24 GB

Un modello in Q4 occupa circa 0,6 GB per miliardo di parametri, più la cache del contesto, che cresce con la lunghezza della conversazione. Con 24 GB, un modello denso da 27 a 32B in Q4 (da 16 a 20 GB) entra in memoria, ma il contesto deve restare breve. Con 32 GB, restano da 12 a 16 GB per il contesto, le attivazioni e il sistema: è questa memoria disponibile che rende possibili finestre da 32.000 a 128.000 token su un 27B, oppure un MoE da 30-35B con un buon margine.

Budget di 32 GB per alcuni modelli comuni (peso in Q4, escluso il contesto)
ModelloPesi Q4Memoria restante per il contesto e il sistemaVerdetto
gpt-oss-20b14 GB18 GBMargine molto ampio, contesto lungo
Qwen 3.5 27B / Qwen 3.8 27B16 GB16 GBUtilizzo agevole, possibilità di un contesto lungo
Gemma 4 31B18 GB14 GBComodo
Qwen 3 32B19-20 GB12 GBVa bene, contesto da monitorare
Qwen3-Coder 30B-A3B (MoE)19 GB13 GBBuono, molto veloce per le sue dimensioni
Qwen 3.6 35B-A3B (MoE)21 GB11 GBBene, contesto medio
Llama 3.3 70B43 GBnegativoNon entra nella VRAM: offload obbligatorio

Questi valori indicano le dimensioni dei file, non il fabbisogno totale: il calcolatore del sito aggiunge la cache per un determinato modello e contesto. La cache può anche essere quantizzata in q8_0, il che, secondo la FAQ di Ollama, ne dimezza all'incirca le dimensioni rispetto a f16, a condizione di attivare Flash Attention.

#Quali schede offrono 32 GB e perché la banda passante conta

Due schede per computer desktop si distinguono. La GeForce RTX 5090 integra 32 GB di GDDR7 su un bus da 512 bit, con 1.792 GB/s di larghezza di banda secondo NVIDIA. La Radeon AI PRO R9700 di AMD offre anch'essa 32 GB, ma in GDDR6 su un bus da 256 bit, a 640 GB/s secondo AMD, per un computer desktop e un uso professionale. La capacità è identica; la velocità di generazione non lo è.

Due schede da 32 GB: stessa capacità, throughput teorico molto diverso
SchedaMemoriaLarghezza di bandaLimite per un modello da 19 GB
GeForce RTX 509032 GB GDDR7, 512 bit1 792 GB/scirca 94 t/s
Radeon AI PRO R970032 GB GDDR6, 256 bit640 GB/scirca 34 t/s

Il limite teorico si calcola dividendo la banda passante per i pesi letti a ogni token; non viene mai raggiunto pienamente, ma il rapporto resta valido: a parità di modello, la RTX 5090 genera a una velocità più che doppia rispetto alla R9700. Per una scheda AMD contano anche il driver e lo stack software (ROCm, Vulkan); la guida dedicata alle schede AMD ne descrive in dettaglio i limiti. Le singole schede hanno pagine dedicate: quella della RTX 5090 fornisce i dettagli della scheda.

Due altre soluzioni permettono di raggiungere 32 GB. Due schede da 16 GB si ripartiscono un modello con llama.cpp, ma il collegamento PCIe rallenta gli scambi e il modello deve poter essere suddiviso correttamente; la guida multi-GPU spiega il metodo. Un Mac con almeno 32 GB di memoria unificata è una terza opzione, con una larghezza di banda inferiore ma senza il limite della VRAM dedicata.

I prezzi cambiano velocemente: il monitoraggio del sito rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.

#I modelli da preferire su 32 GB

Modelli densi da 27 a 32B
La scelta per la qualità: Qwen 3.5 27B o 3.8 27B (16 GB in Q4), Gemma 4 31B (18 GB), Qwen 3 32B (da 19 a 20 GB). Lasciano spazio per un contesto lungo e si prestano bene a quantizzazioni più fini (Q5, Q6) se vuoi una qualità maggiore.
MoE 30-35B
Qwen3-Coder 30B-A3B (19 GB) e Qwen 3.6 35B-A3B (21 GB) attivano solo circa 3 miliardi di parametri per token: offrono la migliore velocità in rapporto alle dimensioni e sono la scelta giusta per il codice e gli agenti.
gpt-oss-20b
14 GB nella libreria Ollama; la pagina di Ollama indica che può funzionare su sistemi dotati di almeno 16 GB di memoria. Con 32 GB, lascia spazio per un contesto enorme e permette di mantenere caricato contemporaneamente un secondo modello.
Modello per il codice da 24B
Devstral Small 2 24B (14 GB): uno specialista degli agenti di programmazione che lascia spazio a due modelli residenti.

Per scegliere, poniti tre domande. Il modello deve gestire un contesto lungo (documenti, repository di codice)? Scegli un modello denso da 27B in Q4, che lascia 16 GB per la cache. Serve velocità (agenti, cicli di chiamate agli strumenti)? Il MoE. Vuoi semplicemente una qualità maggiore rispetto a quella ottenibile con 24 GB? Passa da Q4 a Q6 su un modello da 27 a 32B: lo spazio c'è.

#Verifica che il modello rientri davvero nella memoria della scheda

Un modello che «si carica» non è necessariamente interamente sulla GPU. Ollama distribuisce silenziosamente i layer tra la scheda e la RAM quando la VRAM non basta, e la velocità cala senza messaggi di errore. La FAQ ufficiale indica che il comando ollama ps mostra nella colonna Processor dove è stato caricato il modello: 100 % GPU significa che è interamente sulla GPU, mentre una ripartizione come 30 %/70 % CPU/GPU segnala che una parte del modello è stata spostata nella RAM.

  1. 01
    Caricare il modello con il contesto desiderato
    Avvia il modello con la lunghezza di contesto effettivamente necessaria per il tuo utilizzo, non con il valore predefinito: è la cache del contesto a far superare la capacità di memoria disponibile.
  2. 02
    Leggere la colonna Processor
    Esegui ollama ps in un altro terminale. Punta al 100 % GPU; qualsiasi quota di elaborazione affidata alla CPU riduce la velocità.
  3. 03
    Ridurre se necessario
    Se il modello non rientra nella memoria disponibile, riduci il contesto, attiva la quantizzazione della cache in q8_0 con Flash Attention oppure passa a una quantizzazione più leggera.
  4. 04
    Controllare la VRAM rimanente
    Su Windows o Linux, nvidia-smi mostra la memoria utilizzata; lascia un margine di uno o due GB per la gestione dello schermo e i picchi di utilizzo.
  5. 05
    Misurare le prestazioni nel tuo caso d'uso
    Confronta il throughput con un prompt breve e con il tuo prompt reale: è il secondo numero a contare.
!
La trappola del contesto predefinito
Secondo la sua FAQ, Ollama usa per impostazione predefinita una finestra di contesto di 4.096 token. Con questa impostazione, un modello può sembrare rientrare nella VRAM disponibile e superarne la capacità non appena passi a 32.000 token per analizzare un documento. Fai sempre una prova con il contesto di cui hai bisogno.

#70B e 123B: perché l'offload non rende questi modelli utilizzabili

Llama 3.3 70B pesa 43 GB nella libreria Ollama, Mistral Large 123B 73 GB. Con 32 GB di VRAM, occorre quindi lasciare almeno 11 GB del 70B e 41 GB del 123B nella RAM di sistema. A ogni token, questi strati vengono letti dal processore alla velocità della memoria di sistema: circa 102 GB/s al massimo per una DDR5-6400 a doppio canale (6.400 MT/s × 8 byte × 2). Dividendo per 41 GB, il limite massimo del 123B è di circa 2,5 token al secondo; per il 70B, con 11 GB in RAM, è di circa 9 token al secondo. Sono limiti massimi, non misure: mostrano soprattutto che la velocità di generazione non diminuisce in modo progressivo, ma a gradini, non appena gli strati lasciano la scheda.

Prestazioni di un modello che supera i 32 GB di VRAM (calcolo basato sulla memoria di sistema)
ModelloDimensione in OllamaQuota nella RAM di sistemaLimite RAM (102 GB/s)
Llama 3.3 70B43 GBcirca 11 GB (34 %)circa 9 t/s
Mistral Large 123B73 GBcirca 41 GB (56 %)circa 2,5 t/s

Questo calcolo presuppone che la scheda mantenga 32 GB di pesi; in pratica, anche la cache del contesto occupa spazio, quindi una quota maggiore dei pesi viene trasferita nella RAM e il limite massimo si abbassa. I MoE si comportano meglio: llama.cpp offre un'opzione per mantenere gli esperti di alcuni livelli sul processore (--n-cpu-moe), per le configurazioni che non possono caricare l'intero modello sulla GPU. Permette di utilizzare un modello che altrimenti non starebbe in memoria, ma un utente del repository llama.cpp segnala una perdita di velocità di circa l'80% quando tutti gli esperti vengono spostati sulla CPU: è una soluzione di ultima istanza.

Un MoE troppo grande: tenere gli esperti sulla CPU (llama.cpp)
llama-server -m modele-moe.gguf -ngl 99 -fa --n-cpu-moe 12 -c 16384

Il valore di --n-cpu-moe dipende dalla memoria a tua disposizione; va trovato per tentativi. Per un modello 70B denso, con 32 GB la soluzione giusta è quasi sempre un modello più piccolo o più memoria, non l'offload.

#Eseguire il fine-tuning di un modello con 32 GB: cosa è possibile e cosa no

Il fine-tuning con QLoRA mantiene i pesi del modello a 4 bit e addestra solo piccoli adattatori. I soli pesi di un 70B occupano già 40 GB, quindi il fine-tuning con QLoRA di un 70B non rientra in 32 GB. Un 32B a 4 bit occupa circa 19-20 GB: restano 12 GB per le attivazioni, l'ottimizzatore e gli adattatori, il che è fattibile con un contesto breve e un batch di 1, senza margine di sicurezza. Un modello da 7 a 14B lascia un buon margine. Sono ordini di grandezza da confermare nello strumento che usi.

#32 GB di VRAM o un'altra soluzione: la tabella per decidere

Cosa scegliere in base alle tue esigenze
EsigenzaSoluzionePerché
Modelli densi 27-32B, contesto lungo, velocità massimaScheda NVIDIA da 32 GBBanda passante elevata, ecosistema CUDA
Stessa capacità con minor consumo elettricoRadeon AI PRO R9700Anche 32 GB, velocità teorica più bassa
Modelli da 64 GB e oltre, uso occasionaleMac con memoria unificata di 64 GB o piùCapacità senza offload, velocità più bassa
Budget limitato, MoE di 30BUna scheda da 24 GB basta spessoIl MoE da 19 GB rientra nella memoria disponibile con un contesto moderato

#Domande frequenti

FAQ
Qual è il miglior LLM per 32 GB di VRAM?+
Per la qualità, un modello denso da 27 a 32B in Q4 (Qwen 3.5 o 3.8 27B, Gemma 4 31B, Qwen 3 32B) con un contesto lungo. Per la velocità e il codice, un modello MoE da 30 a 35B come Qwen3-Coder 30B-A3B. Nessun modello è il migliore in assoluto: dipende dal compito e dalla lingua.
Sono sufficienti 32 GB di VRAM per Mistral Large 123B?+
No. La libreria Ollama indica 73 GB per Mistral Large 123B. Più di 40 GB dovrebbero rimanere nella RAM, dove la lettura è limitata a circa 100 GB/s, il che dà un limite teorico di 2-3 token al secondo. È utilizzabile per un'elaborazione in background, non per una chat.
RTX 5090 o Mac Studio 64 GB per l'IA locale?+
La scheda per la velocità: 1 792 GB/s contro qualche centinaio di GB/s per un Mac, con modelli che rientrano in 32 GB. Il Mac per la capacità: un modello da 40 a 50 GB ci sta senza offload, a una velocità inferiore. Scegli in base alla dimensione dei modelli che carichi.
Una seconda scheda da 16 GB vale una scheda da 32 GB?+
Due schede da 16 GB danno complessivamente 32 GB, ma il modello si distribuisce tra di esse e il collegamento PCIe rallenta i trasferimenti; la distribuzione richiede anche una configurazione in llama.cpp. Una scheda da 32 GB è più semplice e più veloce a parità di capacità totale, a meno che tu non possieda già una delle due schede.
È possibile caricare due modelli contemporaneamente su 32 GB?+
Sì, ad esempio gpt-oss-20b (14 GB) e Devstral Small 2 24B (14 GB), complessivamente 28 GB di pesi, con un contesto breve. Ollama mantiene i modelli in memoria per cinque minuti di default e può conservarne più di uno se la memoria lo permette; controlla la cache del contesto, che si aggiunge a ciascuno.
Quale quantizzazione scegliere con 32 GB?+
Q4_K_M rimane il miglior compromesso per i modelli densi da 27 a 32B. Se hai margine (un modello i cui pesi occupano da 14 a 16 GB), passa a Q5 o Q6 per migliorare la qualità. Scendi sotto Q4 solo per far rientrare un modello troppo grande, accettando una perdita di qualità.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.