Intermedio 11 minPer VRAM

Quale LLM per 24 GB di VRAM ?

Risposta diretta

Con 24 GB di VRAM, carica un modello denso da 27 miliardi in Q4 come Qwen 3.8 27B (16 GB di pesi, 8 GB di margine) o un modello MoE da 30 a 35 miliardi (da 19 a 21 GB). Un modello denso da 70 miliardi in Q4 (circa 40 GB) non entra in memoria: richiede due schede o memoria unificata.

Ventiquattro gigabyte di VRAM sono la soglia per i modelli da 27 a 35 miliardi di parametri. Questa guida spiega quali modelli ci stanno, quali schede hanno davvero 24 GB, quale limite di velocità consente la loro larghezza di banda e fino a dove si può arrivare con il fine-tuning.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.

Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#24 GB di VRAM: la fascia dei modelli da 27 a 35 miliardi

Con 24 GB di VRAM, carichi interamente in memoria un modello denso da 27 miliardi di parametri in Q4 (16 GB di pesi secondo il catalogo QuelLLM), con 8 GB di margine per il contesto, oppure un modello MoE da 30 a 35 miliardi di parametri, di cui 3 miliardi attivi (da 19 a 21 GB), con un contesto più breve. Un modello denso da 70B in Q4 pesa circa 40 GB: non ci sta e richiede due schede o memoria unificata. La soglia dei 24 GB è quella a cui si passa dai modelli da 9 a 14 miliardi a quelli che rivaleggiano con i grandi modelli di ieri.

Cosa può entrare in 24 GB (pesi riportati nel catalogo QuelLLM, Q4 salvo diversa indicazione)
ModelloPesi Q4Margine su 24 GBNota
gpt-oss 20B (MoE)13 GB11 GBMolto ampio, contesto lungo
Devstral Small 2 24B14 GB10 GBAgente di programmazione
Qwen 3.8 27B16 GB8 GBDenso, generalista, contesto dichiarato di 262.144 token
Gemma 4 31B18 GB6 GBDenso, Q5 da 22 GB con un margine troppo ridotto
Qwen3-Coder 30B-A3B (MoE)19 GB5 GBCodice, 3 miliardi di parametri attivi
Qwen 3.6 35B-A3B (MoE)21 GB3 GBContesto breve, entra appena in memoria
Qwen 3.8 27B in Q829 GBNoSupera la capacità disponibile

Una correzione rispetto a una versione precedente di questa guida: indicava talvolta 18 GB e talvolta 16 GB per Qwen 3.8 27B, e 23 GB per Qwen 3.6 35B-A3B. Il catalogo indica 16 GB e 21 GB. Questi valori sono pesi in Q4 arrotondati; aggiungi sempre la cache KV e circa un gigabyte di margine.

#Quali schede hanno 24 GB e qual è la differenza

Tre schede destinate al grande pubblico dominano questa fascia. NVIDIA descrive la RTX 3090 con 24 GB di GDDR6X e la RTX 4090 con 24 GB di GDDR6X. AMD indica 24 GB di GDDR6 e una larghezza di banda fino a 960 GB/s per la RX 7900 XTX. La RTX 5090, con 32 GB di GDDR7 su un bus a 512 bit secondo NVIDIA, appartiene alla fascia superiore. Non confonderla con la RX 7900 XT, che ha 20 GB: la tabella delle prestazioni di llama.cpp la elenca con 20 GB di GDDR6.

Tre modi per ottenere 24 GB
SchedaSoftwareDa preferire seGuide
RTX 3090 / 3090 TiCUDAVuoi CUDA e un prezzo d'ingresso contenuto sul mercato dell'usatoLLM su RTX 3090
RTX 4090CUDAVuoi CUDA su un'architettura più recenteLLM su RTX 4090
RX 7900 XTXROCm 7 o VulkanUsi Linux e accetti ROCmLLM su RX 7900 XTX

La scelta dipende da tre criteri: l'ecosistema software, l'età della scheda (stato, garanzia) e il prezzo del giorno, che non fissiamo. Il monitoraggio dei prezzi del sito fornisce il costo del gigabyte di VRAM, aggiornato due volte a settimana; è l'indicatore giusto per scegliere tra una scheda usata da 24 GB e una nuova da 16 GB.

#Quale modello scegliere con 24 GB a seconda dell'uso

Un punto di partenza per ogni uso
UsoModelloPerché
Generalista versatileQwen 3.8 27B Q4Denso, 8 GB di margine per il contesto
Velocità e ragionamentogpt-oss 20BMoE leggero, 11 GB di margine
Codice e agenti di sviluppoDevstral Small 2 24B o Qwen3-Coder 30B-A3B14 o 19 GB, contesto a seconda del margine
Modello MoE più grandeQwen 3.6 35B-A3B Q421 GB, 3 miliardi di parametri attivi, contesto breve
Agenti e chiamate a strumentiGLM 4.7 Flash Q419 GB, licenza MIT secondo il catalogo

La scelta tra un modello denso e un MoE è il vero compromesso a questo livello. Un modello denso da 27 miliardi di parametri legge tutti i suoi pesi a ogni token: è più lento di un MoE, ma lascia più VRAM al contesto. Un MoE da 35 miliardi di parametri legge solo i parametri attivi, quindi genera più velocemente, ma il suo peso totale occupa quasi tutta la scheda. La guida sui MoE spiega il meccanismo.

#E il 70B? Ciò che 24 GB permettono veramente

Un modello denso da 70B in Q4 ha pesi che occupano circa 40 GB secondo il riferimento del sito: supera i 24 GB di almeno 16 GB. Occorrerebbe trasferire questa parte nella RAM di sistema, e la generazione avverrebbe quindi alla velocità della RAM e del bus PCIe, non a quella della scheda. Non indichiamo una velocità di generazione per questo caso, in assenza di una fonte verificabile: tieni presente che è troppo lento per un uso interattivo confortevole. I MoE da 30 a 35 miliardi di parametri sono, a parità di qualità, la risposta pratica a questo limite.

Una sola scheda da 24 GB
MoE da 30-35B in Q4, modelli densi da 27-31B in Q4 o Q5, con da 3 a 8 GB per il contesto.
Due schede da 24 GB (48 GB)
70B in Q4 (circa 40 GB) con un po' di contesto, distribuendo gli strati tra le schede.
Una scheda da 32 GB
La RTX 5090: un 70B in Q4 continua a non entrare nella memoria di una sola scheda, mentre i modelli densi da 27 a 32 miliardi di parametri ci stanno comodamente.

In llama.cpp, la modalità di distribuzione predefinita suddivide il modello per strati tra le schede, in pipeline, con proporzioni regolabili per ciascuna scheda. Il vantaggio riguarda la capacità, non la velocità per token, poiché le schede lavorano una dopo l'altra.

#Velocità: il limite imposto dalla banda passante

Durante la generazione, per ogni token viene letta la maggior parte dei pesi di un modello denso: il limite massimo teorico è la larghezza di banda divisa per la dimensione dei pesi. La scheda tecnica AMD indica 960 GB/s per la RX 7900 XTX; per le schede NVIDIA, consulta la larghezza di banda nella scheda tecnica del modello esatto. La tabella indica il limite massimo per incrementi di 100 GB/s per i modelli densi; i modelli MoE leggono meno pesi per token e sono più veloci.

Limite teorico dei modelli densi per ogni 100 GB/s
Modello in Q4Pesi lettiPer ogni 100 GB/sEsempio 960 GB/s (7900 XTX)
Devstral Small 2 24B14 GB≈ 7 token/s≈ 69 token/s
Qwen 3.8 27B16 GB≈ 6 tokens/s60 token/s
Gemma 4 31B18 GB≈ 5,6 token/s≈ 53 token/s

Questi valori sono limiti massimi, mai misurazioni: la velocità reale è più bassa e varia in base al driver, al software e al contesto. Non pubblichiamo dati sui token al secondo per scheda, perché manca un banco di prova pubblico comparabile per questi modelli. Per misurare la tua installazione, esegui ollama run con l'opzione --verbose.

#Il contesto: il vero limite con 24 GB

Su 24 GB, la cache KV determina la lunghezza del contesto utilizzabile. Un Qwen 3.8 27B in Q4 lascia 8 GB, un Qwen 3.6 35B-A3B ne lascia soltanto 3 GB. Ollama utilizza di default un contesto di 4.096 token secondo la sua documentazione, modificabile con OLLAMA_CONTEXT_LENGTH. Per risparmiare spazio, quantizza la cache: OLLAMA_KV_CACHE_TYPE=q8_0 utilizza circa la metà della memoria rispetto al formato f16 predefinito, a condizione che Flash Attention sia attiva.

Contesto di 32k con cache KV in q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=32768 ollama serve
ollama ps

#Un calcolo del margine in tre righe

Per sapere se un modello e il suo contesto rientrano nella memoria disponibile, somma tre termini: il peso indicato nel catalogo, la cache KV e circa un gigabyte di margine. Prendiamo due esempi con i pesi del catalogo. Un Qwen 3.8 27B in Q5 pesa 19 GB: restano 24 meno 19 meno 1, cioè 4 GB per la cache KV. Un Qwen 3.6 35B-A3B in Q4 pesa 21 GB: restano 24 meno 21 meno 1, cioè soltanto 2 GB, quindi un contesto breve, a meno che tu non quantizzi la cache. Lo stesso 27B in Q4 (16 GB) lascia liberi 7 GB, consentendo un contesto molto più lungo.

Questo calcolo spiega una scelta comune: preferire la quantizzazione Q4 alla Q5 quando il contesto è la priorità, e la Q5 alla Q4 quando lavori su testi brevi e la fedeltà del modello conta. La guida alla scelta della quantizzazione illustra nel dettaglio le differenze di qualità, mentre la guida alla cache KV spiega il risparmio di spazio.

#Acquistare una scheda da 24 GB usata: i controlli da fare

Le schede da 24 GB più diffuse risalgono al periodo dal 2020 al 2022: ne circolano molte usate e alcune hanno funzionato a lungo senza interruzioni. Prima di acquistare, chiedi una schermata di un test sotto carico, verifica la temperatura della memoria durante il test e controlla il rumore delle ventole. Assicurati che la capacità indicata nel driver sia effettivamente di 24 GB, che l'alimentatore di cui disponi supporti il consumo della scheda e che ci sia spazio nel case. I prezzi di queste schede cambiano da una settimana all'altra: il monitoraggio dei prezzi del sito permette di confrontare il costo per gigabyte di VRAM tra nuovo e usato.

#Fine-tuning con 24 GB: cosa entra in memoria e cosa no

La documentazione di Unsloth pubblica una tabella della VRAM minima per dimensione del modello e per metodo, precisando che si tratta di minimi assoluti. In QLoRA (4 bit), un modello da 7B richiede 5 GB, uno da 14B 8,5 GB e uno da 27B 22 GB. In LoRA a 16 bit, un modello da 8B richiede 22 GB e uno da 14B 33 GB. Con 24 GB, quindi, il QLoRA di un modello fino a 14 miliardi di parametri si esegue con un buon margine, quello di un 27B rientra appena nella memoria disponibile, senza margine, mentre il LoRA a 16 bit di un 14B è impossibile.

VRAM minima per il fine-tuning secondo Unsloth
ModelloQLoRA (4 bit)LoRA (16 bit)Su 24 GB
7B5 GB19 GBQLoRA e LoRA
9B6,5 GB24 GBQLoRA; LoRA senza margine
14B8,5 GB33 GBSolo QLoRA
27B22 GB64 GBQLoRA al limite
32B26 GB76 GBNo
70B41 GB164 GBNo
!
Errore corretto: il QLoRA 70B non entra in 24 GB
Una versione precedente di questa guida indicava che il QLoRA di un modello da 70B rientrava «al limite» in 22-23 GB. Unsloth indica un minimo di 41 GB in QLoRA per un modello da 70B e 22 GB per un modello da 27B. Il modello da 70B richiede quindi almeno due schede da 24 GB oppure una scheda di capacità maggiore.

#Domande frequenti

Domande frequenti
Qual è il migliore LLM per 24 GB di VRAM?+
Per un modello generalista, Qwen 3.8 27B in Q4: 16 GB di pesi secondo il catalogo QuelLLM, quindi 8 GB di margine per il contesto. Per la velocità, gpt-oss 20B (13 GB). Per il codice, Devstral Small 2 24B (14 GB) o Qwen3-Coder 30B-A3B (19 GB). Per un grosso MoE, Qwen 3.6 35B-A3B (21 GB), con un contesto breve.
24 GB: conviene ancora puntare a un 70B?+
No. Un 70B denso in Q4 pesa circa 40 GB: almeno 16 GB devono essere trasferiti nella RAM, e la velocità diventa troppo bassa per un uso interattivo. Un MoE da 30 a 35 miliardi di parametri rientra nella memoria della scheda. Per un 70B, prevedi due schede da 24 GB, cioè 48 GB.
RTX 3090, RTX 4090 o RX 7900 XTX per 24 GB?+
Tutte e tre hanno 24 GB. La scelta dipende dall'ecosistema — CUDA per le due RTX, ROCm 7 o Vulkan per la RX 7900 XTX — e dal prezzo del giorno, che non fissiamo. Consulta il monitoraggio dei prezzi del sito, che calcola il costo per gigabyte di VRAM.
Quanti token al secondo su 24 GB?+
Dipende dal modello e dalla scheda. Per un modello denso, il limite teorico è la larghezza di banda divisa per i pesi: circa 60 token/s per un 27B di 16 GB con una larghezza di banda di 960 GB/s, mai raggiunto esattamente. Non pubblichiamo misurazioni per scheda; ollama run con --verbose ti dà la tua misurazione.
24 GB sono sufficienti per il fine-tuning?+
Per il QLoRA di un modello fino a 14 miliardi di parametri, sì, sono più che sufficienti: Unsloth indica un minimo di 8,5 GB per un 14B. Un 27B richiede 22 GB, al limite. Il LoRA a 16 bit di un 14B (33 GB) e il QLoRA di un 70B (41 GB) non rientrano in 24 GB.
È possibile utilizzare due schede da 24 GB insieme?+
Sì, con llama.cpp, la cui modalità predefinita distribuisce i layer e la cache KV tra le GPU. Ottieni 48 GB, abbastanza per un 70B in Q4, ma la velocità per token non raddoppia, perché le schede lavorano in pipeline. Prevedi l'alimentazione e il raffreddamento per due schede.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.