Quale LLM per 24 GB di VRAM ?
Con 24 GB di VRAM, carica un modello denso da 27 miliardi in Q4 come Qwen 3.8 27B (16 GB di pesi, 8 GB di margine) o un modello MoE da 30 a 35 miliardi (da 19 a 21 GB). Un modello denso da 70 miliardi in Q4 (circa 40 GB) non entra in memoria: richiede due schede o memoria unificata.
Ventiquattro gigabyte di VRAM sono la soglia per i modelli da 27 a 35 miliardi di parametri. Questa guida spiega quali modelli ci stanno, quali schede hanno davvero 24 GB, quale limite di velocità consente la loro larghezza di banda e fino a dove si può arrivare con il fine-tuning.
Stai scegliendo un computer? Le nostre scelte per budget →
Buon rapporto qualità/prezzo per l'IA locale: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC è una macchina completa: verifica la memoria disponibile e la compatibilità del motore. Non sostituisce macOS/MLX o CUDA.
Perché questa scelta? La nostra scheda completa su GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#24 GB di VRAM: la fascia dei modelli da 27 a 35 miliardi
Con 24 GB di VRAM, carichi interamente in memoria un modello denso da 27 miliardi di parametri in Q4 (16 GB di pesi secondo il catalogo QuelLLM), con 8 GB di margine per il contesto, oppure un modello MoE da 30 a 35 miliardi di parametri, di cui 3 miliardi attivi (da 19 a 21 GB), con un contesto più breve. Un modello denso da 70B in Q4 pesa circa 40 GB: non ci sta e richiede due schede o memoria unificata. La soglia dei 24 GB è quella a cui si passa dai modelli da 9 a 14 miliardi a quelli che rivaleggiano con i grandi modelli di ieri.
| Modello | Pesi Q4 | Margine su 24 GB | Nota |
|---|---|---|---|
| gpt-oss 20B (MoE) | 13 GB | 11 GB | Molto ampio, contesto lungo |
| Devstral Small 2 24B | 14 GB | 10 GB | Agente di programmazione |
| Qwen 3.8 27B | 16 GB | 8 GB | Denso, generalista, contesto dichiarato di 262.144 token |
| Gemma 4 31B | 18 GB | 6 GB | Denso, Q5 da 22 GB con un margine troppo ridotto |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | Codice, 3 miliardi di parametri attivi |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | Contesto breve, entra appena in memoria |
| Qwen 3.8 27B in Q8 | 29 GB | No | Supera la capacità disponibile |
Una correzione rispetto a una versione precedente di questa guida: indicava talvolta 18 GB e talvolta 16 GB per Qwen 3.8 27B, e 23 GB per Qwen 3.6 35B-A3B. Il catalogo indica 16 GB e 21 GB. Questi valori sono pesi in Q4 arrotondati; aggiungi sempre la cache KV e circa un gigabyte di margine.
#Quali schede hanno 24 GB e qual è la differenza
Tre schede destinate al grande pubblico dominano questa fascia. NVIDIA descrive la RTX 3090 con 24 GB di GDDR6X e la RTX 4090 con 24 GB di GDDR6X. AMD indica 24 GB di GDDR6 e una larghezza di banda fino a 960 GB/s per la RX 7900 XTX. La RTX 5090, con 32 GB di GDDR7 su un bus a 512 bit secondo NVIDIA, appartiene alla fascia superiore. Non confonderla con la RX 7900 XT, che ha 20 GB: la tabella delle prestazioni di llama.cpp la elenca con 20 GB di GDDR6.
| Scheda | Software | Da preferire se | Guide |
|---|---|---|---|
| RTX 3090 / 3090 Ti | CUDA | Vuoi CUDA e un prezzo d'ingresso contenuto sul mercato dell'usato | LLM su RTX 3090 |
| RTX 4090 | CUDA | Vuoi CUDA su un'architettura più recente | LLM su RTX 4090 |
| RX 7900 XTX | ROCm 7 o Vulkan | Usi Linux e accetti ROCm | LLM su RX 7900 XTX |
La scelta dipende da tre criteri: l'ecosistema software, l'età della scheda (stato, garanzia) e il prezzo del giorno, che non fissiamo. Il monitoraggio dei prezzi del sito fornisce il costo del gigabyte di VRAM, aggiornato due volte a settimana; è l'indicatore giusto per scegliere tra una scheda usata da 24 GB e una nuova da 16 GB.
#Quale modello scegliere con 24 GB a seconda dell'uso
| Uso | Modello | Perché |
|---|---|---|
| Generalista versatile | Qwen 3.8 27B Q4 | Denso, 8 GB di margine per il contesto |
| Velocità e ragionamento | gpt-oss 20B | MoE leggero, 11 GB di margine |
| Codice e agenti di sviluppo | Devstral Small 2 24B o Qwen3-Coder 30B-A3B | 14 o 19 GB, contesto a seconda del margine |
| Modello MoE più grande | Qwen 3.6 35B-A3B Q4 | 21 GB, 3 miliardi di parametri attivi, contesto breve |
| Agenti e chiamate a strumenti | GLM 4.7 Flash Q4 | 19 GB, licenza MIT secondo il catalogo |
La scelta tra un modello denso e un MoE è il vero compromesso a questo livello. Un modello denso da 27 miliardi di parametri legge tutti i suoi pesi a ogni token: è più lento di un MoE, ma lascia più VRAM al contesto. Un MoE da 35 miliardi di parametri legge solo i parametri attivi, quindi genera più velocemente, ma il suo peso totale occupa quasi tutta la scheda. La guida sui MoE spiega il meccanismo.
#E il 70B? Ciò che 24 GB permettono veramente
Un modello denso da 70B in Q4 ha pesi che occupano circa 40 GB secondo il riferimento del sito: supera i 24 GB di almeno 16 GB. Occorrerebbe trasferire questa parte nella RAM di sistema, e la generazione avverrebbe quindi alla velocità della RAM e del bus PCIe, non a quella della scheda. Non indichiamo una velocità di generazione per questo caso, in assenza di una fonte verificabile: tieni presente che è troppo lento per un uso interattivo confortevole. I MoE da 30 a 35 miliardi di parametri sono, a parità di qualità, la risposta pratica a questo limite.
- Una sola scheda da 24 GB
- MoE da 30-35B in Q4, modelli densi da 27-31B in Q4 o Q5, con da 3 a 8 GB per il contesto.
- Due schede da 24 GB (48 GB)
- 70B in Q4 (circa 40 GB) con un po' di contesto, distribuendo gli strati tra le schede.
- Una scheda da 32 GB
- La RTX 5090: un 70B in Q4 continua a non entrare nella memoria di una sola scheda, mentre i modelli densi da 27 a 32 miliardi di parametri ci stanno comodamente.
In llama.cpp, la modalità di distribuzione predefinita suddivide il modello per strati tra le schede, in pipeline, con proporzioni regolabili per ciascuna scheda. Il vantaggio riguarda la capacità, non la velocità per token, poiché le schede lavorano una dopo l'altra.
#Velocità: il limite imposto dalla banda passante
Durante la generazione, per ogni token viene letta la maggior parte dei pesi di un modello denso: il limite massimo teorico è la larghezza di banda divisa per la dimensione dei pesi. La scheda tecnica AMD indica 960 GB/s per la RX 7900 XTX; per le schede NVIDIA, consulta la larghezza di banda nella scheda tecnica del modello esatto. La tabella indica il limite massimo per incrementi di 100 GB/s per i modelli densi; i modelli MoE leggono meno pesi per token e sono più veloci.
| Modello in Q4 | Pesi letti | Per ogni 100 GB/s | Esempio 960 GB/s (7900 XTX) |
|---|---|---|---|
| Devstral Small 2 24B | 14 GB | ≈ 7 token/s | ≈ 69 token/s |
| Qwen 3.8 27B | 16 GB | ≈ 6 tokens/s | 60 token/s |
| Gemma 4 31B | 18 GB | ≈ 5,6 token/s | ≈ 53 token/s |
Questi valori sono limiti massimi, mai misurazioni: la velocità reale è più bassa e varia in base al driver, al software e al contesto. Non pubblichiamo dati sui token al secondo per scheda, perché manca un banco di prova pubblico comparabile per questi modelli. Per misurare la tua installazione, esegui ollama run con l'opzione --verbose.
#Il contesto: il vero limite con 24 GB
Su 24 GB, la cache KV determina la lunghezza del contesto utilizzabile. Un Qwen 3.8 27B in Q4 lascia 8 GB, un Qwen 3.6 35B-A3B ne lascia soltanto 3 GB. Ollama utilizza di default un contesto di 4.096 token secondo la sua documentazione, modificabile con OLLAMA_CONTEXT_LENGTH. Per risparmiare spazio, quantizza la cache: OLLAMA_KV_CACHE_TYPE=q8_0 utilizza circa la metà della memoria rispetto al formato f16 predefinito, a condizione che Flash Attention sia attiva.
#Un calcolo del margine in tre righe
Per sapere se un modello e il suo contesto rientrano nella memoria disponibile, somma tre termini: il peso indicato nel catalogo, la cache KV e circa un gigabyte di margine. Prendiamo due esempi con i pesi del catalogo. Un Qwen 3.8 27B in Q5 pesa 19 GB: restano 24 meno 19 meno 1, cioè 4 GB per la cache KV. Un Qwen 3.6 35B-A3B in Q4 pesa 21 GB: restano 24 meno 21 meno 1, cioè soltanto 2 GB, quindi un contesto breve, a meno che tu non quantizzi la cache. Lo stesso 27B in Q4 (16 GB) lascia liberi 7 GB, consentendo un contesto molto più lungo.
Questo calcolo spiega una scelta comune: preferire la quantizzazione Q4 alla Q5 quando il contesto è la priorità, e la Q5 alla Q4 quando lavori su testi brevi e la fedeltà del modello conta. La guida alla scelta della quantizzazione illustra nel dettaglio le differenze di qualità, mentre la guida alla cache KV spiega il risparmio di spazio.
#Acquistare una scheda da 24 GB usata: i controlli da fare
Le schede da 24 GB più diffuse risalgono al periodo dal 2020 al 2022: ne circolano molte usate e alcune hanno funzionato a lungo senza interruzioni. Prima di acquistare, chiedi una schermata di un test sotto carico, verifica la temperatura della memoria durante il test e controlla il rumore delle ventole. Assicurati che la capacità indicata nel driver sia effettivamente di 24 GB, che l'alimentatore di cui disponi supporti il consumo della scheda e che ci sia spazio nel case. I prezzi di queste schede cambiano da una settimana all'altra: il monitoraggio dei prezzi del sito permette di confrontare il costo per gigabyte di VRAM tra nuovo e usato.
#Fine-tuning con 24 GB: cosa entra in memoria e cosa no
La documentazione di Unsloth pubblica una tabella della VRAM minima per dimensione del modello e per metodo, precisando che si tratta di minimi assoluti. In QLoRA (4 bit), un modello da 7B richiede 5 GB, uno da 14B 8,5 GB e uno da 27B 22 GB. In LoRA a 16 bit, un modello da 8B richiede 22 GB e uno da 14B 33 GB. Con 24 GB, quindi, il QLoRA di un modello fino a 14 miliardi di parametri si esegue con un buon margine, quello di un 27B rientra appena nella memoria disponibile, senza margine, mentre il LoRA a 16 bit di un 14B è impossibile.
| Modello | QLoRA (4 bit) | LoRA (16 bit) | Su 24 GB |
|---|---|---|---|
| 7B | 5 GB | 19 GB | QLoRA e LoRA |
| 9B | 6,5 GB | 24 GB | QLoRA; LoRA senza margine |
| 14B | 8,5 GB | 33 GB | Solo QLoRA |
| 27B | 22 GB | 64 GB | QLoRA al limite |
| 32B | 26 GB | 76 GB | No |
| 70B | 41 GB | 164 GB | No |
- Quale LLM per 32 GB di VRAM
- Quale LLM per 16 GB di VRAM
- LLM su RTX 3090 / 3090 Ti (24 GB)
- LLM su RX 7900 XTX (24 GB)
- MoE spiegato: perché un 30B-A3B gira come un modello piccolo
- Prezzi delle schede grafiche per l'IA locale
- Fonte: requisiti di VRAM di Unsloth
- Fonte: FAQ di Ollama (contesto, cache KV)
- Fonte: scheda NVIDIA della RTX 4090
- Fonte: scheda AMD della RX 7900 XTX
#Domande frequenti
Qual è il migliore LLM per 24 GB di VRAM?+
24 GB: conviene ancora puntare a un 70B?+
RTX 3090, RTX 4090 o RX 7900 XTX per 24 GB?+
Quanti token al secondo su 24 GB?+
24 GB sono sufficienti per il fine-tuning?+
È possibile utilizzare due schede da 24 GB insieme?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.