Metodologia · aggiornamento 2026
Strumento di raccomandazione della quantizzazione
Una guida che associa il tuo budget di VRAM esatto alla quantizzazione GGUF, GPTQ o AWQ ottimale — senza procedere per tentativi, senza sprechi di memoria.
Formula base: VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. Il moltiplicatore 1,2 tiene conto della cache KV e dell'overhead delle attivazioni con un contesto di 8K.
Quale quantizzazione per la mia macchina?
Indica la quantità di memoria disponibile: lo strumento elenca i modelli del catalogo che vi rientrano, con la migliore quantizzazione possibile per ciascuno.
Caricamento del catalogo…
La scelta in 30 secondi
Individua qui sotto la tua VRAM disponibile, poi leggi quale modello, il più grande possibile, e quale quantizzazione vi rientrano con un contesto di 8K. Dimensioni comuni dei file GGUF (impostazioni predefinite di llama.cpp/Ollama, cache KV in FP16); l'ultima colonna indica quanta memoria resta per passare a un contesto di 16K.
| VRAM | GPU tipica | Modello + quantizzazione consigliati | Margine 16K |
|---|---|---|---|
| 6 GB | RTX 3060 Laptop (6 GB), RTX 4050 Laptop | Qwen 3 4B Q5_K_M, o Qwen 3 8B Q3_K_M | Giusto — passare a Q4_K_S |
| 8 GB | RTX 3050 8 GB, RTX 4060, RTX 5060 | Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_M | OK in Q4_K_M |
| 12 GB | RTX 3060 12 GB, RTX 4070, RTX 5070 | Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_M | Solo per un 14B |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080 | Qwen 3 14B Q6_K, Mistral Small 3.2 24B Q4_K_M (con poco margine) | Buona per un 14B |
| 24 GB | RTX 3090, RTX 4090, RX 7900 XTX | Qwen 3 32B Q4_K_M, Qwen3-Coder 30B-A3B Q4_K_M, Gemma 3 27B Q4_K_M | Al limite per un 32B denso; ampio margine per un 27B |
| 32 GB | RTX 5090 | Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_K | Solo per il 32B in Q6_K |
| 48 GB | RTX 6000 Ada, 2× RTX 3090/4090 | Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_S | Solo contesto breve (8K) |
| 80 GB | H100 80 GB, A100 80 GB | gpt-oss 120B (MXFP4), Llama 3.3 70B Q8_0 (contesto breve) | Gestisce agevolmente gpt-oss 120B |
Il calcolo alla base della raccomandazione
La quantizzazione comprime ogni peso da FP16 (16 bit) a 2-8 bit. Un modello 7B in Q4_K_M utilizza in media ~4,85 bit/peso, ovvero 7.000.000.000 × 4,85 / 8 ≈ 4,2 GB. Aggiungendo la cache KV (che cresce con il contesto), si arriva a circa 5,5 GB con un contesto di 8K per un modello con attenzione a gruppi (Mistral 7B, Qwen, Llama 3). Con un contesto lungo, l'incidenza della cache KV supera di gran lunga quella del moltiplicatore ×1,2.
Valori di riferimento dei bit per peso
| Quant | Bit/peso effettivi | VRAM (8B) | VRAM (32B) | VRAM (70B) |
|---|---|---|---|---|
| FP16 | 16,0 | 16,0 GB | 64,0 GB | 140,0 GB |
| Q8_0 | 8,5 | 8,5 GB | 34,0 GB | 74,4 GB |
| Q6_K | 6,6 | 6,6 GB | 26,4 GB | 57,8 GB |
| Q5_K_M | 5,7 | 5,7 GB | 22,8 GB | 49,9 GB |
| Q4_K_M | 4,83 | 4,83 GB | 19,3 GB | 42,3 GB |
| Q4_K_S | 4,58 | 4,58 GB | 18,3 GB | 40,1 GB |
| Q3_K_M | 3,9 | 3,9 GB | 15,6 GB | 34,1 GB |
| Q2_K | 3,35 | 3,35 GB | 13,4 GB | 29,3 GB |
Perdita di qualità: cosa dicono veramente i numeri
La misura di riferimento rimane la perplessità pubblicata con i k-quants di llama.cpp (PR #1684, LLaMA 7B, FP16 = 5,9066). Minore è lo scarto, più il modello quantizzato si comporta come l'originale. Il brusco calo tra Q4_K_M e Q3_K_M è evidente, e il guadagno da Q5 a Q6 è minimo.
| Quant | Perplexità (LLaMA 7B) | Differenza rispetto a FP16 | Verdetto |
|---|---|---|---|
| Q8_0 | — | trascurabile | Indistinguibile |
| Q6_K | 5,9110 | +0,07 % | Quasi senza perdita |
| Q5_K_M | 5,9208 | +0,24 % | Eccellente |
| Q4_K_M | 5,9601 | +0,91 % | Punto di equilibrio |
| Q4_K_S | 6,0215 | +1,95 % | Accettabile |
| Q3_K_M | 6,1503 | +4,13 % | Percepibile |
| Q2_K | 6,7764 | +14,7 % | Ultima risorsa |
Misurazioni del 2023 su LLaMA 7B: i modelli più recenti, addestrati su una quantità molto maggiore di dati, sono spesso un po' più sensibili alla quantizzazione. L'ordine di grandezza rimane valido.
A parità di memoria, un modello più grande in Q4_K_M offre generalmente risultati migliori di un modello più piccolo in Q8_0. Nel dubbio, aumenta i parametri, non i bit.
GGUF, GPTQ o AWQ: il formato giusto, non solo il numero di bit corretto
GGUF (llama.cpp / Ollama / LM Studio): la scelta predefinita per l'inferenza con un solo utente, l'offload sulla CPU e Apple Silicon. GPTQ : 4 bit, inferenza esclusivamente su GPU con vLLM/TGI. AWQ : 4 bit, esclusivamente su GPU — l'opzione più veloce nel 2026 per l'inferenza in batch su RTX 4090, RTX 5090, H100/H200.
| Casi d’uso | Migliore formato | Perché |
|---|---|---|
| Singolo utente, postazione, stile ChatGPT | GGUF Q4_K_M | Offload sulla CPU, parte dei layer sulla GPU, funziona ovunque |
| Apple Silicon (M1-M5) | GGUF Q4_K_M o MLX 4 bit | Kernel Metal, memoria unificata |
| API in batch, >4 utenti contemporanei | AWQ 4 bit su vLLM | Miglior throughput con batch di grandi dimensioni |
| Ampere di precedente generazione (A100, RTX 3090) | GPTQ 4 bit o AWQ | Entrambi funzionano; eseguire benchmark sul proprio caso d'uso |
Domande frequenti
Q4_K_M è veramente il punto di equilibrio, o semplicemente popolare?
I due. Negli indici di perplessità pubblicati con i k-quants di llama.cpp (LLaMA 7B), Q4_K_M si discosta solo di circa lo 0,9% dal FP16 con una memoria pari a circa il 30%. Q5_K_M scende allo 0,2% di differenza con una memoria aggiuntiva di circa il 17% — raramente conveniente, a meno che la margine non sia libera.
Quanta VRAM serve per un modello 70B?
In Q4_K_M, circa 42 GB per i pesi, più da 2 a 3 GB di cache KV a 8K per Llama 3.3 70B (grazie all'attenzione raggruppata). Il modello entra in una scheda da 48 GB (RTX 6000 Ada) o in due schede da 24 GB (2×RTX 3090/4090), con un contesto breve. In Q2_K, i pesi scendono a circa 26 GB, ma la qualità cala nettamente.
GGUF, GPTQ o AWQ: quale scegliere?
GGUF per un uso monoutente su computer o Apple Silicon. AWQ per un servizio API in batch su GPU Ada, Hopper o Blackwell. GPTQ rimane una scelta storica che funziona ancora su Ampere, ma nel 2026 è raramente la più veloce.
Quantizzare la cache KV degrada la qualità?
La cache KV in Q8_0 dimezza le proprie dimensioni, con una perdita generalmente considerata trascurabile. In Q4_0, la perdita diventa misurabile: da riservare ai casi in cui è l'unico modo per far stare in memoria un contesto lungo.
I modelli MoE come DeepSeek V3 sono diversi?
Sì. Lo spazio di archiviazione dipende dal numero totale di parametri, quindi un MoE 671B richiede comunque centinaia di GB anche in Q4. La velocità, invece, dipende dai parametri attivi (37B per DeepSeek V3). Al di sotto di Q4, la perdita di qualità aumenta rapidamente; quantizzazioni dinamiche (come quelle di Unsloth per DeepSeek R1, ad esempio) mostrano tuttavia che un MoE molto grande può rimanere utilizzabile a 2 bit.
Come verificare che una quantizzazione rientri davvero nella VRAM?
Avvia nvidia-smi -l 1 durante la generazione di 500 token. Se l'uso della VRAM aumenta e poi si stabilizza, va bene. Se raggiunge un limite e i token/s crollano, parte del modello viene trasferita nella RAM di sistema: scendi di un livello di quantizzazione o riduci il contesto.
Vuoi andare oltre? Il calcolatore di VRAM calcola il fabbisogno esatto del tuo modello, e la nostra guida Q4 vs Q5 vs Q8 dettaglia i test di qualità.