◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Metodologia · aggiornamento 2026

Strumento di raccomandazione della quantizzazione

Una guida che associa il tuo budget di VRAM esatto alla quantizzazione GGUF, GPTQ o AWQ ottimale — senza procedere per tentativi, senza sprechi di memoria.

Formula base: VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. Il moltiplicatore 1,2 tiene conto della cache KV e dell'overhead delle attivazioni con un contesto di 8K.

Quale quantizzazione per la mia macchina?

Indica la quantità di memoria disponibile: lo strumento elenca i modelli del catalogo che vi rientrano, con la migliore quantizzazione possibile per ciascuno.

Caricamento del catalogo…

La scelta in 30 secondi

Individua qui sotto la tua VRAM disponibile, poi leggi quale modello, il più grande possibile, e quale quantizzazione vi rientrano con un contesto di 8K. Dimensioni comuni dei file GGUF (impostazioni predefinite di llama.cpp/Ollama, cache KV in FP16); l'ultima colonna indica quanta memoria resta per passare a un contesto di 16K.

VRAMGPU tipicaModello + quantizzazione consigliatiMargine 16K
6 GBRTX 3060 Laptop (6 GB), RTX 4050 LaptopQwen 3 4B Q5_K_M, o Qwen 3 8B Q3_K_MGiusto — passare a Q4_K_S
8 GBRTX 3050 8 GB, RTX 4060, RTX 5060Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_MOK in Q4_K_M
12 GBRTX 3060 12 GB, RTX 4070, RTX 5070Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_MSolo per un 14B
16 GBRTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080Qwen 3 14B Q6_K, Mistral Small 3.2 24B Q4_K_M (con poco margine)Buona per un 14B
24 GBRTX 3090, RTX 4090, RX 7900 XTXQwen 3 32B Q4_K_M, Qwen3-Coder 30B-A3B Q4_K_M, Gemma 3 27B Q4_K_MAl limite per un 32B denso; ampio margine per un 27B
32 GBRTX 5090Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_KSolo per il 32B in Q6_K
48 GBRTX 6000 Ada, 2× RTX 3090/4090Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_SSolo contesto breve (8K)
80 GBH100 80 GB, A100 80 GBgpt-oss 120B (MXFP4), Llama 3.3 70B Q8_0 (contesto breve)Gestisce agevolmente gpt-oss 120B

Il calcolo alla base della raccomandazione

La quantizzazione comprime ogni peso da FP16 (16 bit) a 2-8 bit. Un modello 7B in Q4_K_M utilizza in media ~4,85 bit/peso, ovvero 7.000.000.000 × 4,85 / 8 ≈ 4,2 GB. Aggiungendo la cache KV (che cresce con il contesto), si arriva a circa 5,5 GB con un contesto di 8K per un modello con attenzione a gruppi (Mistral 7B, Qwen, Llama 3). Con un contesto lungo, l'incidenza della cache KV supera di gran lunga quella del moltiplicatore ×1,2.

Valori di riferimento dei bit per peso

QuantBit/peso effettiviVRAM (8B)VRAM (32B)VRAM (70B)
FP1616,016,0 GB64,0 GB140,0 GB
Q8_08,58,5 GB34,0 GB74,4 GB
Q6_K6,66,6 GB26,4 GB57,8 GB
Q5_K_M5,75,7 GB22,8 GB49,9 GB
Q4_K_M4,834,83 GB19,3 GB42,3 GB
Q4_K_S4,584,58 GB18,3 GB40,1 GB
Q3_K_M3,93,9 GB15,6 GB34,1 GB
Q2_K3,353,35 GB13,4 GB29,3 GB

Perdita di qualità: cosa dicono veramente i numeri

La misura di riferimento rimane la perplessità pubblicata con i k-quants di llama.cpp (PR #1684, LLaMA 7B, FP16 = 5,9066). Minore è lo scarto, più il modello quantizzato si comporta come l'originale. Il brusco calo tra Q4_K_M e Q3_K_M è evidente, e il guadagno da Q5 a Q6 è minimo.

QuantPerplexità (LLaMA 7B)Differenza rispetto a FP16Verdetto
Q8_0—trascurabileIndistinguibile
Q6_K5,9110+0,07 %Quasi senza perdita
Q5_K_M5,9208+0,24 %Eccellente
Q4_K_M5,9601+0,91 %Punto di equilibrio
Q4_K_S6,0215+1,95 %Accettabile
Q3_K_M6,1503+4,13 %Percepibile
Q2_K6,7764+14,7 %Ultima risorsa

Misurazioni del 2023 su LLaMA 7B: i modelli più recenti, addestrati su una quantità molto maggiore di dati, sono spesso un po' più sensibili alla quantizzazione. L'ordine di grandezza rimane valido.

A parità di memoria, un modello più grande in Q4_K_M offre generalmente risultati migliori di un modello più piccolo in Q8_0. Nel dubbio, aumenta i parametri, non i bit.

GGUF, GPTQ o AWQ: il formato giusto, non solo il numero di bit corretto

GGUF (llama.cpp / Ollama / LM Studio): la scelta predefinita per l'inferenza con un solo utente, l'offload sulla CPU e Apple Silicon. GPTQ : 4 bit, inferenza esclusivamente su GPU con vLLM/TGI. AWQ : 4 bit, esclusivamente su GPU — l'opzione più veloce nel 2026 per l'inferenza in batch su RTX 4090, RTX 5090, H100/H200.

Casi d’usoMigliore formatoPerché
Singolo utente, postazione, stile ChatGPTGGUF Q4_K_MOffload sulla CPU, parte dei layer sulla GPU, funziona ovunque
Apple Silicon (M1-M5)GGUF Q4_K_M o MLX 4 bitKernel Metal, memoria unificata
API in batch, >4 utenti contemporaneiAWQ 4 bit su vLLMMiglior throughput con batch di grandi dimensioni
Ampere di precedente generazione (A100, RTX 3090)GPTQ 4 bit o AWQEntrambi funzionano; eseguire benchmark sul proprio caso d'uso

Domande frequenti

Q4_K_M è veramente il punto di equilibrio, o semplicemente popolare?

I due. Negli indici di perplessità pubblicati con i k-quants di llama.cpp (LLaMA 7B), Q4_K_M si discosta solo di circa lo 0,9% dal FP16 con una memoria pari a circa il 30%. Q5_K_M scende allo 0,2% di differenza con una memoria aggiuntiva di circa il 17% — raramente conveniente, a meno che la margine non sia libera.

Quanta VRAM serve per un modello 70B?

In Q4_K_M, circa 42 GB per i pesi, più da 2 a 3 GB di cache KV a 8K per Llama 3.3 70B (grazie all'attenzione raggruppata). Il modello entra in una scheda da 48 GB (RTX 6000 Ada) o in due schede da 24 GB (2×RTX 3090/4090), con un contesto breve. In Q2_K, i pesi scendono a circa 26 GB, ma la qualità cala nettamente.

GGUF, GPTQ o AWQ: quale scegliere?

GGUF per un uso monoutente su computer o Apple Silicon. AWQ per un servizio API in batch su GPU Ada, Hopper o Blackwell. GPTQ rimane una scelta storica che funziona ancora su Ampere, ma nel 2026 è raramente la più veloce.

Quantizzare la cache KV degrada la qualità?

La cache KV in Q8_0 dimezza le proprie dimensioni, con una perdita generalmente considerata trascurabile. In Q4_0, la perdita diventa misurabile: da riservare ai casi in cui è l'unico modo per far stare in memoria un contesto lungo.

I modelli MoE come DeepSeek V3 sono diversi?

Sì. Lo spazio di archiviazione dipende dal numero totale di parametri, quindi un MoE 671B richiede comunque centinaia di GB anche in Q4. La velocità, invece, dipende dai parametri attivi (37B per DeepSeek V3). Al di sotto di Q4, la perdita di qualità aumenta rapidamente; quantizzazioni dinamiche (come quelle di Unsloth per DeepSeek R1, ad esempio) mostrano tuttavia che un MoE molto grande può rimanere utilizzabile a 2 bit.

Come verificare che una quantizzazione rientri davvero nella VRAM?

Avvia nvidia-smi -l 1 durante la generazione di 500 token. Se l'uso della VRAM aumenta e poi si stabilizza, va bene. Se raggiunge un limite e i token/s crollano, parte del modello viene trasferita nella RAM di sistema: scendi di un livello di quantizzazione o riduci il contesto.

Vuoi andare oltre? Il calcolatore di VRAM calcola il fabbisogno esatto del tuo modello, e la nostra guida Q4 vs Q5 vs Q8 dettaglia i test di qualità.

Altri strumenti gratuiti