🇺🇸 DiffusionGemma 26B-A4B Instruct
DiffusionGemma 26B (Google): Gemma visivo-linguistico basato sulla diffusione, Instruct, contesto di 128k, 15 GB di VRAM in Q4. Apache 2.0. Uscita a giugno 2026.
# HuggingFace : google/diffusiongemma-26B-A4B-it
Classifica aggiornata il 22/09/2026
16 GB di VRAM sono il livello ideale per i LLM da 13 a 24B quantizzati. Schede di riferimento: RTX 4080/4080 Super, RTX 5080, 4070 Ti Super, 4060 Ti 16 GB, RX 7800 XT. Ecco i migliori modelli per questa fascia.
RTX 4080 : alternativa d'acquisto disponibile per l'IA locale — RTX 5080 16 GB :
Un mini-PC è una macchina completa: controlla la memoria necessaria e la compatibilità del software. Non sostituisce macOS/MLX o CUDA.
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
DiffusionGemma 26B (Google): Gemma visivo-linguistico basato sulla diffusione, Instruct, contesto di 128k, 15 GB di VRAM in Q4. Apache 2.0. Uscita a giugno 2026.
# HuggingFace : google/diffusiongemma-26B-A4B-it
Multimodale con 4B effettivi (testo+immagine+audio). 140 lingue. Per laptop ed edge.
ollama run gemma4:e4b
Specialista in programmazione 24B, Apache 2.0. 72.2% su SWE-Bench. 256k ctx, laboratorio francese.
ollama run devstral-small2:24b
Primo modello di ragionamento open di Mistral. AIME24 70.7%. Base Small 3.1 + addestramento CoT.
ollama run magistral:24b
Fratello minore di gpt-oss 120B. 21B/3.6B attivi. Pari a o3-mini su laptop.
ollama run openai/gpt-oss:20b
Modello di ragionamento compatto MoE 21B/3B attivi. Apache 2.0. Veloce grazie ai 3B attivi.
ollama pull hf.co/baidu/ernie-4.5-21b-GGUF
MoE 26B/3B attivi sviluppato da un laboratorio statunitense. Veloce grazie ai 3B attivi. Apache 2.0.
ollama pull hf.co/arcee-ai/Trinity-Mini-26B-GGUF
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su RTX 4080 |
|---|---|---|---|---|---|---|
| #1 | DiffusionGemma 26B-A4B Instruct | 26B | 15 GB | 128 000 | Apache 2.0 | 14 tok/s · Q4_K_M |
| #2 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | 40 tok/s · FP16 |
| #3 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 | 15 tok/s · Q4_K_M |
| #4 | Magistral Small 24B | 24B | 14 GB | 128 000 | Apache 2.0 | 15 tok/s · Q4_K_M |
| #5 | gpt-oss 20B | 21B | 13 GB | 128 000 | Apache 2.0 | 55 tok/s · Q5_K_M |
| #6 | ERNIE 4.5 21B-A3B Thinking | 21B | 13 GB | 131 072 | Apache 2.0 | 40 tok/s · Q5_K_M |
| #7 | Trinity Mini 26B-A3B | 26B | 15 GB | 131 072 | Apache 2.0 | 40 tok/s · Q4_K_M |
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Teniamo i modelli che entrano in Q4_K_M in 16 GB, preferendo quelli che riempiono bene la VRAM (50-95%) — segno che si sta sfruttando l'hardware.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
Quale LLM su RTX 4080 16 GB?
La nostra prima scelta: DiffusionGemma 26B-A4B Instruct. Per un buon compromesso qualità/velocità, resta su modelli da 13 a 24B quantizzati in Q4_K_M o Q5.
È possibile passare a Q5 o Q8 su 16 GB?
Sì per un 8-14B (Q5 di un 14B = ~10 GB, Q8 di un 8B = ~10 GB). No per un 24B (Q5 ≈ 17 GB, fuori budget). Q4 resta l'opzione per i 24B.
Gemma 2 27B entra in 16 GB?
Solo in Q4_K_M (≈ 16 GB) — proprio al limite. In Q5 supera la capacità disponibile (20 GB). Preferisci Mistral Small 3.1 24B in Q4 (14 GB) per mantenere un margine.
RTX 4080 vs RTX 4070 Ti Super per LLM ?
Entrambe hanno 16 GB, ma la 4080 è il 30–40% più veloce (tier 4 contro 3 nel nostro sistema di punteggio). Se il budget lo permette, la 4080 Super o la 5080 è chiaramente una scelta migliore.