🇺🇸 Granite 4.1 8B Instruct
Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Classifica aggiornata il 09/10/2026
La Radeon RX 6700 XT (12 GB GDDR6, 384 GB/s) è la scheda AMD di fascia media con architettura RDNA 2. 12 GB sul mercato dell'usato a ~250 € = Qwen 3 14B Q4 accessibile tramite ROCm.
Radeon RX 6700 XT : alternativa d'acquisto disponibile per l'IA locale — Radeon RX 9070 XT 16 GB :
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link affiliati — QualeLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te; questo non influenza la classifica, definita in modo indipendente. In qualità di Partner Amazon, QualeLLM trae un beneficio dagli acquisti idonei.
Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Gemma 4 12B (Google): modello denso multimodale (testo, visione, audio), contesto da 256k, ~7 GB di VRAM in Q4. Apache 2.0, multilingue.
# HuggingFace : google/gemma-4-12B
Denso 14B con hybrid thinking. Eguaglia Qwen 2.5 32B Base in STEM/codice.
ollama run qwen3:14b
Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.
ollama pull granite4.2
Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.
ollama pull glm-5.3
Modello di ragionamento da 14B con licenza MIT. Supera R1-Distill-Llama-70B nelle valutazioni AIME24/25 di Microsoft con un quinto dei parametri.
ollama run phi4-reasoning:14b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Radeon RX 6700 XT |
|---|---|---|---|---|---|---|
| #1 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · Q8 |
| #2 | Gemma 4 12B | 12B | 7 GB | 262 144 | Apache 2.0 | 18 tok/s · Q5_K_M |
| #3 | Qwen 3 14B | 14B | 9 GB | 131 072 | Apache 2.0 | 6 tok/s · Q5_K_M |
| #4 | Granite 4.2 8B | 8B | 4.6 GB | 128 000 | Apache 2.0 | 32 tok/s · Q8 |
| #5 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | 32 tok/s · Q8 |
| #6 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | 32 tok/s · Q8 |
| #7 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT | 6 tok/s · Q5_K_M |
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: Q4_K_M ≤ 11 GB. Bonus 7-14B. 384 GB/s + ROCm 6.
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
RX 6700 XT vs RTX 3060 12 GB ?
6700 XT = 384 GB/s vs 3060 = 360 GB/s. Quasi identici. NVIDIA CUDA ROCm AMD: differenza di ecosistema. NVIDIA rimane più semplice. Vedi RTX 3060 12GB.
Qual è il punto ottimale per gli LLM sulla 6700 XT?
Mistral 7B Q5 (~5,5 GB) a 28 tok/s, Qwen 3 14B Q4 (~8 GB) a 18 tok/s. Prestazioni discrete per chat e codice.
ROCm su RDNA 2 nel 2026?
Supportato ma meno prioritario di RDNA 3/4. Resta stabile per Ollama/llama.cpp. Vedi guide.
È meglio una 7700 XT nuova?
7700 XT = gli stessi 12 GB + 432 GB/s + RDNA 3. Più moderna, circa 400 € da nuova. Vedi RX 7700 XT.