Migliore LLM su Radeon RX 9070 XT (16 GB) nel 2026
Identificare il miglior LLM per RX 9070 XT richiede di comprendere due vincoli che interagiscono: 16 GB di VRAM GDDR6 e l'ecosistema ROCm di AMD, ora funzionale sull'architettura RDNA4. La RX 9070 XT rappresenta nel 2026 il punto di ingresso più accessibile per eseguire modelli da 27 miliardi di parametri con quantizzazione Q4 su GPU di fascia consumer sotto Linux o Windows. Questa guida esamina le specifiche hardware, seleziona i modelli del catalogo quelllm.fr adatti a questa scheda, confronta le licenze, fornisce indicazioni sulla velocità e propone raccomandazioni per caso d'uso.
RX 9070 XT e ROCm: ciò che bisogna sapere prima di scegliere un modello
La Radeon RX 9070 XT dispone di 16 GB di memoria GDDR6 su un bus da 256 bit, offrendo una banda passante teorica di circa 576 GB/s. L'architettura RDNA4 è supportata a partire da ROCm 6.x, che permette di utilizzare llama.cpp compilato con il backend HIP, Ollama ≥ 0.3.x o LM Studio — a condizione di disporre dei driver amdgpu recenti su Linux, o di un'installazione ROCm per Windows.
Punti chiave prima di avviare un modello :
- VRAM utilizzabile : ~15,5 GB in pratica, al netto dell'overhead del sistema e dei driver
- Larghezza di banda : ~576 GB/s (stimato), contro ~1 008 GB/s per una RTX 4090 — la velocità di inferenza è proporzionalmente ridotta
- Backend più stabile : llama.cpp con
-DGGML_HIPBLAS=ONsu Linux - Compatibilità : verificare la matrice di compatibilità AMD per il kernel e il driver esatti che usi
- Precisione nativa : supporto FP16 fornito dalle unità di calcolo RDNA4
La buona notizia: i modelli intorno ai 27B con quantizzazione Q4 sono perfettamente adatti a 16 GB, e la famiglia dei 24B offre un margine confortevole per contesti lunghi.
Quali modelli rientrano in 16 GB di VRAM?
La regola approssimativa per Q4 è di circa 0,55 GB per miliardo di parametri. Un modello da 27B pesa quindi circa 15-16 GB in Q4, un 24B circa 13-14 GB e un 32B circa 18-19 GB — oltre la soglia.
Modelli 26-27B con compatibilità nativa in Q4 (≤ 16 GB)
- Gemma 2 27B — VRAM Q4 : ~16 GB, ctx : 8 192
- Gemma 3 27B — VRAM Q4 : ~16 GB, ctx : 128 000
- Qwen 3.5 27B — VRAM Q4 : ~16 GB, ctx : 262 000
- Qwen 3.6 27B — VRAM Q4 : ~16 GB, ctx : 262 144
- Qwen 3.8 27B — VRAM Q4 : ~16 GB, ctx : 262 144
- Gemma 4 26B-A4B MoE — VRAM Q4 : ~16 GB, ctx : 128.000, architettura mixture-of-experts
- Trinity Mini 26B-A3B — VRAM Q4 : ~15 GB, ctx : 131 072
Modelli 24B (ampio margine, 2-3 GB liberi)
- Mistral Small 3.2 24B — VRAM Q4 : ~14 GB
- Magistral Small 24B — VRAM Q4 : ~14 GB
- Devstral Small 2 24B — VRAM Q4 : ~14 GB, ctx : 256 000
Modelli 20-22B (ampio margine, ~3-5 GB liberi)
- Codestral 22B v0.1 — VRAM Q4 : ~13 GB, ctx : 32 000
- EuroLLM 22B Instruct 2512 — VRAM Q4 : ~13 GB, multilingue europeo
- gpt-oss 20B — VRAM Q4 : ~13 GB, ctx : 128 000
Nota sui 32B : in Q4 (~19 GB), superano i 16 GB disponibili. In Q3 (~13-14 GB, cioè ~0,42 GB/B), è tecnicamente possibile con una perdita di precisione misurabile. Sulla 9070 XT, rimanere sui 27B in Q4 resta la scelta più razionale.
Top 5 dei modelli raccomandati per la RX 9070 XT
1. Qwen 3.8 27B — versatilità e contesto lungo
Qwen 3.8 27B è la versione più avanzata della serie Qwen 3.x nella fascia 27B, pubblicata da Alibaba con licenza Apache 2.0. Il suo contesto di 262.144 token è uno dei più ampi disponibili in questa fascia di dimensioni. Occupa interamente i 16 GB in Q4 senza superarne la capacità.
- Licenza : Apache 2.0 (uso commerciale autorizzato)
- VRAM Q4 : ~16 GB
- Contesto : 262.144 token
- Punti di forza : ragionamento generale, codice, domande a lungo raggio
- Velocità stimata : 20-30 tokens/s su RX 9070 XT (stimato sulla base dei benchmark della comunità, proporzionale alla banda passante)
2. Gemma 3 27B — prestazioni validate, contesto 128 k
Gemma 3 27B di Google offre 128.000 token di contesto e un'architettura ben documentata. Le sue prestazioni sul Open LLM Leaderboard di Hugging Face lo collocano tra i punti di riferimento nella categoria 27B per la comprensione e il rispetto delle istruzioni.
- Licenza : Gemma (limitazioni per alcuni usi commerciali — vedi i Termini e Condizioni di Google)
- VRAM Q4 : ~16 GB
- Contesto : 128 000 token
- Punti di forza : comprensione delle relazioni tra parti distanti del testo, rispetto preciso delle istruzioni
3. Magistral Small 24B — ragionamento strutturato
Magistral Small 24B di Mistral AI è progettato per compiti di ragionamento a più fasi e per l'analisi strutturata. Con circa 14 GB in Q4, lascia 2 GB di margine sulla 9070 XT — utile per mantenere un contesto di sistema esteso in produzione.
- Licenza : Apache 2.0
- VRAM Q4 : ~14 GB
- Contesto : 128 000 token
- Punti di forza : analisi, riassunto strutturato, agente a fasi, ragionamento a catena
4. Devstral Small 2 24B — agente di sviluppo software
Devstral Small 2 24B (Apache 2.0, Mistral AI) mira esplicitamente agli agenti di sviluppo con un contesto eccezionale di 256.000 token. Può inglobare interamente una base di codice in una sola passata, rendendolo pertinente per la revisione automatica, la generazione di test o la documentazione.
- Licenza : Apache 2.0
- VRAM Q4 : ~14 GB
- Contesto : 256.000 token
- Punti di forza : generazione di codice, refactoring, lettura di un'ampia base di codice
5. Codestral 22B v0.1 — specialista del codice, leggero
Codestral 22B v0.1 di Mistral AI è uno dei punti di riferimento tra i modelli per il codice con meno di 23B parametri. Supporta il fill-in-the-middle (FIM) e raggiunge punteggi HumanEval superiori a quelli dei modelli generalisti delle stesse dimensioni (punteggi esatti su GGUF Q4: da confermare). Pesa solo circa 13 GB in Q4.
- Licenza : Mistral Non-Production License (uso esclusivamente non commerciale)
- VRAM Q4 : ~13 GB
- Contesto : 32.000 token
- Punti di forza : completamento del codice, FIM, integrazione con IDE
Licenze: Apache 2.0, MIT, Gemma — cosa cambia in base all'uso
La scelta della licenza determina l'uso in azienda o in un prodotto.
Licenze libere per uso commerciale (Apache 2.0 o MIT)
- Qwen 3.5 27B, Qwen 3.6 27B, Qwen 3.8 27B — Apache 2.0
- Trinity Mini 26B-A3B — Apache 2.0
- Magistral Small 24B, Devstral Small 2 24B, Mistral Small 3.2 24B — Apache 2.0
- EuroLLM 22B Instruct 2512, gpt-oss 20B — Apache 2.0
- Phi-4 14B — MIT
Licenze restrittive
- Licenza Gemma (Gemma 2 27B, Gemma 3 27B, Gemma 4 26B-A4B MoE): richiede l'accettazione delle condizioni d'uso Google Gemma ; alcuni usi commerciali sono soggetti a restrizioni
- Mistral Non-Production License : Codestral 22B è riservato ai contesti non commerciali e di ricerca
Per una visione sintetica delle licenze disponibili nel catalogo, consultare il guida alle licenze degli LLM open-weights.
Benchmark e prestazioni attese sulla RX 9070 XT
I punteggi seguenti provengono dalle pubblicazioni ufficiali o dai benchmark della comunità. Le velocità di inferenza sulla RX 9070 XT sono stimate a partire da misurazioni su altre GPU ponderate in base alla rispettiva banda passante della memoria.
MMLU — valutazione generale
- Serie Qwen 3.x 27B: prestazioni MMLU superiori al 75% in 5-shot riportate sulla pagina Qwen di HuggingFace per le varianti di queste dimensioni (da confermare in Q4)
- Gemma 3 27B: risultati pubblicati da Google nella documentazione ufficiale Gemma — verificare la degradazione in Q4 in base al livello di quantizzazione
- Magistral Small 24B : metriche di ragionamento pubblicate da Mistral AI nelle note di versione
HumanEval — generazione di codice
- Devstral Small 2 24B: progettato per agenti di programmazione, punteggio HumanEval superiore a quello dei modelli generalisti delle stesse dimensioni (da confermare su GGUF Q4)
- Codestral 22B: punto di riferimento nella categoria dei modelli per il codice sotto i 23B secondo i benchmark della comunità riportati su r/LocalLLaMA
Velocità di inferenza (stimata)
- Modelli 27B Q4: 20-35 token/s su RX 9070 XT
- Modelli 24B Q4 : 35-50 token/s
- Modelli 14-22B Q4 : 50-80 token/s
Questi intervalli dipendono dal backend (llama.cpp HIP vs ROCm nativo), dal livello di parallelismo e dalla lunghezza del contesto attivo. Con un contesto vicino al massimo (262 k token), la velocità cala significativamente.
Casi d'uso concreti
Sviluppo software e revisione del codice Devstral Small 2 24B per gli agenti che lavorano su più file e i progetti di grandi dimensioni; Codestral 22B per la completazione e il FIM all'interno di un IDE. I due vengono eseguiti con margine sulla 9070 XT.
Analisi di documenti lunghi Qwen 3.8 27B con i suoi 262.144 token di contesto permette di analizzare contratti o rapporti voluminosi in una sola richiesta. Gemma 3 27B (128 000 token) è un'alternativa solida sotto licenza Gemma.
Multilinguismo e francese EuroLLM 22B Instruct 2512 è stato addestrato specificamente sulle lingue europee, tra cui francese, tedesco e spagnolo. Può essere eseguito sulla 9070 XT lasciando circa 3 GB di margine.
Modello veloce e leggero Phi-4 14B (MIT, Microsoft) occupa circa 9 GB in Q4 e libera 7 GB per un contesto molto esteso o sessioni simultanee. Utile quando la velocità è più importante della dimensione del modello.
Ragionamento e agenti Magistral Small 24B per catene di ragionamento strutturate e agenti semplici. Trinity Mini 26B-A3B (Apache 2.0, Arcee AI) a circa 15 GB in Q4 offre un buon compromesso tra ragionamento e dimensione.
Per confrontare due modelli direttamente, utilizzare il comparatore quelllm.fr.
FAQ
Q: La RX 9070 XT è ben supportata da ROCm?
ROCm 6.x include il supporto per l'architettura RDNA4 (navi48). Su Linux con i driver amdgpu-dkms recenti, llama.cpp HIP funziona in modo stabile. Su Windows, ROCm for Windows è ancora in fase di maturazione — consultare la matrice di compatibilità AMD prima di qualsiasi configurazione. Le prestazioni su Linux sono generalmente migliori rispetto all'ambiente Windows per ora.
Q: È possibile eseguire un modello 32B su una RX 9070 XT con 16 GB?
In Q4 (~19 GB per un 32B), no — si supera la capacità della VRAM. In Q3 (~13-14 GB), è fattibile con una perdita di precisione significativa. In pratica, i modelli da 27B in Q4 offrono un migliore rapporto qualità/dimensione su questa scheda: stesso livello di inferenza, piena precisione Q4 e nessun rischio di superare la capacità della VRAM.
Q: Qual è la quantizzazione da scegliere tra Q4, Q5 e Q8?
Q4_K_M è il punto di partenza migliore: perdita di qualità bassa, dimensione ridotta a metà rispetto al FP16. Q5_K_M migliora la precisione con un aumento di circa +25% di VRAM. Q8_0 è vicino al FP16 ma supera i 16 GB per la maggior parte dei 27B. Su una 9070 XT, Q4_K_M su 27B o Q5_K_M su 24B sono scelte razionali. FP16 completo su 27B (~30 GB) è fuori portata.
Q: Ollama funziona sulla RX 9070 XT sotto Linux?
Sì. Ollama ≥ 0.3.x rileva automaticamente le GPU AMD compatibili con ROCm su Linux se i driver amdgpu-dkms sono installati correttamente. Non è necessaria alcuna configurazione manuale nella maggior parte dei casi. Su Windows, il supporto dipende dalla versione di ROCm for Windows disponibile al momento dell'installazione.
Q: Quale modello consigli per il francese corrente?
EuroLLM 22B Instruct 2512 è il più mirato per le lingue europee. Mistral Small 3.2 24B di Mistral AI (Apache 2.0) offre prestazioni eccellenti in francese per compiti generali e scrittura assistita, con un buon margine sulla 9070 XT.
Q: Qwen 3.8 27B o Gemma 3 27B: quale scegliere?
Entrambi occupano ~16 GB in Q4. Qwen 3.8 27B è distribuito con licenza Apache 2.0 (uso commerciale libero) e offre un contesto più ampio (262 144 vs 128 000 token). Gemma 3 27B è soggetto alla licenza Gemma, più restrittiva per gli usi commerciali. Se la licenza non fa la differenza, i rispettivi punteggi sul Open LLM Leaderboard consentono di prendere decisioni in base alla tua attività specifica.
Conclusione
Le miglior LLM per RX 9070 XT nel 2026 si colloca nella fascia 24-27B: Qwen 3.8 27B e Gemma 3 27B per la versatilità generale, Devstral Small 2 24B e Codestral 22B per lo sviluppo software, EuroLLM 22B per il multilinguismo europeo, Magistral Small 24B per il ragionamento strutturato. Con 16 GB di VRAM RDNA4 e ROCm, questa scheda permette di raggiungere un livello di prestazioni elevato in self-hosting. Esplora il catalogo completo di quelllm.fr o utilizza il configuratore per affinare la tua selezione in base alla tua GPU, alla licenza desiderata e al tuo caso d'uso.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una Radeon RX 9070 XT offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.