Prestazioni degli LLM su GPU AMD Radeon 9070XT
La ricerca « 9070xt llm » ricorre spesso tra i possessori della Radeon RX 9070 XT che vogliono eseguire un modello in locale senza una scheda NVIDIA. Buone notizie: con 16 GB di GDDR6 e il supporto ROCm per l'architettura RDNA 4, una configurazione 9070xt llm è praticabile per la maggior parte degli usi personali, a condizione di comprenderne i limiti di memoria. Questa pagina illustra in dettaglio le specifiche della scheda utili all'inferenza, la VRAM consumata in base alla quantizzazione (Q4, Q5, Q8, FP16), le velocità in token al secondo da aspettarsi, i modelli del catalogo quelllm.fr utilizzabili con offload sulla CPU, l'interpretazione dei benchmark, quindi i casi d'uso e gli strumenti (llama.cpp, Ollama, vLLM) che funzionano realmente su AMD.
Scheda tecnica della RX 9070 XT per l'inferenza
Per un LLM ciò che conta non è la potenza di calcolo bruta ma la larghezza di banda della memoria e la quantità di VRAM. Su questi due punti, la scheda si colloca così:
- Architettura : RDNA 4, identificatore ROCm gfx1201
- VRAM : 16 GB GDDR6, bus 256 bit
- Larghezza di banda : circa 640 GB/s (valore dichiarato dal produttore)
- Unità di calcolo : 64 CU, 4096 processori di flusso
- Consumo tipico : 304 W sotto carico
- Supporto software : ROCm 6.4 e versioni successive, backend Vulkan di llama.cpp come alternativa
Per capire: la banda passante è vicina a quella di una RX 7900 XT, ma la VRAM resta a 16 GB contro i 20 o 24 GB della generazione precedente. È il compromesso da tenere in considerazione prima di acquistare. La pagina della RX 9070 XT elenca i modelli classificati per compatibilità, e la guida di installazione dedicata copre la configurazione passo dopo passo.
VRAM: cosa entra in 16 GB in base alla quantizzazione
Regola pratica per stimare la memoria di un modello denso: circa da 0,55 a 0,6 GB per miliardo di parametri in Q4, 0,7 in Q5, 1,05 in Q8 e 2 in FP16, più la cache KV che cresce con il contesto. Su 16 GB, riservando da 1 a 1,5 GB per il sistema e la cache KV:
- Q4 (Q4_K_M) : modelli densi fino a circa 20–24 miliardi di parametri, contesto da 8k a 16k
- Q5 : fino a circa 16–18 miliardi di parametri
- Q8 : fino a circa 12–13 miliardi di parametri
- FP16 : fino a circa 7 miliardi di parametri, raramente utile per l'inferenza locale
I modelli del catalogo di riferimento citato in questa pagina sono tutti molto più grandi di così. Prendiamo tre esempi nella fascia da 118 a 128 miliardi di parametri, in cui solo gli esperti attivi lavorano a ogni token:
- Qwen 3.5 122B-A10B : Q4 ~73 GB, Q5 ~88 GB (stimato), Q8 ~130 GB (stimato), FP16 ~245 GB (stimato). Scheda: Qwen 3.5 122B-A10B
- Mistral Small 4 (119B): Q4 ~72 GB, Q8 ~128 GB (stimato). Scheda: Mistral Small 4
- Qwen3.8 Flash Next 125B-A6B : Q4 ~72 GB, solo 6 miliardi di parametri attivi. Scheda: Qwen3.8 Flash Next
Nessuno di questi modelli entra in 16 GB di VRAM. Rimangono tuttavia interessanti per una 9070 XT grazie all’offload degli esperti nella RAM di sistema, spiegato più avanti.
Velocità in token/sec: ordini di grandezza stimati
Durante la generazione, la velocità di un modello che rientra interamente nella VRAM è limitata dalla larghezza di banda: ogni token richiede di leggere tutti i pesi. Con 640 GB/s, il limite teorico per un modello da 8 GB in Q4 è di circa 80 token/sec; in pratica, si osserva dal 55 al 70% di questo limite. Ordini di grandezza, tutti stimati e da confermare con la tua configurazione personale :
- Modello denso da 7 a 9 miliardi di parametri, Q4, 100 % in VRAM : da 45 a 60 token/sec
- Modello denso da 12 a 14 miliardi, Q4 : da 28 a 38 token/sec
- Modello denso da 22 a 24 miliardi, Q4, contesto breve : da 15 a 22 token/sec
- Modello denso da 30 miliardi e oltre, Q4 : offload parziale sulla CPU, spesso da 3 a 6 token/sec, poco pratico nell'uso quotidiano
Per i modelli a esperti del catalogo, il throughput dipende soprattutto dalla RAM di sistema. Con 64-96 GB di DDR5 a doppio canale, gli strati di attenzione in VRAM e gli esperti in RAM, si può puntare a 8-15 token/sec (valore stimato) su un modello con 10 miliardi di parametri attivi come Qwen 3.5 122B-A10B, e a 12-20 token/sec (valore stimato) su Qwen3.8 Flash Next 125B-A6B. L'elaborazione del prompt resta nettamente più lenta rispetto a un'esecuzione interamente in VRAM. Il metodo è documentato sul GitHub di llama.cpp tramite le opzioni di posizionamento dei tensori sulla CPU. Il comparatore di benchmark locali fornisce numeri rilevati su altre schede per calibrare le tue aspettative.
Modelli a esperti utilizzabili con offload sulla CPU e relative licenze
Per un uso serio su 9070 XT con molta RAM, ecco i candidati del catalogo quelllm.fr nella fascia da 118 a 142 miliardi di parametri, con la licenza da verificare prima di qualsiasi utilizzo commerciale :
- Qwen 3.5 122B-A10B (Alibaba) : Apache 2.0, contesto 262k, VRAM Q4 ~73 GB. Pesi pubblicati su la pagina Hugging Face di Alibaba
- Qwen3.8 Flash Next 125B-A6B (Qwen) : licenza « altro, pesi aperti », da leggere attentamente
- Mistral Small 4 (Mistral): Apache 2.0, contesto 256k. Pesi disponibili su la pagina Hugging Face di Mistral
- Mistral Medium 3.5 128B : Modified MIT, VRAM Q4 ~74 GB. Scheda: Mistral Medium 3.5
- Nemotron 3 Super 120B (NVIDIA): NVIDIA Open Model License, VRAM Q4 ~72 GB. Pesi su la pagina Hugging Face di NVIDIA
- Laguna S 2.1 (Poolside) : OpenMDW 1.1, orientato al codice, VRAM Q4 ~68 GB, il più leggero della serie
- dots.llm1 Instruct (Rednote) : MIT, VRAM Q4 ~85 GB, contesto limitato a 32k
- Mixtral 8x22B Instruct (Mistral): Apache 2.0, VRAM Q4 ~82 GB, architettura meno recente
Apache 2.0 e MIT autorizzano l'uso commerciale senza clausole particolari. Le licenze « Modified MIT », « NVIDIA Open Model License » e « OpenMDW » aggiungono condizioni che bisogna leggere nel repository del modello prima di costruire un prodotto su di esso. Se hai dubbi tra diversi candidati, il comparatore mette due schede l'una accanto all'altra.
Benchmark: come leggere i punteggi per questa GPU
I punteggi pubblicati (MMLU per la cultura generale, HumanEval e LiveCodeBench per il codice, GPQA per il ragionamento scientifico) misurano il modello a precisione completa, non la tua configurazione. Con una 9070 XT sono necessarie tre precauzioni:
- La quantizzazione degrada leggermente i punteggi : in Q4_K_M, la perdita rimane generalmente inferiore a 2 punti su MMLU per i modelli con più di 12 miliardi di parametri, maggiore sui modelli più piccoli. Dato da confermare modello per modello.
- I punteggi del catalogo devono essere verificati con l'Open LLM Leaderboard, che valuta i modelli a pesi aperti in condizioni omogenee.
- Il contesto troncato cambia i risultati : un modello dichiarato con 256k di contesto ma avviato con 8k su 16 GB di VRAM non si comporterà come nei test con contesti lunghi.
L'approccio giusto consiste nel confrontare due modelli sulle tue attività, con i tuoi prompt, piuttosto che affidarsi a una classifica aggregata.
Casi d'uso concreti e strumenti compatibili con AMD
Su una 9070 XT, gli usi che funzionano bene nella pratica quotidiana sono l'assistente di programmazione nell'editor, il riassunto e la riformulazione di documenti, la traduzione, l'analisi di file privati con RAG locale e gli agenti dotati di strumenti per compiti brevi. Gli usi con un contesto molto lungo, come l'analisi di contratti di diverse centinaia di pagine, richiedono o un modello piccolo con una KV cache quantizzata o una seconda scheda.
Sul lato software:
- Ollama supporta ROCm su RDNA 4 a partire dalle versioni del 2025; la procedura da seguire è nel manuale Ollama su GPU AMD, e il progetto è seguito su il GitHub di Ollama
- llama.cpp offre due backend: ROCm (HIP) per il miglior throughput e Vulkan per la semplicità di installazione, utile se ROCm non riconosce la scheda
- vLLM si rivolge principalmente al servizio multiutente; il suo supporto ROCm è documentato su sito di vLLM ma si concentra innanzitutto sulle schede professionali, da testare prima di contarci
In caso di errore durante il caricamento, di GPU non rilevata o di passaggio silenzioso alla CPU, il guida alla risoluzione dei problemi di Ollama con la GPU elenca le cause frequenti. Se pensi di aggiungere una seconda scheda per superare i 16 GB, la guida multi-GPU llama.cpp spiega la distribuzione degli strati.
FAQ
Q: La RX 9070 XT è una buona scelta per una prima configurazione LLM locale?
Sì, per i modelli fino a 24 miliardi di parametri in Q4, con buone velocità di elaborazione e un prezzo inferiore a quello delle schede NVIDIA con la stessa quantità di VRAM. Il punto debole restano i 16 GB: fai un confronto con una RX 7900 XTX usata da 24 GB se punti a modelli più grandi. La guida alla scelta di una GPU illustra in dettaglio questi compromessi.
Q: Qual è la differenza rispetto alla RX 9060 XT 16 GB per gli LLM?
Stessa quantità di VRAM, quindi si possono caricare gli stessi modelli, ma la 9060 XT dispone di un bus da 128 bit e di una larghezza di banda circa dimezzata. La velocità in token/sec segue approssimativamente questo rapporto. Il benchmark della 9060 XT 16 GB fornisce misure concrete da confrontare con le stime di questa pagina.
Q: È possibile eseguire Qwen 3.5 122B-A10B su una 9070 XT?
Non con la sola VRAM: la versione Q4 pesa circa 73 GB. Con almeno 96 GB di RAM di sistema, llama.cpp permette di mantenere i layer condivisi sulla GPU e di trasferire gli esperti nella RAM. Il throughput scende quindi a circa 8-15 token/sec (stima), accettabile per un uso conversazionale ma lento per prompt lunghi.
Q: ROCm o Vulkan su questa scheda?
ROCm offre generalmente un throughput superiore del 10-25% (stimato) e una migliore elaborazione del prompt. Vulkan si installa senza dipendenze specifiche AMD e funziona su quasi tutte le distribuzioni Linux e su Windows. Inizia con Vulkan per verificare l'hardware, poi passa a ROCm se ti interessa il guadagno e se la versione installata riconosce gfx1201.
Q: Quanta RAM di sistema occorre prevedere in aggiunta?
Per limitarti ai modelli che rientrano nella VRAM, 32 GB sono sufficienti. Per sfruttare i modelli a esperti del catalogo con offload, punta ad almeno 64 GB e idealmente a 96–128 GB di DDR5 a doppio canale. In questa modalità, la velocità della RAM influenza direttamente i token/sec, più del processore stesso.
Q: Quali modelli funzionano senza GPU se la scheda grafica è occupata?
I modelli con un numero ridotto di parametri attivi rimangono utilizzabili con la sola CPU, a velocità ridotte. La pagina dedicata all'inferenza senza GPU spiega le impostazioni dei thread e della quantizzazione che limitano il calo delle prestazioni, e la classifica Solo CPU elenca i candidati.
Conclusione
Una configurazione 9070xt llm ha senso per chi vuole un LLM locale veloce con modelli da 7 a 24 miliardi di parametri e resta utilizzabile con i modelli a esperti del catalogo, a condizione di investire nella RAM di sistema. I valori di velocità di generazione forniti qui sono stime da confermare sulla tua macchina. Per trovare il modello adatto ai tuoi 16 GB di VRAM, alla tua RAM e al tuo utilizzo, usa il configuratore o sfoglia il catalogo completo filtrato per VRAM.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.