Intermedio 11 minRadeon RX 9000

Quale LLM su Radeon RX 9070 XT (16 GB) ?

Risposta diretta

La RX 9070 XT (16 GB GDDR6, fino a 640 GB/s secondo AMD) è una buona scheda per i LLM in locale su Linux con ROCm 7, o tramite Vulkan su Windows. Carica senza trasferire parte del modello nella RAM di sistema modelli con pesi fino a 13-14 GB in Q4, come gpt-oss 20B o Mistral Small 24B. I modelli densi da 27 miliardi di parametri sono fuori portata.

La RX 9070 XT è la Radeon RDNA 4 di fascia alta di AMD. Questa guida spiega cosa consentono i suoi 16 GB, come installarla su Linux o Windows, cosa mostrano le misurazioni pubbliche e quando è preferibile una RTX 5070 Ti o una scheda da 24 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RX 9070 XT per gli LLM: 16 GB, 640 GB/s e una buona potenza di calcolo

La Radeon RX 9070 XT è la Radeon consumer più capace per i LLM tra le RX 9000: 16 GB di GDDR6 su un bus da 256 bit, una larghezza di banda che può raggiungere 640 GB/s secondo AMD e prestazioni di calcolo matriciale nettamente superiori a quelle della RX 7900 XTX in FP16 e FP8. Esegue senza ricorrere alla RAM di sistema i modelli i cui pesi rimangono sotto circa 13–14 GB in Q4: un 9B o un 12B con un contesto lungo, gpt-oss 20B, Mistral Small 24B con un contesto breve. Il limite è la capacità: i modelli densi da 27 miliardi di parametri in Q4 (circa 16 GB) non entrano nella VRAM.

Scheda tecnica RX 9070 XT (fonte: AMD)
CaratteristicaValore
Memoria16 GB GDDR6, bus da 256 bit
Larghezza di bandafino a 640 GB/s
Processori di flusso / unità di calcolo4 096 / 64
Acceleratori IA128
Calcolo matriciale FP16 / FP8195 / 389 TFLOPs
Potenza tipica della scheda304 W
Potenza minima consigliata dell'alimentatore750 W
Connettori di alimentazione2 x 8 pin
i
Banda passante: 640 GB/s, non 644
Alcune schede online, inclusa una versione precedente di questa guida, indicano 644 GB/s. La scheda ufficiale di AMD indica «fino a 640 GB/s»: è questo il valore da usare nei tuoi calcoli.

#Software: ROCm, Vulkan, LM Studio, vLLM

La RX 9070 XT figura nella matrice ROCm 7.2.1 della documentazione Radeon di AMD (Ubuntu 22.04, 24.04 e 25.10). Ollama la elenca tra le schede supportate su Linux con il driver ROCm v7 e associa il target gfx1201 alla 9070 XT nella sua tabella dei target LLVM. LM Studio ha annunciato nella versione 0.3.19, nel luglio 2025, il supporto per le GPU AMD della serie 9000 su Linux con ROCm. vLLM elenca le Radeon RX 9000 (gfx1200 e gfx1201) tra i suoi hardware AMD.

Su Windows, l'elenco ROCm di Ollama si ferma alle RX 7000: le RX 9000 non vi figurano. Ollama precisa tuttavia che Vulkan offre un supporto aggiuntivo su Windows e Linux, attivato per impostazione predefinita. Una 9070 XT su Windows usa quindi in pratica Vulkan; controlla con ollama ps che il modello sia effettivamente sulla GPU e consulta la guida a llama.cpp con Vulkan se compili tu stesso.

#Primi passi su Linux con Ollama

  1. 01
    Installare il driver ROCm
    Segui la documentazione ROCm di AMD con l'utilità amdgpu-install, come richiesto da Ollama, aggiungi l'utente ai gruppi render e video, poi riavvia.
  2. 02
    Confermare la rilevazione
    rocminfo deve elencare un agente GPU e rocm-smi deve mostrare i 16 GB. Altrimenti, Ollama utilizzerà il processore.
  3. 03
    Avviare un primo modello
    Installa Ollama con lo script ufficiale e avvia un modello che rientri in 16 GB, ad esempio un 9B in Q4.
  4. 04
    Verificare la collocazione
    Dopo la prima risposta, ollama ps deve indicare il 100 % di GPU. Un'allocazione condivisa tra GPU e processore segnala un modello o un contesto troppo grande.
Verifiche
rocminfo | grep -i gfx
rocm-smi --showmeminfo vram
ollama ps

#Quali modelli stanno in 16 GB

I pesi provengono dal catalogo QuelLLM, in Q4 salvo diversa indicazione. Aggiungi la cache KV e circa un gigabyte di margine. L'elenco completo per fascia si trova nella guida sui 16 GB di VRAM.

Peso (catalogo QuelLLM) e limite teorico con una banda di 640 GB/s
ModelloDimensione del modelloRientra in 16 GB?Limite teorico
Qwen 3.5 9B Q46 GBSì, con ampio margine≈ 107 token/s
Qwen 3.5 9B Q810 GBSì64 token/s
Gemma 4 12B Q47 GBSì, contesto lungo≈ 91 token/s
Gemma 4 12B Q813 GBSì, contesto breve≈ 49 token/s
gpt-oss 20B (MoE)13 GBSì, contesto moderatodipende dai pesi attivi
Mistral Small 24B Q414 GBStretto≈ 46 tokens/s
Qwen 3.8 27B Q416 GBNo-

Il limite è la banda passante divisa per i pesi letti a ogni token; nessuna scheda raggiunge esattamente questo valore. I modelli MoE come gpt-oss 20B leggono per ogni token solo una parte dei loro pesi totali e quindi sono più veloci di un modello denso della stessa dimensione, a condizione che entrino interamente nella VRAM.

!
Cosa non consentono «16 GB»
I modelli da 27 a 35 miliardi di parametri in Q4 pesano da 16 a 21 GB secondo il catalogo: una parte deve essere caricata nella RAM di sistema e la velocità crolla. Per questa categoria, consulta la guida ai 24 GB o valuta la RX 7900 XTX.

#Cosa dicono le misure pubbliche

La tabella della comunità llama.cpp su ROCm misura lo stesso modello, Llama 2 7B in Q4_0, su diverse schede. Per la RX 9070 XT, un partecipante segnala 5 055 token al secondo in lettura del prompt (pp512) e 101 in generazione (tg128), senza Flash Attention. Sulla 7900 XTX, la tabella dà 3 552 e 167; sulla 9060 XT, 1 420 e 68.

Llama 2 7B Q4_0, llama.cpp ROCm (tabella della comunità, senza Flash Attention)
SchedaLarghezza di banda AMDLettura del promptGenerazione
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

Due considerazioni. In primo luogo, la 9070 XT legge un prompt lungo circa il 40% più velocemente della 7900 XTX, nonostante una banda passante inferiore: è il vantaggio del calcolo matriciale più potente, utile per il RAG, i documenti lunghi e gli agenti di programmazione che restituiscono molto contesto. In secondo luogo, in generazione, la 7900 XTX resta in vantaggio, come ci si può aspettare dalla sua banda passante superiore del 50%.

i
Una tabella della comunità non è un banco di prova
Nella stessa tabella, la RX 9070 (non XT) mostra 114 token/s in generazione, più della 9070 XT a 101, anche se dovrebbe essere più lenta. Le righe provengono da versioni diverse di llama.cpp e dei driver. Interpreta questi numeri come ordini di grandezza, mai come una classifica precisa.

#Quale modello scegliere in base all'uso

Con 16 GB, la scelta giusta dipende meno dalla dimensione massima che dal margine lasciato al contesto. Una regola semplice: lascia almeno 2 GB liberi oltre allo spazio occupato dai pesi per la cache KV e i buffer, di più se lavori su documenti lunghi. La tabella propone un punto di partenza per ogni uso, a partire dai pesi del catalogo QuelLLM.

Punto di partenza per ciascun utilizzo con 16 GB
UsoModello di partenzaPesi Q4Margine su 16 GB
Chat generale e redazioneGemma 4 12B7 GB9 GB, contesto lungo possibile
Codice, agente di sviluppoDevstral Small 2 24B14 GB2 GB, contesto breve
Ragionamento rapido (MoE)gpt-oss 20B13 GB3 GB
RAG con prompt lunghiQwen 3.5 9B6 GB10 GB per il contesto
Attività leggere continuativeGranite 4.2 8B4,6 GB11 GB

Per il RAG, il calcolo matriciale della 9070 XT è un vero vantaggio: un prompt di diverse migliaia di token viene letto rapidamente e un 9B in Q4 lascia 10 GB per la cache KV, quindi per un contesto lungo. Per il codice, un modello da 14 GB ci sta, ma con un contesto breve; occorre allora quantizzare la cache KV o ridurre la finestra.

#Contesto e cache KV: i due parametri che contano

La documentazione di Ollama indica una finestra di contesto predefinita di 4.096 token, modificabile tramite la variabile OLLAMA_CONTEXT_LENGTH. La cache KV può essere quantizzata tramite OLLAMA_KV_CACHE_TYPE, con f16 come valore predefinito, quando Flash Attention è attiva; Ollama utilizza automaticamente Flash Attention quando il backend e la scheda lo consentono. Aumenta progressivamente il contesto monitorando ollama ps: appena una parte del modello passa al processore, torna al livello precedente.

Contesto 32k con cache KV in q8_0
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#FP8 su RX 9070 XT: cosa cambia veramente

AMD indica per la 9070 XT una potenza di calcolo matriciale FP8 di 389 TFLOPs, un dato assente dalla scheda tecnica della RX 7900 XTX. In pratica, con Ollama e i modelli GGUF in Q4 o Q5, non usi FP8: i pesi sono interi quantizzati. L'FP8 serve soprattutto ai motori che caricano pesi FP8, come vLLM, che include le RX 9000 nel suo elenco. Consideralo una riserva per il futuro, non un vantaggio immediato, e non acquistare la scheda per questo: la capacità di 16 GB e la banda passante restano i due criteri che determinano ciò che puoi far girare oggi.

#RX 9070 XT o RTX 5070 Ti

NVIDIA descrive la RTX 5070 Ti con 16 GB di GDDR7 su un bus da 256 bit: la stessa capacità della scheda AMD, con una memoria di una generazione diversa. A parità di capacità, i modelli che entrano in memoria sono gli stessi; la differenza riguarda la velocità di generazione, l'ecosistema CUDA e il prezzo, che qui non fissiamo. Consulta il monitoraggio dei prezzi delle schede per l'IA locale: di solito è questo a orientare la scelta.

Come scegliere con 16 GB
La tua situazioneScheda da preferireMotivo
Linux, Ollama o LM Studio, budget contenutoRX 9070 XTROCm 7 supportato, 16 GB, calcolo FP8 elencato
Windows e nessuna voglia di debuggareRTX 5070 TiEcosistema CUDA, driver più universali
Progetti che richiedono CUDA (alcune pipeline di fine-tuning)RTX 5070 TiCUDA rimane la piattaforma di riferimento predefinita per molti progetti
RAG con prompt lunghiRX 9070 XT o RTX 5070 TiIl calcolo conta quanto la banda passante
Modelli da 27 miliardi in suScheda da 24 GBNessuna scheda da 16 GB è sufficiente

#Alimentazione e case

AMD raccomanda un alimentatore da almeno 750 W e indica una potenza tipica di 304 W per la scheda, con due connettori a 8 pin. Aggiungi il consumo del processore, dei dischi e delle ventole per dimensionare l'intero sistema, e verifica la lunghezza e lo spessore del modello del tuo produttore: queste schede sono spesso grandi. Un case ben ventilato limita il rumore e i cali di frequenza sotto carico prolungato, un aspetto rilevante quando la scheda genera testo per ore. Per un server di IA che rimane acceso, il consumo a riposo e sotto carico conta quanto il prezzo d'acquisto nel lungo periodo.

#Domande frequenti

Domande frequenti
La RX 9070 XT è adatta per i LLM locali?+
Sì per i modelli che occupano fino a 16 GB: un 9B o un 12B con lungo contesto, gpt-oss 20B, Mistral Small 24B con contesto breve. I suoi 640 GB/s e il suo calcolo matriciale la rendono veloce, soprattutto nella lettura del prompt. Non è adatta ai modelli densi da 27 miliardi di parametri.
Come usare LM Studio con una RX 9070 XT?+
LM Studio annuncia, a partire dalla versione 0.3.19, il supporto per le GPU AMD serie 9000 su Linux con ROCm. Su Windows, il motore Vulkan di llama.cpp è la soluzione alternativa. In entrambi i casi, carica un modello di meno di 14 GB e controlla nell'interfaccia che tutti gli strati siano sulla GPU.
Serve ROCm o Vulkan per l'RX 9070 XT?+
Su Linux, ROCm 7 è la soluzione ufficiale di Ollama, con il target gfx1201 per questa scheda. Su Windows, l'elenco ROCm di Ollama non menziona le RX 9000, quindi Vulkan, attivato per impostazione predefinita, è la soluzione pratica. Confronta i due con llama-bench sul tuo modello prima di decidere.
Quanti token al secondo genera una RX 9070 XT?+
Dipende dal modello. Con un Llama 2 7B in Q4_0, la tabella della comunità di llama.cpp riporta 101 token/s in generazione su ROCm. Per un altro modello, il limite teorico è 640 GB/s diviso per la dimensione dei pesi: circa 46 token/s per un 24B da 14 GB, prima di qualsiasi perdita di prestazioni.
La RX 9070 XT gestisce il FP8?+
Sulla carta sì: AMD indica 389 TFLOPs di calcolo matriciale FP8. Con Ollama e i modelli GGUF in Q4, non ne benefici direttamente, perché i pesi sono interi quantizzati. L'FP8 serve ai motori che caricano pesi FP8, come vLLM, che elenca le RX 9000.
Quale alimentatore scegliere per una RX 9070 XT?+
AMD indica un minimo di 750 W e una potenza tipica di 304 W, con due connettori di alimentazione da 8 pin. Aggiungi il consumo del resto del PC e mantieni un margine, soprattutto se il processore è potente. Verifica anche la scheda tecnica del tuo modello presso il produttore, che può raccomandare una potenza maggiore.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.