Quale LLM su Radeon RX 9070 XT (16 GB) ?
La RX 9070 XT (16 GB GDDR6, fino a 640 GB/s secondo AMD) è una buona scheda per i LLM in locale su Linux con ROCm 7, o tramite Vulkan su Windows. Carica senza trasferire parte del modello nella RAM di sistema modelli con pesi fino a 13-14 GB in Q4, come gpt-oss 20B o Mistral Small 24B. I modelli densi da 27 miliardi di parametri sono fuori portata.
La RX 9070 XT è la Radeon RDNA 4 di fascia alta di AMD. Questa guida spiega cosa consentono i suoi 16 GB, come installarla su Linux o Windows, cosa mostrano le misurazioni pubbliche e quando è preferibile una RTX 5070 Ti o una scheda da 24 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RX 9070 XT per gli LLM: 16 GB, 640 GB/s e una buona potenza di calcolo
La Radeon RX 9070 XT è la Radeon consumer più capace per i LLM tra le RX 9000: 16 GB di GDDR6 su un bus da 256 bit, una larghezza di banda che può raggiungere 640 GB/s secondo AMD e prestazioni di calcolo matriciale nettamente superiori a quelle della RX 7900 XTX in FP16 e FP8. Esegue senza ricorrere alla RAM di sistema i modelli i cui pesi rimangono sotto circa 13–14 GB in Q4: un 9B o un 12B con un contesto lungo, gpt-oss 20B, Mistral Small 24B con un contesto breve. Il limite è la capacità: i modelli densi da 27 miliardi di parametri in Q4 (circa 16 GB) non entrano nella VRAM.
| Caratteristica | Valore |
|---|---|
| Memoria | 16 GB GDDR6, bus da 256 bit |
| Larghezza di banda | fino a 640 GB/s |
| Processori di flusso / unità di calcolo | 4 096 / 64 |
| Acceleratori IA | 128 |
| Calcolo matriciale FP16 / FP8 | 195 / 389 TFLOPs |
| Potenza tipica della scheda | 304 W |
| Potenza minima consigliata dell'alimentatore | 750 W |
| Connettori di alimentazione | 2 x 8 pin |
#Software: ROCm, Vulkan, LM Studio, vLLM
La RX 9070 XT figura nella matrice ROCm 7.2.1 della documentazione Radeon di AMD (Ubuntu 22.04, 24.04 e 25.10). Ollama la elenca tra le schede supportate su Linux con il driver ROCm v7 e associa il target gfx1201 alla 9070 XT nella sua tabella dei target LLVM. LM Studio ha annunciato nella versione 0.3.19, nel luglio 2025, il supporto per le GPU AMD della serie 9000 su Linux con ROCm. vLLM elenca le Radeon RX 9000 (gfx1200 e gfx1201) tra i suoi hardware AMD.
Su Windows, l'elenco ROCm di Ollama si ferma alle RX 7000: le RX 9000 non vi figurano. Ollama precisa tuttavia che Vulkan offre un supporto aggiuntivo su Windows e Linux, attivato per impostazione predefinita. Una 9070 XT su Windows usa quindi in pratica Vulkan; controlla con ollama ps che il modello sia effettivamente sulla GPU e consulta la guida a llama.cpp con Vulkan se compili tu stesso.
#Primi passi su Linux con Ollama
- 01Installare il driver ROCmSegui la documentazione ROCm di AMD con l'utilità amdgpu-install, come richiesto da Ollama, aggiungi l'utente ai gruppi render e video, poi riavvia.
- 02Confermare la rilevazionerocminfo deve elencare un agente GPU e rocm-smi deve mostrare i 16 GB. Altrimenti, Ollama utilizzerà il processore.
- 03Avviare un primo modelloInstalla Ollama con lo script ufficiale e avvia un modello che rientri in 16 GB, ad esempio un 9B in Q4.
- 04Verificare la collocazioneDopo la prima risposta, ollama ps deve indicare il 100 % di GPU. Un'allocazione condivisa tra GPU e processore segnala un modello o un contesto troppo grande.
#Quali modelli stanno in 16 GB
I pesi provengono dal catalogo QuelLLM, in Q4 salvo diversa indicazione. Aggiungi la cache KV e circa un gigabyte di margine. L'elenco completo per fascia si trova nella guida sui 16 GB di VRAM.
| Modello | Dimensione del modello | Rientra in 16 GB? | Limite teorico |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | Sì, con ampio margine | ≈ 107 token/s |
| Qwen 3.5 9B Q8 | 10 GB | Sì | 64 token/s |
| Gemma 4 12B Q4 | 7 GB | Sì, contesto lungo | ≈ 91 token/s |
| Gemma 4 12B Q8 | 13 GB | Sì, contesto breve | ≈ 49 token/s |
| gpt-oss 20B (MoE) | 13 GB | Sì, contesto moderato | dipende dai pesi attivi |
| Mistral Small 24B Q4 | 14 GB | Stretto | ≈ 46 tokens/s |
| Qwen 3.8 27B Q4 | 16 GB | No | - |
Il limite è la banda passante divisa per i pesi letti a ogni token; nessuna scheda raggiunge esattamente questo valore. I modelli MoE come gpt-oss 20B leggono per ogni token solo una parte dei loro pesi totali e quindi sono più veloci di un modello denso della stessa dimensione, a condizione che entrino interamente nella VRAM.
#Cosa dicono le misure pubbliche
La tabella della comunità llama.cpp su ROCm misura lo stesso modello, Llama 2 7B in Q4_0, su diverse schede. Per la RX 9070 XT, un partecipante segnala 5 055 token al secondo in lettura del prompt (pp512) e 101 in generazione (tg128), senza Flash Attention. Sulla 7900 XTX, la tabella dà 3 552 e 167; sulla 9060 XT, 1 420 e 68.
| Scheda | Larghezza di banda AMD | Lettura del prompt | Generazione |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
Due considerazioni. In primo luogo, la 9070 XT legge un prompt lungo circa il 40% più velocemente della 7900 XTX, nonostante una banda passante inferiore: è il vantaggio del calcolo matriciale più potente, utile per il RAG, i documenti lunghi e gli agenti di programmazione che restituiscono molto contesto. In secondo luogo, in generazione, la 7900 XTX resta in vantaggio, come ci si può aspettare dalla sua banda passante superiore del 50%.
#Quale modello scegliere in base all'uso
Con 16 GB, la scelta giusta dipende meno dalla dimensione massima che dal margine lasciato al contesto. Una regola semplice: lascia almeno 2 GB liberi oltre allo spazio occupato dai pesi per la cache KV e i buffer, di più se lavori su documenti lunghi. La tabella propone un punto di partenza per ogni uso, a partire dai pesi del catalogo QuelLLM.
| Uso | Modello di partenza | Pesi Q4 | Margine su 16 GB |
|---|---|---|---|
| Chat generale e redazione | Gemma 4 12B | 7 GB | 9 GB, contesto lungo possibile |
| Codice, agente di sviluppo | Devstral Small 2 24B | 14 GB | 2 GB, contesto breve |
| Ragionamento rapido (MoE) | gpt-oss 20B | 13 GB | 3 GB |
| RAG con prompt lunghi | Qwen 3.5 9B | 6 GB | 10 GB per il contesto |
| Attività leggere continuative | Granite 4.2 8B | 4,6 GB | 11 GB |
Per il RAG, il calcolo matriciale della 9070 XT è un vero vantaggio: un prompt di diverse migliaia di token viene letto rapidamente e un 9B in Q4 lascia 10 GB per la cache KV, quindi per un contesto lungo. Per il codice, un modello da 14 GB ci sta, ma con un contesto breve; occorre allora quantizzare la cache KV o ridurre la finestra.
#Contesto e cache KV: i due parametri che contano
La documentazione di Ollama indica una finestra di contesto predefinita di 4.096 token, modificabile tramite la variabile OLLAMA_CONTEXT_LENGTH. La cache KV può essere quantizzata tramite OLLAMA_KV_CACHE_TYPE, con f16 come valore predefinito, quando Flash Attention è attiva; Ollama utilizza automaticamente Flash Attention quando il backend e la scheda lo consentono. Aumenta progressivamente il contesto monitorando ollama ps: appena una parte del modello passa al processore, torna al livello precedente.
#FP8 su RX 9070 XT: cosa cambia veramente
AMD indica per la 9070 XT una potenza di calcolo matriciale FP8 di 389 TFLOPs, un dato assente dalla scheda tecnica della RX 7900 XTX. In pratica, con Ollama e i modelli GGUF in Q4 o Q5, non usi FP8: i pesi sono interi quantizzati. L'FP8 serve soprattutto ai motori che caricano pesi FP8, come vLLM, che include le RX 9000 nel suo elenco. Consideralo una riserva per il futuro, non un vantaggio immediato, e non acquistare la scheda per questo: la capacità di 16 GB e la banda passante restano i due criteri che determinano ciò che puoi far girare oggi.
#RX 9070 XT o RTX 5070 Ti
NVIDIA descrive la RTX 5070 Ti con 16 GB di GDDR7 su un bus da 256 bit: la stessa capacità della scheda AMD, con una memoria di una generazione diversa. A parità di capacità, i modelli che entrano in memoria sono gli stessi; la differenza riguarda la velocità di generazione, l'ecosistema CUDA e il prezzo, che qui non fissiamo. Consulta il monitoraggio dei prezzi delle schede per l'IA locale: di solito è questo a orientare la scelta.
| La tua situazione | Scheda da preferire | Motivo |
|---|---|---|
| Linux, Ollama o LM Studio, budget contenuto | RX 9070 XT | ROCm 7 supportato, 16 GB, calcolo FP8 elencato |
| Windows e nessuna voglia di debuggare | RTX 5070 Ti | Ecosistema CUDA, driver più universali |
| Progetti che richiedono CUDA (alcune pipeline di fine-tuning) | RTX 5070 Ti | CUDA rimane la piattaforma di riferimento predefinita per molti progetti |
| RAG con prompt lunghi | RX 9070 XT o RTX 5070 Ti | Il calcolo conta quanto la banda passante |
| Modelli da 27 miliardi in su | Scheda da 24 GB | Nessuna scheda da 16 GB è sufficiente |
#Alimentazione e case
AMD raccomanda un alimentatore da almeno 750 W e indica una potenza tipica di 304 W per la scheda, con due connettori a 8 pin. Aggiungi il consumo del processore, dei dischi e delle ventole per dimensionare l'intero sistema, e verifica la lunghezza e lo spessore del modello del tuo produttore: queste schede sono spesso grandi. Un case ben ventilato limita il rumore e i cali di frequenza sotto carico prolungato, un aspetto rilevante quando la scheda genera testo per ore. Per un server di IA che rimane acceso, il consumo a riposo e sotto carico conta quanto il prezzo d'acquisto nel lungo periodo.
- Quali LLM per 16 GB di VRAM: la lista completa
- Ollama con GPU AMD (ROCm): installazione
- LLM su RX 7900 XTX (24 GB)
- LLM su RX 9060 XT (8 / 16 GB)
- Specifiche hardware RX 9070 XT
- Prezzi delle schede grafiche per l'IA locale
- Fonte: scheda AMD della Radeon RX 9070 XT
- Fonte: documentazione GPU di Ollama
- Fonte: LM Studio 0.3.19, supporto per la serie AMD 9000
- Fonte: tabella delle prestazioni di llama.cpp su ROCm
#Domande frequenti
La RX 9070 XT è adatta per i LLM locali?+
Come usare LM Studio con una RX 9070 XT?+
Serve ROCm o Vulkan per l'RX 9070 XT?+
Quanti token al secondo genera una RX 9070 XT?+
La RX 9070 XT gestisce il FP8?+
Quale alimentatore scegliere per una RX 9070 XT?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.