Intermedio 11 minRadeon RX 9000

Quale LLM su Radeon RX 9070 (16 GB) ?

Risposta diretta

La Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) esegue modelli da 20 a 24 miliardi di parametri in Q4 e genera circa 120 token al secondo su Llama 2 7B in Q4_0 con Vulkan, secondo una misurazione pubblica. Su Linux, Ollama la supporta con ROCm v7; su Windows, non è presente nella lista ROCm di Ollama e utilizza Vulkan, che dà già buoni risultati.

La RX 9070 è la più recente delle schede AMD da 16 GB in questa fascia di prezzo, con un consumo nettamente inferiore rispetto ai modelli precedenti della serie RX 7000. Questa guida illustra cosa può eseguire, cosa si sa della sua velocità in base a misurazioni pubbliche, cosa cambia tra Linux e Windows e come si colloca rispetto alla RX 9070 XT e alle RTX da 16 GB.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Per questa configurazione: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Cosa fa una RX 9070 nel 2026

La RX 9070 carica senza problemi i modelli da 8 a 14 miliardi di parametri in Q4 e accetta i 20 a 24B, con un contesto breve per i più grandi. La sua memoria da 16 GB GDDR6 a 20,1 Gb/s su un bus da 256 bit le dà una banda passante di 640 GB/s, cifra che l'antica versione di questa pagina (644) corregge. Su Llama 2 7B in Q4_0, il discussion pubblica del deposito llama.cpp dà 119,71 token al secondo in generazione sotto Vulkan e 114,48 sotto ROCm, con una lettura del prompt a 3 164 token al secondo sotto Vulkan, più veloce delle RX 7800 XT e 7900 GRE. Il suo punto forte è anche il suo TDP di 220 W, inferiore di 40 a 50 W rispetto ai suoi predecessori da 16 GB.

Architettura
RDNA 4, chip della serie RX 9000, con lo stesso bus da 256 bit della 9070 XT.
Calcolo
3.584 processori di flusso (4.096 per la 9070 XT).
Memoria
16 GB GDDR6, 20,1 Gb/s, bus da 256 bit, 640 GB/s.
Consumo
TDP di 220 W (304 W per la 9070 XT).
Prezzo
Non indicato: cambia ogni settimana, vedi /prix-gpu-ia.

#Linux, Windows: ROCm o Vulkan

È la particolarità della generazione RDNA 4: il supporto varia a seconda del sistema. AMD elenca la RX 9070 in ROCm (target gfx1201) e la documentazione di Ollama la cita per Linux, con il driver ROCm v7. Per Windows, invece, l'elenco ROCm di Ollama si ferma alla RX 7900 XTX; la RX 9070 non vi compare. Resta utilizzabile tramite Vulkan, attivato per impostazione predefinita, che offre inoltre buone velocità di elaborazione. La documentazione di AMD precisa infine che le Radeon RX 9000 sono supportate solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7.

Supporto per la RX 9070
AmbienteStatoConseguenza pratica
Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)ROCm ufficiale, target gfx1201Ollama con driver ROCm v7
WindowsAssente dall'elenco ROCm di OllamaPassare per Vulkan, attivato per impostazione predefinita
Vulkan, tutti i sistemiPercorso genericoVelocità di elaborazione comparabili a quelle di ROCm nelle misurazioni pubbliche
i
Una divergenza da conoscere
La tabella dei target della documentazione Ollama indica gfx1200 per la RX 9070 e gfx1201 per la 9070 XT come esempio, mentre la tabella di AMD associa la RX 9070 a gfx1201. Fidati del comando rocminfo sul tuo computer, non di un esempio di documentazione.

#Ciò che entra in 16 GB di VRAM

Considera circa 15 GB per il modello e la sua cache KV quando la scheda non gestisce lo schermo. Il catalogo QuelLLM riporta di seguito i pesi in Q4; la memoria necessaria per il contesto si aggiunge a questi.

Ciò che una RX 9070 può gestire (solo pesi)
ModelloDimensione del modelloMargine per il contestoVerdetto
Llama 3.1 8B in Q4≈ 6 GB≈ 9 GBUtilizzo molto agevole, contesto molto lungo
Gemma 4 12B in Q8≈ 13 GB≈ 2 GBCi sta, con contesto breve
gpt-oss 20B in Q4≈ 13 GB≈ 2 GBRientra nella memoria disponibile, con un contesto da breve a medio
Devstral Small 2 24B in Q4≈ 14 GB≈ 1 GBCi sta a malapena
Gemma 4 26B-A4B in Q4≈ 16 GBnessunaTroppo al limite

Questi 16 GB sono la soglia tra il modello da 24B, che ci sta, e quelli da 26 a 30B, che non ci stanno più. Per questa soglia precisa, le schede da 16 GB di tutte le marche si equivalgono: la pagina dedicata al confronto per capacità di VRAM le confronta. Ciò che distingue la RX 9070 è ciò che offre oltre a questa capacità: una lettura del prompt più veloce e un consumo più basso.

#Velocità misurate: Vulkan davanti a ROCm

I numeri provengono dalle discussioni pubbliche del repository llama.cpp, che utilizzano tutte Llama 2 7B in Q4_0 (3,56 GiB) e llama-bench; non sono misurazioni del sito. Sulla RX 9070, Vulkan raggiunge 3 164,10 token al secondo in lettura e 119,71 in generazione; con Flash Attention, 2 859,98 e 119,51. ROCm raggiunge 2 381,77 e 114,48. I due backend sono vicini in generazione, con Vulkan leggermente in vantaggio, e la differenza è più marcata nella lettura del prompt. Configurazioni, driver e commit variano da una serie all'altra: interpreta queste differenze come ordini di grandezza.

RX 9070 su Llama 2 7B Q4_0 (misurazioni pubbliche llama.cpp)
BackendFlash AttentionLettura pp512Generazione tg128
Vulkanno3 164,10 t/s119,71 t/s
Vulkansì2 859,98 t/s119,51 t/s
ROCmno2 381,77 t/s114,48 t/s

Il limite teorico di generazione è dato da 640 GB/s divisi per 3,82 GB, ossia circa 167 token al secondo; la scheda ne raggiunge il 71% con Vulkan. Applicando questa efficienza a modelli più grandi si ottengono ordini di grandezza. Si tratta di calcoli, non di misurazioni, e presuppongono che un modello più grande si comporti come il 7B di riferimento.

Stima al 71 % del limite di 640 GB/s (calcolo, non misura)
Modello (Q4)Dimensione del modelloLimite teoricoOrdine di grandezza
Llama 3.1 8B≈ 6 GB≈ 107 token/s≈ 76 token/s
Gemma 4 12B≈ 7 GB≈ 91 token/s≈ 65 token/s
Phi-4 14B≈ 9 GB≈ 71 token/s≈ 50 token/s
Devstral Small 2 24B≈ 14 GB≈ 46 tokens/s≈ 32 token/s

#Che cosa cambia con RDNA 4 per un LLM locale

RDNA 4 aggiunge hardware dedicato all'IA: la RX 9070 integra 112 acceleratori di IA secondo la scheda della serie, contro 128 per la 9070 XT. Ci si potrebbe aspettare una velocità di generazione molto superiore rispetto a RDNA 3. Le misurazioni pubbliche non lo dimostrano: 119,71 token al secondo per la RX 9070 con Vulkan, contro 118,27 per la RX 7800 XT nella stessa discussione. La generazione di un LLM è limitata dalla banda passante della memoria, e 640 GB/s non sono molto lontani dai 624 GB/s della 7800 XT. Gli acceleratori di IA aiutano soprattutto nella lettura del prompt, dove la RX 9070 guadagna il 57% rispetto alla 7800 XT.

La conseguenza per l'acquirente: non pagare per RDNA 4 in nome della velocità di conversazione, ma per la lettura dei prompt, il minor consumo e la durata del supporto software, che continuerà a supportare le schede recenti più a lungo di quelle vecchie. Se usi una chat con un modello da 8 a 14B, una RX 7800 XT usata offre risultati di generazione simili.

#Rispetto alla RX 9070 XT: il divario è superiore al «10 %»

La versione precedente di questa pagina indicava una RX 9070 più lenta del 10-12 % rispetto alla 9070 XT. Sul modello 7B di riferimento con Vulkan, la 9070 XT genera a 137,11 token al secondo contro 119,71, cioè il 15 % in più, e legge i prompt a 5.036 token al secondo contro 3.164, cioè il 59 % in più. Le due schede hanno però la stessa memoria, 16 GB, e la stessa larghezza di banda secondo le rispettive schede tecniche. La differenza deriva quindi dalle risorse di calcolo (4.096 processori di flusso contro 3.584), che incidono poco sulla generazione e molto sulla lettura del prompt.

RX 9070 e RX 9070 XT su Vulkan (Llama 2 7B Q4_0, senza FA)
CriterioRX 9070RX 9070 XT
Processori di flusso3 5844 096
TDP220 W304 W
Lettura pp5123 164,10 t/s5 036,04 t/s
Generazione tg128119,71 t/s137,11 t/s

In pratica: per la chat, la 9070 perde il 15% di velocità a fronte di 84 W in meno, un compromesso ragionevole. Per il RAG e i documenti lunghi, la 9070 XT legge circa 1,6 volte più velocemente.

#Rispetto alle RTX da 16 GB: il prompt rimane il punto debole

Rispetto alle schede NVIDIA da 16 GB misurate con Vulkan, la RX 9070 genera un po' più lentamente, con una velocità inferiore dell'8% rispetto alla RTX 4070 Ti Super e del 12% rispetto alla RTX 5070 Ti, e legge il prompt a circa metà della velocità. La RTX 5070 da 12 GB, spesso citata come concorrente diretta, non compare nella discussione Vulkan di riferimento: non esiste quindi un confronto numerico affidabile con questa scheda, ma solo la differenza di capacità, 16 GB contro 12 GB.

RX 9070 e RTX da 16 GB con Vulkan (Llama 2 7B Q4_0, senza FA)
SchedaLettura pp512Generazione tg128
RX 90703 164,10 t/s119,71 t/s
RTX 4070 Ti Super6 099,18 t/s129,45 t/s
RTX 5070 Ti6 213,63 t/s135,63 t/s

#Avvio

  1. 01
    Scegliere il sistema
    Su Linux, usa Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7 per rimanere nell'ambito dei sistemi supportati da AMD. Su Windows, affidati a Vulkan.
  2. 02
    Installare Ollama
    Su Linux, installa il driver ROCm v7 con amdgpu-install, poi Ollama. Su Windows, installa Ollama: Vulkan è attivato per impostazione predefinita.
  3. 03
    Caricare un modello
    Scegli un 12B o un 20B prima di un 24B, poi verifica con ollama ps che il modello sia al 100% sulla GPU.
  4. 04
    Confrontare i backend
    Avvia llama-bench con Vulkan e poi con ROCm sul tuo modello: nelle misure pubbliche, Vulkan è leggermente in vantaggio.
Terminale
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Conviene aspettare una generazione successiva? Nulla nelle misurazioni citate giustifica l'attesa per l'uso di modelli da 8 a 24B: il limite è la capacità di 16 GB, che solo una scheda da 20 a 24 GB elimina. Se sai già di volere modelli da 30B e oltre, evita questa scheda; altrimenti, l'acquisto di una scheda da 16 GB si giustifica per ciò che esegui oggi, non per ciò che uscirà domani.

#Verdetto 2026

Una buona scelta
Se vuoi 16 GB su una scheda dai consumi contenuti (220 W) e accetti Vulkan su Windows.
Preferisci la 9070 XT
Se i tuoi prompt sono lunghi: la lettura è il 59% più veloce su quella scheda, con 84 W in più.
Preferisci una RTX da 16 GB
Se hai bisogno di CUDA o di una lettura del prompt due volte più veloce.

I prezzi cambiano velocemente: il monitoraggio del sito aggiorna ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM. È questo ultimo valore che deve guidare la comparazione con la RTX 5070 o la RX 9070 XT.

#Domande frequenti

FAQ
RX 9070 o RX 9070 XT per un LLM locale?+
La 9070 XT genera il 15% più velocemente e legge i prompt il 59% più velocemente sul modello 7B di riferimento con Vulkan, al prezzo di un TDP di 304 W contro 220 W. Per la chat, la 9070 basta; per il RAG e i documenti lunghi, la XT è giustificata. Confronta i prezzi attuali.
RX 9070 o RTX 5070 per un LLM locale?+
La RX 9070 offre 16 GB contro 12 GB, consentendo di eseguire modelli da 20 a 24 miliardi di parametri. La RTX 5070 mantiene l'ecosistema CUDA e una lettura del prompt più veloce. Non sono state trovate misure Vulkan pubbliche per la RTX 5070: il confronto numerico rimane quindi da fare.
La RX 9070 è supportata da Ollama?+
Su Linux, sì, con il driver ROCm v7: è presente nella lista di Ollama. Su Windows, non è presente nella lista ROCm di Ollama, che si ferma alla RX 7900 XTX, ma Vulkan, attivato per impostazione predefinita, permette di usarla. Verifica con ollama ps che il modello sia caricato sulla GPU.
Quanti token al secondo fa una RX 9070?+
Su Llama 2 7B in Q4_0, le discussioni pubbliche del repository llama.cpp riportano 119,71 token al secondo con Vulkan e 114,48 con ROCm in generazione. Per un modello 24B in Q4 il calcolo dà circa 32 token al secondo: una stima da misurare sulla tua macchina.
Quali modelli si possono eseguire su una RX 9070 da 16 GB?+
Llama 3.1 8B, Gemma 4 12B fino a Q8, gpt-oss 20B e Devstral Small 2 24B in Q4, questi ultimi due con un contesto breve. Un modello da 26 a 30B in Q4 supera i 16 GB di VRAM e viene eseguito in parte sul processore, con una significativa riduzione della velocità.
Vulkan o ROCm su RX 9070?+
Nelle misurazioni pubbliche del repository llama.cpp, Vulkan genera un po' più velocemente (119,71 contro 114,48 token al secondo) e legge il prompt più velocemente (3 164 contro 2 382). Su Windows, Vulkan è comunque il percorso predefinito. Prova entrambi con il tuo modello prima di decidere.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.