Quale LLM su Radeon RX 9070 (16 GB) ?
La Radeon RX 9070 (RDNA 4, 16 GB GDDR6, 640 GB/s, 220 W) esegue modelli da 20 a 24 miliardi di parametri in Q4 e genera circa 120 token al secondo su Llama 2 7B in Q4_0 con Vulkan, secondo una misurazione pubblica. Su Linux, Ollama la supporta con ROCm v7; su Windows, non è presente nella lista ROCm di Ollama e utilizza Vulkan, che dà già buoni risultati.
La RX 9070 è la più recente delle schede AMD da 16 GB in questa fascia di prezzo, con un consumo nettamente inferiore rispetto ai modelli precedenti della serie RX 7000. Questa guida illustra cosa può eseguire, cosa si sa della sua velocità in base a misurazioni pubbliche, cosa cambia tra Linux e Windows e come si colloca rispetto alla RX 9070 XT e alle RTX da 16 GB.
Stai scegliendo un computer? Le nostre scelte per budget →
Per questa configurazione: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Cosa fa una RX 9070 nel 2026
La RX 9070 carica senza problemi i modelli da 8 a 14 miliardi di parametri in Q4 e accetta i 20 a 24B, con un contesto breve per i più grandi. La sua memoria da 16 GB GDDR6 a 20,1 Gb/s su un bus da 256 bit le dà una banda passante di 640 GB/s, cifra che l'antica versione di questa pagina (644) corregge. Su Llama 2 7B in Q4_0, il discussion pubblica del deposito llama.cpp dà 119,71 token al secondo in generazione sotto Vulkan e 114,48 sotto ROCm, con una lettura del prompt a 3 164 token al secondo sotto Vulkan, più veloce delle RX 7800 XT e 7900 GRE. Il suo punto forte è anche il suo TDP di 220 W, inferiore di 40 a 50 W rispetto ai suoi predecessori da 16 GB.
- Architettura
- RDNA 4, chip della serie RX 9000, con lo stesso bus da 256 bit della 9070 XT.
- Calcolo
- 3.584 processori di flusso (4.096 per la 9070 XT).
- Memoria
- 16 GB GDDR6, 20,1 Gb/s, bus da 256 bit, 640 GB/s.
- Consumo
- TDP di 220 W (304 W per la 9070 XT).
- Prezzo
- Non indicato: cambia ogni settimana, vedi /prix-gpu-ia.
#Linux, Windows: ROCm o Vulkan
È la particolarità della generazione RDNA 4: il supporto varia a seconda del sistema. AMD elenca la RX 9070 in ROCm (target gfx1201) e la documentazione di Ollama la cita per Linux, con il driver ROCm v7. Per Windows, invece, l'elenco ROCm di Ollama si ferma alla RX 7900 XTX; la RX 9070 non vi compare. Resta utilizzabile tramite Vulkan, attivato per impostazione predefinita, che offre inoltre buone velocità di elaborazione. La documentazione di AMD precisa infine che le Radeon RX 9000 sono supportate solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7.
| Ambiente | Stato | Conseguenza pratica |
|---|---|---|
| Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | ROCm ufficiale, target gfx1201 | Ollama con driver ROCm v7 |
| Windows | Assente dall'elenco ROCm di Ollama | Passare per Vulkan, attivato per impostazione predefinita |
| Vulkan, tutti i sistemi | Percorso generico | Velocità di elaborazione comparabili a quelle di ROCm nelle misurazioni pubbliche |
#Ciò che entra in 16 GB di VRAM
Considera circa 15 GB per il modello e la sua cache KV quando la scheda non gestisce lo schermo. Il catalogo QuelLLM riporta di seguito i pesi in Q4; la memoria necessaria per il contesto si aggiunge a questi.
| Modello | Dimensione del modello | Margine per il contesto | Verdetto |
|---|---|---|---|
| Llama 3.1 8B in Q4 | ≈ 6 GB | ≈ 9 GB | Utilizzo molto agevole, contesto molto lungo |
| Gemma 4 12B in Q8 | ≈ 13 GB | ≈ 2 GB | Ci sta, con contesto breve |
| gpt-oss 20B in Q4 | ≈ 13 GB | ≈ 2 GB | Rientra nella memoria disponibile, con un contesto da breve a medio |
| Devstral Small 2 24B in Q4 | ≈ 14 GB | ≈ 1 GB | Ci sta a malapena |
| Gemma 4 26B-A4B in Q4 | ≈ 16 GB | nessuna | Troppo al limite |
Questi 16 GB sono la soglia tra il modello da 24B, che ci sta, e quelli da 26 a 30B, che non ci stanno più. Per questa soglia precisa, le schede da 16 GB di tutte le marche si equivalgono: la pagina dedicata al confronto per capacità di VRAM le confronta. Ciò che distingue la RX 9070 è ciò che offre oltre a questa capacità: una lettura del prompt più veloce e un consumo più basso.
#Velocità misurate: Vulkan davanti a ROCm
I numeri provengono dalle discussioni pubbliche del repository llama.cpp, che utilizzano tutte Llama 2 7B in Q4_0 (3,56 GiB) e llama-bench; non sono misurazioni del sito. Sulla RX 9070, Vulkan raggiunge 3 164,10 token al secondo in lettura e 119,71 in generazione; con Flash Attention, 2 859,98 e 119,51. ROCm raggiunge 2 381,77 e 114,48. I due backend sono vicini in generazione, con Vulkan leggermente in vantaggio, e la differenza è più marcata nella lettura del prompt. Configurazioni, driver e commit variano da una serie all'altra: interpreta queste differenze come ordini di grandezza.
| Backend | Flash Attention | Lettura pp512 | Generazione tg128 |
|---|---|---|---|
| Vulkan | no | 3 164,10 t/s | 119,71 t/s |
| Vulkan | sì | 2 859,98 t/s | 119,51 t/s |
| ROCm | no | 2 381,77 t/s | 114,48 t/s |
Il limite teorico di generazione è dato da 640 GB/s divisi per 3,82 GB, ossia circa 167 token al secondo; la scheda ne raggiunge il 71% con Vulkan. Applicando questa efficienza a modelli più grandi si ottengono ordini di grandezza. Si tratta di calcoli, non di misurazioni, e presuppongono che un modello più grande si comporti come il 7B di riferimento.
| Modello (Q4) | Dimensione del modello | Limite teorico | Ordine di grandezza |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 107 token/s | ≈ 76 token/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 91 token/s | ≈ 65 token/s |
| Phi-4 14B | ≈ 9 GB | ≈ 71 token/s | ≈ 50 token/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 46 tokens/s | ≈ 32 token/s |
#Che cosa cambia con RDNA 4 per un LLM locale
RDNA 4 aggiunge hardware dedicato all'IA: la RX 9070 integra 112 acceleratori di IA secondo la scheda della serie, contro 128 per la 9070 XT. Ci si potrebbe aspettare una velocità di generazione molto superiore rispetto a RDNA 3. Le misurazioni pubbliche non lo dimostrano: 119,71 token al secondo per la RX 9070 con Vulkan, contro 118,27 per la RX 7800 XT nella stessa discussione. La generazione di un LLM è limitata dalla banda passante della memoria, e 640 GB/s non sono molto lontani dai 624 GB/s della 7800 XT. Gli acceleratori di IA aiutano soprattutto nella lettura del prompt, dove la RX 9070 guadagna il 57% rispetto alla 7800 XT.
La conseguenza per l'acquirente: non pagare per RDNA 4 in nome della velocità di conversazione, ma per la lettura dei prompt, il minor consumo e la durata del supporto software, che continuerà a supportare le schede recenti più a lungo di quelle vecchie. Se usi una chat con un modello da 8 a 14B, una RX 7800 XT usata offre risultati di generazione simili.
#Rispetto alla RX 9070 XT: il divario è superiore al «10 %»
La versione precedente di questa pagina indicava una RX 9070 più lenta del 10-12 % rispetto alla 9070 XT. Sul modello 7B di riferimento con Vulkan, la 9070 XT genera a 137,11 token al secondo contro 119,71, cioè il 15 % in più, e legge i prompt a 5.036 token al secondo contro 3.164, cioè il 59 % in più. Le due schede hanno però la stessa memoria, 16 GB, e la stessa larghezza di banda secondo le rispettive schede tecniche. La differenza deriva quindi dalle risorse di calcolo (4.096 processori di flusso contro 3.584), che incidono poco sulla generazione e molto sulla lettura del prompt.
| Criterio | RX 9070 | RX 9070 XT |
|---|---|---|
| Processori di flusso | 3 584 | 4 096 |
| TDP | 220 W | 304 W |
| Lettura pp512 | 3 164,10 t/s | 5 036,04 t/s |
| Generazione tg128 | 119,71 t/s | 137,11 t/s |
In pratica: per la chat, la 9070 perde il 15% di velocità a fronte di 84 W in meno, un compromesso ragionevole. Per il RAG e i documenti lunghi, la 9070 XT legge circa 1,6 volte più velocemente.
#Rispetto alle RTX da 16 GB: il prompt rimane il punto debole
Rispetto alle schede NVIDIA da 16 GB misurate con Vulkan, la RX 9070 genera un po' più lentamente, con una velocità inferiore dell'8% rispetto alla RTX 4070 Ti Super e del 12% rispetto alla RTX 5070 Ti, e legge il prompt a circa metà della velocità. La RTX 5070 da 12 GB, spesso citata come concorrente diretta, non compare nella discussione Vulkan di riferimento: non esiste quindi un confronto numerico affidabile con questa scheda, ma solo la differenza di capacità, 16 GB contro 12 GB.
| Scheda | Lettura pp512 | Generazione tg128 |
|---|---|---|
| RX 9070 | 3 164,10 t/s | 119,71 t/s |
| RTX 4070 Ti Super | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 6 213,63 t/s | 135,63 t/s |
#Avvio
- 01Scegliere il sistemaSu Linux, usa Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7 per rimanere nell'ambito dei sistemi supportati da AMD. Su Windows, affidati a Vulkan.
- 02Installare OllamaSu Linux, installa il driver ROCm v7 con amdgpu-install, poi Ollama. Su Windows, installa Ollama: Vulkan è attivato per impostazione predefinita.
- 03Caricare un modelloScegli un 12B o un 20B prima di un 24B, poi verifica con ollama ps che il modello sia al 100% sulla GPU.
- 04Confrontare i backendAvvia llama-bench con Vulkan e poi con ROCm sul tuo modello: nelle misure pubbliche, Vulkan è leggermente in vantaggio.
Conviene aspettare una generazione successiva? Nulla nelle misurazioni citate giustifica l'attesa per l'uso di modelli da 8 a 24B: il limite è la capacità di 16 GB, che solo una scheda da 20 a 24 GB elimina. Se sai già di volere modelli da 30B e oltre, evita questa scheda; altrimenti, l'acquisto di una scheda da 16 GB si giustifica per ciò che esegui oggi, non per ciò che uscirà domani.
#Verdetto 2026
- Una buona scelta
- Se vuoi 16 GB su una scheda dai consumi contenuti (220 W) e accetti Vulkan su Windows.
- Preferisci la 9070 XT
- Se i tuoi prompt sono lunghi: la lettura è il 59% più veloce su quella scheda, con 84 W in più.
- Preferisci una RTX da 16 GB
- Se hai bisogno di CUDA o di una lettura del prompt due volte più veloce.
I prezzi cambiano velocemente: il monitoraggio del sito aggiorna ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM. È questo ultimo valore che deve guidare la comparazione con la RTX 5070 o la RX 9070 XT.
- Prezzi delle schede grafiche per l'IA locale, aggiornati due volte a settimana
- Documentazione Ollama: schede AMD supportate
- Compatibilità delle GPU con ROCm, documentazione AMD
- Classifica Vulkan del repository llama.cpp
#Domande frequenti
RX 9070 o RX 9070 XT per un LLM locale?+
RX 9070 o RTX 5070 per un LLM locale?+
La RX 9070 è supportata da Ollama?+
Quanti token al secondo fa una RX 9070?+
Quali modelli si possono eseguire su una RX 9070 da 16 GB?+
Vulkan o ROCm su RX 9070?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.