Quale LLM su Radeon RX 7900 XT (20 GB) ?
La Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) carica interamente in VRAM modelli da 24 a 26 miliardi di parametri in Q4 con un buon margine per il contesto, e riesce anche a ospitare un 30B a patto di limitare il contesto. È la memoria, non la velocità, a distinguerla: su Llama 2 7B, le misurazioni pubbliche indicano 123 token al secondo con Vulkan, appena più di quanto raggiunge una RX 7800 XT da 16 GB e molto meno di una RX 7900 XTX.
Venti gigabyte di VRAM sono una capacità rara su una scheda destinata al grande pubblico e cambiano ciò che si può eseguire: fanno la differenza tra un 24B con poco margine di memoria e un 24B con spazio per il contesto. Questa guida distingue ciò che questi 20 GB offrono realmente da ciò che la larghezza di banda di 800 GB/s lascia sperare, citando misurazioni pubbliche e correggendo le convinzioni errate su questa scheda.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#Cosa fa una RX 7900 XT nel 2026
La RX 7900 XT è adatta a chi vuole modelli da 24 a 26 miliardi di parametri senza limitare il contesto. I suoi 20 GB accolgono Devstral Small 2 24B (circa 14 GB in Q4) con 6 GB di margine, contro 1 GB su una scheda da 16 GB, e il MoE Gemma 4 26B-A4B (circa 16 GB) con 4 GB di margine. In termini di velocità, però, delude chi fa affidamento sui suoi 800 GB/s: 123,18 token al secondo sul modello 7B di riferimento con Vulkan, contro 118,27 per una RX 7800 XT la cui larghezza di banda è inferiore del 22 %. AMD la elenca ufficialmente tra le schede supportate da ROCm e Ollama la supporta su Linux e Windows.
- Architettura
- RDNA 3, Navi 31 con un GCD e cinque MCD, lanciata il 13 dicembre 2022.
- Calcolo
- 5.376 processori di flusso, 84 unità di calcolo.
- Memoria
- 20 GB GDDR6, bus 320 bit, 800 GB/s
- Consumo
- 315 W di potenza della scheda: verifica l'alimentatore consigliato dal produttore del tuo modello.
- Prezzo
- Non indicato qui: consulta /prix-gpu-ia
#Il budget di memoria dei 20 GB
Calcola circa 19 GB per il modello e la sua cache KV quando la scheda non gestisce lo schermo. La tabella sottrae da questo budget il peso in Q4 riportato nel catalogo QuelLLM per mostrare il margine disponibile per il contesto. Questo margine è il vero criterio: un modello che «ci sta» con 1 GB residuo si accontenta di un contesto di poche migliaia di token.
| Modello | Dimensione del modello | Margine per il contesto | Verdetto |
|---|---|---|---|
| gpt-oss 20B | ≈ 13 GB | ≈ 6 GB | Molto comodo, contesto lungo |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 5 GB | Utilizzo agevole, possibilità di un contesto lungo |
| Gemma 4 26B-A4B (MoE) | ≈ 16 GB | ≈ 3 GB | Ci sta, con un contesto medio |
| Granite 4.1 30B | ≈ 17 GB | ≈ 2 GB | Ci sta, con contesto breve |
| Gemma 4 31B | ≈ 18 GB | ≈ 1 GB | Al limite della memoria disponibile, contesto molto breve |
Il caso dei modelli a esperti merita una nota. Solo una frazione dei parametri di un MoE viene utilizzata per ogni token, il che rende la generazione più veloce rispetto a un modello denso delle stesse dimensioni, ma tutti i pesi devono rientrare in memoria. Il 26B-A4B è il tipo di modello per cui 20 GB fanno la differenza: troppo grande per 16 GB con il contesto, ma con un buon margine in 20 GB. Per modelli ancora più grandi, come la famiglia Qwen3.6 35B-A3B, consulta la guida dedicata invece di tirare a indovinare: la dimensione esatta dipende dalla quantizzazione scelta.
Per trasformare il margine in un numero di token di contesto, serve il costo della cache KV per token, che dipende dall'architettura del modello: numero di strati, teste di attenzione e precisione della cache. Non esiste quindi una regola universale in token per gigabyte. Il metodo affidabile è la misurazione: carica il modello con un contesto modesto, annota la VRAM occupata con rocm-smi, aumenta la finestra, poi ripeti. Il calcolatore di VRAM del sito automatizza questa stima per i modelli del catalogo, e la quantizzazione della cache KV a 8 bit dimezza approssimativamente la memoria occupata dal contesto.
- Qwen3.6 35B-A3B in locale: test e requisiti VRAM
- Quale LLM per 24 GB di VRAM, per i modelli oltre i 20 GB
- Quantizzare la cache KV per risparmiare VRAM
#Velocità misurate: la larghezza di banda non è tutto
I numeri provengono dalle discussioni pubbliche del repository llama.cpp, che usano Llama 2 7B in Q4_0 e llama-bench; non sono misurazioni del sito. Con Vulkan, la RX 7900 XT legge un prompt di 512 token a 2 941,58 token al secondo e genera a 123,18. Con Flash Attention, 2 701,13 e 120,62. Con ROCm, la discussione riporta 3 098,38 in lettura e 116,15 in generazione. Le due serie convergono: la generazione raggiunge un limite di circa 120 token al secondo.
Il limite teorico dato dalla banda passante, 800 GB/s divisi per 3,82 GB di pesi, è di circa 209 token al secondo; la scheda ne raggiunge solo il 59% con Vulkan. È il rendimento più basso tra le schede AMD di questa serie di misurazioni (83% per una RX 6700 XT, 77% per una RX 7900 GRE, 72% per una RX 7800 XT). La spiegazione probabile è che un modello di 7 miliardi di parametri sia troppo piccolo per saturare la memoria di un chip di grandi dimensioni; si può sperare in un rendimento migliore con modelli più grandi, ma nessuna misurazione di queste serie lo dimostra, e sarebbe imprudente annunciare velocità di generazione per un modello 24B.
| Backend | Flash Attention | Lettura pp512 | Generazione tg128 |
|---|---|---|---|
| Vulkan | no | 2 941,58 t/s | 123,18 t/s |
| Vulkan | sì | 2 701,13 t/s | 120,62 t/s |
| ROCm | no | 3 098,38 t/s | 116,15 t/s |
Per stimare un ordine di grandezza per i modelli grandi, un limite prudente si ottiene applicando il rendimento misurato del 59 % al massimo teorico: per un modello da 24B in Q4 con 14 GB di pesi, 800 diviso 14 dà un massimo di circa 57 token al secondo, e quindi circa 34 token al secondo. È un calcolo, non una misurazione; se il rendimento è migliore su un modello grande, il throughput reale sarà superiore.
#Rispetto alla RX 7900 XTX: la differenza reale è ben più grande di quanto si dica
Spesso si legge che la 7900 XT è «dal 10 al 12 % più lenta» della 7900 XTX. Le misurazioni pubbliche raccontano un'altra storia. Sul modello di riferimento da 7B con Vulkan, la XTX genera 182,63 token al secondo, contro i 123,18 della XT: il 48 % in più. Il rapporto tra il numero di processori di flusso (6.144 contro 5.376) non basta a spiegarlo; sono la larghezza di banda e il chip ad ampliare il divario. Ciò che la XT mantiene è il prezzo d'ingresso: con 20 GB, soddisfa la maggior parte dei requisiti dei modelli da 24 a 26B.
| Misurazione | RX 7900 XT | RX 7900 XTX |
|---|---|---|
| VRAM | 20 GB | 24 GB |
| Vulkan, generazione tg128 | 123,18 t/s | 182,63 t/s |
| Vulkan, lettura pp512 | 2 941,58 t/s | 3 726,99 t/s |
Questa correzione modifica l'equilibrio: se la velocità di generazione è importante per te, il vantaggio del 48% pesa di più rispetto ai 4 GB aggiuntivi di VRAM, mentre se cerchi soprattutto capacità di contesto, la XT offre la maggior parte di ciò che offre la XTX per un modello da 24B. Su un modello da 30B o più, invece, i 24 GB della XTX eliminano i compromessi di contesto, e proprio lì il prezzo più alto si giustifica.
#Rispetto alla RTX 4070 Ti Super: più memoria, meno velocità
La RTX 4070 Ti Super offre 16 GB, cioè 4 in meno. Sul modello di riferimento da 7B con Vulkan, genera 129,45 token al secondo, il 5% in più rispetto alla RX 7900 XT, e legge il prompt a 6.099 token al secondo, due volte più velocemente. La XT non è quindi «più veloce», contrariamente a quanto si legge talvolta: ha più memoria. Il suo punto di forza è la capacità, che permette di caricare modelli da 24 a 26B con contesto.
| Criterio | RX 7900 XT | RTX 4070 Ti Super |
|---|---|---|
| VRAM | 20 GB | 16 GB |
| Lettura pp512 | 2 941,58 t/s | 6 099,18 t/s |
| Generazione tg128 | 123,18 t/s | 129,45 t/s |
#Quando un modello supera i 20 GB
Un modello troppo grande non provoca un errore: Ollama e llama.cpp collocano il maggior numero possibile di strati sulla scheda e lasciano il resto al processore. In llama.cpp, l'opzione -ngl fissa il numero di strati inviati alla GPU e il valore 100 usato nelle misurazioni sopra significa «tutti». Ridurre questo valore libera VRAM, al prezzo di una generazione più lenta, perché ogni token deve allora attraversare la memoria di sistema, molto più lenta della GDDR6. La regola pratica: finché ollama ps mostra 100% GPU, sei nella fascia veloce; non appena compare una percentuale sul lato del processore, la velocità cala a gradini.
#20 GB, 16 GB o 24 GB: come decidere
| Uso previsto | 16 GB | 20 GB (RX 7900 XT) | 24 GB |
|---|---|---|---|
| Chat con un modello da 8B a 14B | Sufficiente | Inutile | Inutile |
| Assistente di programmazione 24B, contesto lungo | Poco margine | Comodo | Comodo |
| MoE da 26B con contesto medio | Troppo al limite | Sufficiente | Sufficiente |
| Modello da 30 a 35B con contesto lungo | Impossibile | Esatto | Necessario |
Il principio: paga per la capacità richiesta dal tuo modello più grande, non per quella che un giorno potresti usare. Se punti a un modello da 24B con contesto, 20 GB sono la prima soglia che permette di usarlo comodamente; oltre questa soglia, ogni gigabyte aggiuntivo deve essere giustificato da un modello preciso.
#Avvio
- 01Scegliere il sistemaAMD supporta le Radeon RX 7000 solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Su Windows, Ollama utilizza uno stack ROCm v7 o HIP7; Vulkan funge da fallback.
- 02Installare il driver e OllamaSu Linux, Ollama richiede il driver ROCm v7. Installalo con l'utilità amdgpu-install, poi installa Ollama.
- 03Caricare un modello da 24BPrendi un Devstral Small 2 24B in Q4_K_M, avvialo e verifica con ollama ps che occupi la GPU al 100 %.
- 04Regolare il contestoAumenta la finestra di contesto per incrementi successivi, monitorando la VRAM: l'obiettivo è rimanere sotto i 19 GB in totale.
- 05Confrontare Vulkan e ROCmMisura con llama-bench sul tuo modello. Nelle misurazioni pubbliche, i due backend offrono prestazioni simili su questa scheda.
#Verdetto 2026
- Una buona scelta
- Se vuoi eseguire modelli da 24 a 26B lasciando spazio per il contesto e il costo per GB di VRAM su /prix-gpu-ia è conveniente.
- Una scelta nella media
- Se cerchi soprattutto la velocità: la generazione raggiunge un limite vicino a quello di una scheda da 16 GB, e la RTX 4070 Ti Super legge i prompt due volte più velocemente.
- Un'opzione insufficiente
- Per modelli da 30 a 35B con un contesto lungo, in cui 24 GB diventano necessari.
- Prezzi delle schede grafiche per l'IA locale, rilevati due volte a settimana
- Documentazione Ollama: schede AMD supportate
- Compatibilità delle GPU con ROCm, documentazione AMD
- Classifica Vulkan del repository llama.cpp
#Domande frequenti
La RX 7900 XT è buona per i LLM locali?+
RX 7900 XT o RX 7900 XTX per l'IA locale?+
20 GB di VRAM sono sufficienti per un modello da 30B?+
Quanti token al secondo fa una RX 7900 XT?+
RX 7900 XT o RTX 4070 Ti Super per un LLM?+
La RX 7900 XT funziona con Ollama su Windows?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.