Intermedio 11 minRadeon RX 7000

Quale LLM su Radeon RX 7900 XT (20 GB) ?

Risposta diretta

La Radeon RX 7900 XT (20 GB GDDR6, 800 GB/s, 315 W) carica interamente in VRAM modelli da 24 a 26 miliardi di parametri in Q4 con un buon margine per il contesto, e riesce anche a ospitare un 30B a patto di limitare il contesto. È la memoria, non la velocità, a distinguerla: su Llama 2 7B, le misurazioni pubbliche indicano 123 token al secondo con Vulkan, appena più di quanto raggiunge una RX 7800 XT da 16 GB e molto meno di una RX 7900 XTX.

Venti gigabyte di VRAM sono una capacità rara su una scheda destinata al grande pubblico e cambiano ciò che si può eseguire: fanno la differenza tra un 24B con poco margine di memoria e un 24B con spazio per il contesto. Questa guida distingue ciò che questi 20 GB offrono realmente da ciò che la larghezza di banda di 800 GB/s lascia sperare, citando misurazioni pubbliche e correggendo le convinzioni errate su questa scheda.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#Cosa fa una RX 7900 XT nel 2026

La RX 7900 XT è adatta a chi vuole modelli da 24 a 26 miliardi di parametri senza limitare il contesto. I suoi 20 GB accolgono Devstral Small 2 24B (circa 14 GB in Q4) con 6 GB di margine, contro 1 GB su una scheda da 16 GB, e il MoE Gemma 4 26B-A4B (circa 16 GB) con 4 GB di margine. In termini di velocità, però, delude chi fa affidamento sui suoi 800 GB/s: 123,18 token al secondo sul modello 7B di riferimento con Vulkan, contro 118,27 per una RX 7800 XT la cui larghezza di banda è inferiore del 22 %. AMD la elenca ufficialmente tra le schede supportate da ROCm e Ollama la supporta su Linux e Windows.

Architettura
RDNA 3, Navi 31 con un GCD e cinque MCD, lanciata il 13 dicembre 2022.
Calcolo
5.376 processori di flusso, 84 unità di calcolo.
Memoria
20 GB GDDR6, bus 320 bit, 800 GB/s
Consumo
315 W di potenza della scheda: verifica l'alimentatore consigliato dal produttore del tuo modello.
Prezzo
Non indicato qui: consulta /prix-gpu-ia

#Il budget di memoria dei 20 GB

Calcola circa 19 GB per il modello e la sua cache KV quando la scheda non gestisce lo schermo. La tabella sottrae da questo budget il peso in Q4 riportato nel catalogo QuelLLM per mostrare il margine disponibile per il contesto. Questo margine è il vero criterio: un modello che «ci sta» con 1 GB residuo si accontenta di un contesto di poche migliaia di token.

Cosa può caricare una 7900 XT in Q4 (solo pesi, budget di 19 GB)
ModelloDimensione del modelloMargine per il contestoVerdetto
gpt-oss 20B≈ 13 GB≈ 6 GBMolto comodo, contesto lungo
Devstral Small 2 24B≈ 14 GB≈ 5 GBUtilizzo agevole, possibilità di un contesto lungo
Gemma 4 26B-A4B (MoE)≈ 16 GB≈ 3 GBCi sta, con un contesto medio
Granite 4.1 30B≈ 17 GB≈ 2 GBCi sta, con contesto breve
Gemma 4 31B≈ 18 GB≈ 1 GBAl limite della memoria disponibile, contesto molto breve

Il caso dei modelli a esperti merita una nota. Solo una frazione dei parametri di un MoE viene utilizzata per ogni token, il che rende la generazione più veloce rispetto a un modello denso delle stesse dimensioni, ma tutti i pesi devono rientrare in memoria. Il 26B-A4B è il tipo di modello per cui 20 GB fanno la differenza: troppo grande per 16 GB con il contesto, ma con un buon margine in 20 GB. Per modelli ancora più grandi, come la famiglia Qwen3.6 35B-A3B, consulta la guida dedicata invece di tirare a indovinare: la dimensione esatta dipende dalla quantizzazione scelta.

Per trasformare il margine in un numero di token di contesto, serve il costo della cache KV per token, che dipende dall'architettura del modello: numero di strati, teste di attenzione e precisione della cache. Non esiste quindi una regola universale in token per gigabyte. Il metodo affidabile è la misurazione: carica il modello con un contesto modesto, annota la VRAM occupata con rocm-smi, aumenta la finestra, poi ripeti. Il calcolatore di VRAM del sito automatizza questa stima per i modelli del catalogo, e la quantizzazione della cache KV a 8 bit dimezza approssimativamente la memoria occupata dal contesto.

#Velocità misurate: la larghezza di banda non è tutto

I numeri provengono dalle discussioni pubbliche del repository llama.cpp, che usano Llama 2 7B in Q4_0 e llama-bench; non sono misurazioni del sito. Con Vulkan, la RX 7900 XT legge un prompt di 512 token a 2 941,58 token al secondo e genera a 123,18. Con Flash Attention, 2 701,13 e 120,62. Con ROCm, la discussione riporta 3 098,38 in lettura e 116,15 in generazione. Le due serie convergono: la generazione raggiunge un limite di circa 120 token al secondo.

Il limite teorico dato dalla banda passante, 800 GB/s divisi per 3,82 GB di pesi, è di circa 209 token al secondo; la scheda ne raggiunge solo il 59% con Vulkan. È il rendimento più basso tra le schede AMD di questa serie di misurazioni (83% per una RX 6700 XT, 77% per una RX 7900 GRE, 72% per una RX 7800 XT). La spiegazione probabile è che un modello di 7 miliardi di parametri sia troppo piccolo per saturare la memoria di un chip di grandi dimensioni; si può sperare in un rendimento migliore con modelli più grandi, ma nessuna misurazione di queste serie lo dimostra, e sarebbe imprudente annunciare velocità di generazione per un modello 24B.

RX 7900 XT su Llama 2 7B Q4_0 (misurazioni pubbliche llama.cpp)
BackendFlash AttentionLettura pp512Generazione tg128
Vulkanno2 941,58 t/s123,18 t/s
Vulkansì2 701,13 t/s120,62 t/s
ROCmno3 098,38 t/s116,15 t/s

Per stimare un ordine di grandezza per i modelli grandi, un limite prudente si ottiene applicando il rendimento misurato del 59 % al massimo teorico: per un modello da 24B in Q4 con 14 GB di pesi, 800 diviso 14 dà un massimo di circa 57 token al secondo, e quindi circa 34 token al secondo. È un calcolo, non una misurazione; se il rendimento è migliore su un modello grande, il throughput reale sarà superiore.

#Rispetto alla RX 7900 XTX: la differenza reale è ben più grande di quanto si dica

Spesso si legge che la 7900 XT è «dal 10 al 12 % più lenta» della 7900 XTX. Le misurazioni pubbliche raccontano un'altra storia. Sul modello di riferimento da 7B con Vulkan, la XTX genera 182,63 token al secondo, contro i 123,18 della XT: il 48 % in più. Il rapporto tra il numero di processori di flusso (6.144 contro 5.376) non basta a spiegarlo; sono la larghezza di banda e il chip ad ampliare il divario. Ciò che la XT mantiene è il prezzo d'ingresso: con 20 GB, soddisfa la maggior parte dei requisiti dei modelli da 24 a 26B.

RX 7900 XT e RX 7900 XTX (Llama 2 7B Q4_0, misure pubbliche)
MisurazioneRX 7900 XTRX 7900 XTX
VRAM20 GB24 GB
Vulkan, generazione tg128123,18 t/s182,63 t/s
Vulkan, lettura pp5122 941,58 t/s3 726,99 t/s

Questa correzione modifica l'equilibrio: se la velocità di generazione è importante per te, il vantaggio del 48% pesa di più rispetto ai 4 GB aggiuntivi di VRAM, mentre se cerchi soprattutto capacità di contesto, la XT offre la maggior parte di ciò che offre la XTX per un modello da 24B. Su un modello da 30B o più, invece, i 24 GB della XTX eliminano i compromessi di contesto, e proprio lì il prezzo più alto si giustifica.

#Rispetto alla RTX 4070 Ti Super: più memoria, meno velocità

La RTX 4070 Ti Super offre 16 GB, cioè 4 in meno. Sul modello di riferimento da 7B con Vulkan, genera 129,45 token al secondo, il 5% in più rispetto alla RX 7900 XT, e legge il prompt a 6.099 token al secondo, due volte più velocemente. La XT non è quindi «più veloce», contrariamente a quanto si legge talvolta: ha più memoria. Il suo punto di forza è la capacità, che permette di caricare modelli da 24 a 26B con contesto.

RX 7900 XT e RTX 4070 Ti Super con Vulkan (Llama 2 7B Q4_0, senza FA)
CriterioRX 7900 XTRTX 4070 Ti Super
VRAM20 GB16 GB
Lettura pp5122 941,58 t/s6 099,18 t/s
Generazione tg128123,18 t/s129,45 t/s

#Quando un modello supera i 20 GB

Un modello troppo grande non provoca un errore: Ollama e llama.cpp collocano il maggior numero possibile di strati sulla scheda e lasciano il resto al processore. In llama.cpp, l'opzione -ngl fissa il numero di strati inviati alla GPU e il valore 100 usato nelle misurazioni sopra significa «tutti». Ridurre questo valore libera VRAM, al prezzo di una generazione più lenta, perché ogni token deve allora attraversare la memoria di sistema, molto più lenta della GDDR6. La regola pratica: finché ollama ps mostra 100% GPU, sei nella fascia veloce; non appena compare una percentuale sul lato del processore, la velocità cala a gradini.

#20 GB, 16 GB o 24 GB: come decidere

Quale capacità per quale utilizzo
Uso previsto16 GB20 GB (RX 7900 XT)24 GB
Chat con un modello da 8B a 14BSufficienteInutileInutile
Assistente di programmazione 24B, contesto lungoPoco margineComodoComodo
MoE da 26B con contesto medioTroppo al limiteSufficienteSufficiente
Modello da 30 a 35B con contesto lungoImpossibileEsattoNecessario

Il principio: paga per la capacità richiesta dal tuo modello più grande, non per quella che un giorno potresti usare. Se punti a un modello da 24B con contesto, 20 GB sono la prima soglia che permette di usarlo comodamente; oltre questa soglia, ogni gigabyte aggiuntivo deve essere giustificato da un modello preciso.

#Avvio

  1. 01
    Scegliere il sistema
    AMD supporta le Radeon RX 7000 solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Su Windows, Ollama utilizza uno stack ROCm v7 o HIP7; Vulkan funge da fallback.
  2. 02
    Installare il driver e Ollama
    Su Linux, Ollama richiede il driver ROCm v7. Installalo con l'utilità amdgpu-install, poi installa Ollama.
  3. 03
    Caricare un modello da 24B
    Prendi un Devstral Small 2 24B in Q4_K_M, avvialo e verifica con ollama ps che occupi la GPU al 100 %.
  4. 04
    Regolare il contesto
    Aumenta la finestra di contesto per incrementi successivi, monitorando la VRAM: l'obiettivo è rimanere sotto i 19 GB in totale.
  5. 05
    Confrontare Vulkan e ROCm
    Misura con llama-bench sul tuo modello. Nelle misurazioni pubbliche, i due backend offrono prestazioni simili su questa scheda.
Terminale
ollama ps
rocm-smi --showmeminfo vram
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Verdetto 2026

Una buona scelta
Se vuoi eseguire modelli da 24 a 26B lasciando spazio per il contesto e il costo per GB di VRAM su /prix-gpu-ia è conveniente.
Una scelta nella media
Se cerchi soprattutto la velocità: la generazione raggiunge un limite vicino a quello di una scheda da 16 GB, e la RTX 4070 Ti Super legge i prompt due volte più velocemente.
Un'opzione insufficiente
Per modelli da 30 a 35B con un contesto lungo, in cui 24 GB diventano necessari.

#Domande frequenti

FAQ
La RX 7900 XT è buona per i LLM locali?+
Sì, per la sua memoria: 20 GB permettono di caricare un modello 24B in Q4 con un ampio margine per il contesto, cosa che 16 GB consentono a malapena. La sua velocità di generazione, circa 123 token al secondo su un modello 7B in Q4_0 con Vulkan, rimane vicina a quella di una RX 7800 XT.
RX 7900 XT o RX 7900 XTX per l'IA locale?+
La XTX offre 24 GB e una generazione 48% più veloce sul modello 7B di riferimento sotto Vulkan (182,63 contro 123,18 token al secondo). La XT basta per modelli da 24 a 26B e costa meno. Confronta i prezzi attuali sulla pagina dedicata del sito.
20 GB di VRAM sono sufficienti per un modello da 30B?+
Un 30B come Granite 4.1 30B pesa circa 17 GB in Q4: ci sta con un contesto breve, lasciando circa 2 GB di margine. Per un contesto lungo o per modelli da 35B, come Qwen3.6 35B-A3B, diventano necessari 24 GB. Consulta la guida dedicata a questo modello.
Quanti token al secondo fa una RX 7900 XT?+
Con Llama 2 7B in Q4_0, le discussioni pubbliche nel repository di llama.cpp riportano 123,18 token al secondo con Vulkan e 116,15 con ROCm durante la generazione. Per un 24B in Q4, il calcolo dà circa 34 token al secondo: una stima da misurare sul tuo sistema.
RX 7900 XT o RTX 4070 Ti Super per un LLM?+
La XT per la capacità (20 GB contro 16): può caricare modelli da 24 a 26B con spazio per il contesto. La RTX 4070 Ti Super genera il 5% più velocemente sul modello 7B di riferimento e legge i prompt due volte più velocemente, con l'ecosistema CUDA. La scelta dipende dal modello che vuoi usare.
La RX 7900 XT funziona con Ollama su Windows?+
Sì: la documentazione di Ollama la elenca come supportata su Windows, con uno stack ROCm v7 o HIP7, e su Linux con il driver ROCm v7. AMD la elenca tra le schede supportate da ROCm, con target gfx1100, su Ubuntu 24.04.4, 22.04.5, RHEL 10.1 e RHEL 9.7. Vulkan rimane disponibile come alternativa di ripiego.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.