Intermedio 11 minRadeon RX 7000

Quale LLM su Radeon RX 7900 GRE (16 GB) ?

Risposta diretta

La Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) fa girare i modelli da 20 a 24 miliardi di parametri in Q4, come la RX 7800 XT, ma senza guadagnare velocità di generazione: le misurazioni pubbliche su Llama 2 7B danno 116 token al secondo contro 118 per la 7800 XT con Vulkan. Il suo vantaggio è altrove, nella lettura del prompt con Vulkan, un po' più rapida (2 336 contro 2 017 token al secondo).

La 7900 GRE assomiglia a una 7800 XT potenziata nel calcolo ma limitata sul fronte della memoria, e le misurazioni lo mostrano. Questa guida spiega cosa consentono i suoi 16 GB, in cosa si distingue dalle due schede più vicine, la RX 7800 XT e la RX 9070, e per quale uso vale il suo prezzo.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Cosa fa una RX 7900 GRE nel 2026

La RX 7900 GRE carica in Q4 tutto ciò che pesa meno di 15 GB: Gemma 4 12B fino a Q8, gpt-oss 20B e Devstral Small 2 24B con un contesto breve. La sua velocità di generazione, limitata dalla larghezza di banda di 576 GB/s, si aggira intorno a 116 token al secondo sul modello 7B di riferimento delle classifiche con Vulkan. Questo è il punto da ricordare: il suo numero di processori di flusso, 5.120 contro i 3.840 della 7800 XT, accelera la lettura dei prompt ma non la generazione, perché non ha né più memoria né una maggiore larghezza di banda rispetto alla scheda vicina nella gamma. AMD la elenca ufficialmente in ROCm e Ollama la supporta su Linux e su Windows.

Architettura
RDNA 3, Navi 31 (il chip della RX 7900 XTX, qui in versione ridotta), 80 unità di calcolo e 5 120 processori di flusso.
Memoria
16 GB GDDR6 con bus da 256 bit, pari a 576 GB/s.
Consumo
260 W di potenza della scheda.
Disponibilità
Riservata inizialmente alla Cina (27 luglio 2023), commercializzata a livello internazionale il 27 febbraio 2024, con un prezzo di lancio di 549 dollari.
Prezzo attuale
Consulta /prix-gpu-ia: il prezzo cambia ogni settimana.

#7900 GRE contro 7800 XT: la memoria decide

Le due schede offrono 16 GB. La 7800 XT ha 624 GB/s di larghezza di banda, la 7900 GRE 576 GB/s, cioè l'8% in meno. Durante la generazione, ogni token comporta la rilettura di tutti i pesi, quindi è la larghezza di banda a determinare le prestazioni: nella discussione su Vulkan di llama.cpp, la 7800 XT supera leggermente la GRE, e il vantaggio è più netto con Flash Attention attivata. La GRE torna in vantaggio nell'elaborazione del prompt con Vulkan (il 16% in più), dove conta la capacità di calcolo. Con ROCm, entrambe le serie pubbliche di misurazioni vedono la 7800 XT in vantaggio su entrambe le metriche.

RX 7900 GRE e RX 7800 XT (Llama 2 7B Q4_0, misure pubbliche llama.cpp)
MisurazioneRX 7900 GRERX 7800 XT
Vulkan, lettura pp512, senza FA2 336,31 t/s2 017,33 t/s
Vulkan, generazione tg128, senza FA116,11 t/s118,27 t/s
Vulkan, generazione tg128, con FA110,50 t/s124,86 t/s
ROCm, lettura pp512, senza FA1 456,98 t/s2 151,81 t/s
ROCm, generazione tg128, senza FA96,07 t/s100,94 t/s

Queste serie provengono da contributori diversi, con commit diversi di llama.cpp: lo scarto è indicativo dell'ordine di grandezza, non il risultato di un confronto di laboratorio. Eppure concordano sul fatto che la GRE non genera più velocemente di una 7800 XT. Se le trovi entrambe allo stesso prezzo, scegli la 7800 XT per la conversazione e la GRE per l'uso con prompt lunghi.

#Ciò che entra in 16 GB di VRAM

Calcola circa 15 GB per il modello e la sua cache KV quando la scheda non gestisce lo schermo. I pesi in Q4 provengono dal catalogo QuelLLM; a questi si aggiunge il contesto.

Cosa può ospitare una 7900 GRE (solo pesi)
ModelloDimensione del modelloMargine per il contestoVerdetto
Gemma 4 12B in Q4≈ 7 GB≈ 8 GBMolto comodo, contesto lungo
Gemma 4 12B in Q8≈ 13 GB≈ 2 GBCi sta, con contesto breve
gpt-oss 20B in Q4≈ 13 GB≈ 2 GBRientra nella memoria disponibile, con un contesto da breve a medio
Devstral Small 2 24B in Q4≈ 14 GB≈ 1 GBCi sta a malapena
Gemma 4 31B in Q4≈ 18 GBnessunaNon entra in memoria, servono da 20 a 24 GB

Il limite dei 16 GB si trova quindi tra il 24B, che ci sta, e il 31B, che non ci sta. Per superare questo limite senza passare a una scheda da 24 GB, la RX 7900 XT da 20 GB offre un margine intermedio; la guida dedicata spiega in dettaglio cosa offre. Per tutte le schede da 16 GB, indipendentemente dalla marca, la pagina per VRAM confronta i modelli.

#Velocità misurate e limite della larghezza di banda

Nessun dato numerico di questa pagina è una misurazione effettuata dal sito. I valori provengono dalle discussioni pubbliche del repository llama.cpp, che utilizzano tutte Llama 2 7B in Q4_0 (3,56 GiB) e llama-bench. La lettura del prompt (pp512) misura la velocità di ingestione di 512 token; la generazione (tg128) misura la velocità di scrittura. Per la RX 7900 GRE con Vulkan, la discussione riporta 116,11 token al secondo in generazione senza Flash Attention e 110,50 con Flash Attention. Con ROCm, riporta 96,07.

Il limite teorico della velocità di generazione, dato dalla larghezza di banda divisa per la dimensione dei pesi, è qui di 576 GB/s divisi per 3,82 GB, cioè circa 151 token al secondo. La scheda raggiunge il 77% di questo limite con Vulkan senza Flash Attention. Applicare questo rendimento a modelli più grandi dà un ordine di grandezza: non è una misura, e un altro driver o un'altra versione di llama.cpp lo farà variare.

Stima al 75% del limite di 576 GB/s (calcolo, non misura)
Modello (Q4)Dimensione del modelloLimite teoricoOrdine di grandezza
Llama 3.1 8B≈ 6 GB≈ 96 token/s≈ 72 token/s
Gemma 4 12B≈ 7 GB≈ 82 token/s≈ 62 token/s
Phi-4 14B≈ 9 GB≈ 64 token/s≈ 48 token/s
Devstral Small 2 24B≈ 14 GB≈ 41 token/s≈ 31 token/s

#Che cosa cambia in pratica con la lettura del prompt

La lettura del prompt sembra astratta finché non la si converte in secondi di attesa. Il calcolo è semplice: numero di token del prompt diviso per la velocità pp512. Suppone che la velocità misurata su 512 token si mantenga su un prompt più lungo, cosa che è solo approssimativamente vera, poiché la lettura rallenta quando il contesto aumenta. I tempi riportati di seguito sono quindi delle stime per un documento di circa 4.000 token, cioè una decina di pagine.

Tempo di ingestione di un prompt di 4.000 token (calcolato a partire dalle misure pp512)
Scheda e backendVelocità pp512Attesa prima della prima parola
RX 7900 GRE, Vulkan2 336 t/s≈ 1,7 s
RX 7800 XT, Vulkan2 017 t/s≈ 2,0 s
RX 7900 GRE, ROCm1 457 t/s≈ 2,7 s
RX 9070, Vulkan3 164 t/s≈ 1,3 s

La differenza tra queste schede si misura quindi in frazioni di secondo su un documento breve. Diventa percepibile quando il prompt raggiunge decine di migliaia di token, come nel caso di un intero repository di codice o di un insieme di PDF, oppure quando ogni richiesta di un agente rilegge contesti di grandi dimensioni. Per un utilizzo a basso volume, scegli la scheda in base al costo per GB di VRAM, non in base a questo criterio.

#Rispetto alla RX 9070: stessa VRAM, RDNA 4

La RX 9070 è l'altra scheda da 16 GB della gamma attuale. Ha 640 GB/s di banda contro 576 GB/s, un TDP di 220 W contro 260 W e 3.584 processori di flusso. Con Vulkan, genera a 119,71 token al secondo e legge a 3.164: è più veloce del 35% nella lettura del prompt e quasi alla pari nella generazione. La differenza pratica è altrove: ROCm, Ollama e Windows si comportano diversamente per queste due generazioni, come spiegato nella pagina della RX 9070. Un esempio concreto: la documentazione di Ollama elenca la RX 9070 tra le schede ROCm su Linux ma non su Windows, dove utilizza Vulkan, mentre la RX 7900 GRE compare negli elenchi di entrambi i sistemi. Se lavori su Windows e vuoi usare ROCm, questo favorisce la GRE; se accetti Vulkan, la differenza scompare.

RX 7900 GRE e RX 9070 su Vulkan (Llama 2 7B Q4_0, senza FA)
CriterioRX 7900 GRERX 9070
Larghezza di banda576 GB/s640 GB/s
Potenza della scheda260 W220 W
Lettura pp5122 336,31 t/s3 164,10 t/s
Generazione tg128116,11 t/s119,71 t/s

#Avvio

  1. 01
    Scegliere il sistema
    AMD supporta le Radeon RX 7000 solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Su Windows, Ollama utilizza uno stack ROCm v7 o HIP7.
  2. 02
    Installare Ollama
    Su Linux è richiesto il driver ROCm v7. Vulkan, attivato per impostazione predefinita, funge da fallback e dà buoni risultati su questa scheda.
  3. 03
    Caricare un modello che rientri nella memoria disponibile
    Prova prima un 12B o un 20B, poi un 24B, con un contesto breve. Verifica con ollama ps che il modello sia interamente sulla GPU.
  4. 04
    Confrontare i due backend
    Avvia llama-bench con Vulkan e poi con ROCm, con e senza Flash Attention. Su questa scheda, Flash Attention ha rallentato la generazione con Vulkan nelle misurazioni pubblicate.
Terminale
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#Per quale uso scegliere la 7900 GRE

Il criterio che la distingue è il rapporto tra calcolo e memoria: molta potenza di calcolo per 16 GB e 576 GB/s. È adatta quando il tempo prima della prima parola conta quanto la velocità di scrittura, ad esempio per un assistente che elabora documenti lunghi o un flusso RAG il cui prompt contiene migliaia di token. Per una chat breve, il vantaggio scompare e la 7800 XT, con maggiore banda passante, fa altrettanto bene o meglio.

Quale scheda AMD da 16 GB per quale uso
UsoScheda da preferireMotivo
Chat, generazione di testoRX 7800 XT o RX 9070Banda passante più elevata, generazione più veloce o altrettanto veloce
RAG, documenti lunghiRX 9070, poi RX 7900 GRELettura del prompt più rapida
Modelli da 30 a 32BNessuna delle treServono da 20 a 24 GB di VRAM
Budget limitato per l'acquisto di una scheda usataLa meno costosa delle treIl costo per GB di VRAM su /prix-gpu-ia è decisivo

In sintesi per le tre schede da 16 GB: la 7800 XT è la scelta semplice per la conversazione, la 9070 la scelta più veloce in lettura e con i consumi più contenuti, a 220 W, e la 7900 GRE la scelta opportunistica quando il prezzo scende sotto quello delle altre due. Nessuna delle tre sblocca i modelli da 30 miliardi di parametri, che richiedono più memoria.

#Verdetto 2026

Un'opzione pertinente
Se trovi la GRE allo stesso prezzo di una 7800 XT o a meno e i tuoi prompt sono lunghi.
Una scelta meno pertinente
Se costa più di una 7800 XT e fai soprattutto conversazione: paghi una potenza di calcolo che la generazione non utilizza.
Da verificare prima dell'acquisto
Che il sistema rilevi correttamente 16 GB di VRAM e il modello corretto della scheda, usando rocminfo su Linux o Gestione attività su Windows.

#Domande frequenti

FAQ
La RX 7900 GRE è adatta per gli LLM locali?+
Sì: i suoi 16 GB consentono di caricare in Q4 modelli da 20 a 24 miliardi di parametri, e la scheda genera circa 116 token al secondo su un 7B in Q4_0 con Vulkan secondo una misura pubblica. Il suo vantaggio rispetto alla RX 7800 XT si limita alla lettura del prompt.
RX 7900 GRE o RX 7800 XT per l'IA locale?+
La 7800 XT per la conversazione: ha 624 GB/s di banda passante contro i 576 GB/s e genera un po' più velocemente nelle misure pubbliche. La 7900 GRE legge il prompt circa il 16% più velocemente su Vulkan, utile per documenti lunghi. A prezzo uguale, la scelta dipende dall'uso.
Quali modelli eseguire su una RX 7900 GRE da 16 GB?+
Gemma 4 12B in Q4 o Q8, gpt-oss 20B in Q4 e Devstral Small 2 24B in Q4 rientrano nella memoria disponibile, con un contesto breve per gli ultimi due. Un modello da 31B come Gemma 4 in Q4, circa 18 GB, supera i 16 GB della scheda.
La RX 7900 GRE funziona con Ollama?+
Sì, la documentazione di Ollama la elenca su Linux, con il driver ROCm v7, e su Windows. AMD la elenca anche in ROCm, con target gfx1100, ma solo su Ubuntu 24.04.4, 22.04.5, RHEL 10.1 e RHEL 9.7. Vulkan, attivato per impostazione predefinita in Ollama, resta utilizzabile come alternativa se il rilevamento fallisce.
Vulkan o ROCm su RX 7900 GRE?+
Nelle discussioni pubbliche del repository llama.cpp, Vulkan genera più velocemente di ROCm su questa scheda (116 contro 96 token al secondo senza Flash Attention) e legge anche più velocemente il prompt. Le configurazioni variano da una serie all'altra: testa entrambi con il tuo modello.
Quando la RX 7900 GRE non basta più?+
Non appena punti a modelli da 30 miliardi di parametri o più, oppure a un contesto molto lungo su un 24B, 16 GB non bastano più. Il passo successivo è quindi una RX 7900 XT da 20 GB o una scheda da 24 GB.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.