Quale LLM su Radeon RX 7900 GRE (16 GB) ?
La Radeon RX 7900 GRE (16 GB GDDR6, 576 GB/s, 260 W) fa girare i modelli da 20 a 24 miliardi di parametri in Q4, come la RX 7800 XT, ma senza guadagnare velocità di generazione: le misurazioni pubbliche su Llama 2 7B danno 116 token al secondo contro 118 per la 7800 XT con Vulkan. Il suo vantaggio è altrove, nella lettura del prompt con Vulkan, un po' più rapida (2 336 contro 2 017 token al secondo).
La 7900 GRE assomiglia a una 7800 XT potenziata nel calcolo ma limitata sul fronte della memoria, e le misurazioni lo mostrano. Questa guida spiega cosa consentono i suoi 16 GB, in cosa si distingue dalle due schede più vicine, la RX 7800 XT e la RX 9070, e per quale uso vale il suo prezzo.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Cosa fa una RX 7900 GRE nel 2026
La RX 7900 GRE carica in Q4 tutto ciò che pesa meno di 15 GB: Gemma 4 12B fino a Q8, gpt-oss 20B e Devstral Small 2 24B con un contesto breve. La sua velocità di generazione, limitata dalla larghezza di banda di 576 GB/s, si aggira intorno a 116 token al secondo sul modello 7B di riferimento delle classifiche con Vulkan. Questo è il punto da ricordare: il suo numero di processori di flusso, 5.120 contro i 3.840 della 7800 XT, accelera la lettura dei prompt ma non la generazione, perché non ha né più memoria né una maggiore larghezza di banda rispetto alla scheda vicina nella gamma. AMD la elenca ufficialmente in ROCm e Ollama la supporta su Linux e su Windows.
- Architettura
- RDNA 3, Navi 31 (il chip della RX 7900 XTX, qui in versione ridotta), 80 unità di calcolo e 5 120 processori di flusso.
- Memoria
- 16 GB GDDR6 con bus da 256 bit, pari a 576 GB/s.
- Consumo
- 260 W di potenza della scheda.
- Disponibilità
- Riservata inizialmente alla Cina (27 luglio 2023), commercializzata a livello internazionale il 27 febbraio 2024, con un prezzo di lancio di 549 dollari.
- Prezzo attuale
- Consulta /prix-gpu-ia: il prezzo cambia ogni settimana.
#7900 GRE contro 7800 XT: la memoria decide
Le due schede offrono 16 GB. La 7800 XT ha 624 GB/s di larghezza di banda, la 7900 GRE 576 GB/s, cioè l'8% in meno. Durante la generazione, ogni token comporta la rilettura di tutti i pesi, quindi è la larghezza di banda a determinare le prestazioni: nella discussione su Vulkan di llama.cpp, la 7800 XT supera leggermente la GRE, e il vantaggio è più netto con Flash Attention attivata. La GRE torna in vantaggio nell'elaborazione del prompt con Vulkan (il 16% in più), dove conta la capacità di calcolo. Con ROCm, entrambe le serie pubbliche di misurazioni vedono la 7800 XT in vantaggio su entrambe le metriche.
| Misurazione | RX 7900 GRE | RX 7800 XT |
|---|---|---|
| Vulkan, lettura pp512, senza FA | 2 336,31 t/s | 2 017,33 t/s |
| Vulkan, generazione tg128, senza FA | 116,11 t/s | 118,27 t/s |
| Vulkan, generazione tg128, con FA | 110,50 t/s | 124,86 t/s |
| ROCm, lettura pp512, senza FA | 1 456,98 t/s | 2 151,81 t/s |
| ROCm, generazione tg128, senza FA | 96,07 t/s | 100,94 t/s |
Queste serie provengono da contributori diversi, con commit diversi di llama.cpp: lo scarto è indicativo dell'ordine di grandezza, non il risultato di un confronto di laboratorio. Eppure concordano sul fatto che la GRE non genera più velocemente di una 7800 XT. Se le trovi entrambe allo stesso prezzo, scegli la 7800 XT per la conversazione e la GRE per l'uso con prompt lunghi.
#Ciò che entra in 16 GB di VRAM
Calcola circa 15 GB per il modello e la sua cache KV quando la scheda non gestisce lo schermo. I pesi in Q4 provengono dal catalogo QuelLLM; a questi si aggiunge il contesto.
| Modello | Dimensione del modello | Margine per il contesto | Verdetto |
|---|---|---|---|
| Gemma 4 12B in Q4 | ≈ 7 GB | ≈ 8 GB | Molto comodo, contesto lungo |
| Gemma 4 12B in Q8 | ≈ 13 GB | ≈ 2 GB | Ci sta, con contesto breve |
| gpt-oss 20B in Q4 | ≈ 13 GB | ≈ 2 GB | Rientra nella memoria disponibile, con un contesto da breve a medio |
| Devstral Small 2 24B in Q4 | ≈ 14 GB | ≈ 1 GB | Ci sta a malapena |
| Gemma 4 31B in Q4 | ≈ 18 GB | nessuna | Non entra in memoria, servono da 20 a 24 GB |
Il limite dei 16 GB si trova quindi tra il 24B, che ci sta, e il 31B, che non ci sta. Per superare questo limite senza passare a una scheda da 24 GB, la RX 7900 XT da 20 GB offre un margine intermedio; la guida dedicata spiega in dettaglio cosa offre. Per tutte le schede da 16 GB, indipendentemente dalla marca, la pagina per VRAM confronta i modelli.
- Radeon RX 7900 XT : 20 GB per superare i 24B
- Quale LLM per 16 GB di VRAM, indipendentemente dalla scheda grafica
#Velocità misurate e limite della larghezza di banda
Nessun dato numerico di questa pagina è una misurazione effettuata dal sito. I valori provengono dalle discussioni pubbliche del repository llama.cpp, che utilizzano tutte Llama 2 7B in Q4_0 (3,56 GiB) e llama-bench. La lettura del prompt (pp512) misura la velocità di ingestione di 512 token; la generazione (tg128) misura la velocità di scrittura. Per la RX 7900 GRE con Vulkan, la discussione riporta 116,11 token al secondo in generazione senza Flash Attention e 110,50 con Flash Attention. Con ROCm, riporta 96,07.
Il limite teorico della velocità di generazione, dato dalla larghezza di banda divisa per la dimensione dei pesi, è qui di 576 GB/s divisi per 3,82 GB, cioè circa 151 token al secondo. La scheda raggiunge il 77% di questo limite con Vulkan senza Flash Attention. Applicare questo rendimento a modelli più grandi dà un ordine di grandezza: non è una misura, e un altro driver o un'altra versione di llama.cpp lo farà variare.
| Modello (Q4) | Dimensione del modello | Limite teorico | Ordine di grandezza |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 96 token/s | ≈ 72 token/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 82 token/s | ≈ 62 token/s |
| Phi-4 14B | ≈ 9 GB | ≈ 64 token/s | ≈ 48 token/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 41 token/s | ≈ 31 token/s |
#Che cosa cambia in pratica con la lettura del prompt
La lettura del prompt sembra astratta finché non la si converte in secondi di attesa. Il calcolo è semplice: numero di token del prompt diviso per la velocità pp512. Suppone che la velocità misurata su 512 token si mantenga su un prompt più lungo, cosa che è solo approssimativamente vera, poiché la lettura rallenta quando il contesto aumenta. I tempi riportati di seguito sono quindi delle stime per un documento di circa 4.000 token, cioè una decina di pagine.
| Scheda e backend | Velocità pp512 | Attesa prima della prima parola |
|---|---|---|
| RX 7900 GRE, Vulkan | 2 336 t/s | ≈ 1,7 s |
| RX 7800 XT, Vulkan | 2 017 t/s | ≈ 2,0 s |
| RX 7900 GRE, ROCm | 1 457 t/s | ≈ 2,7 s |
| RX 9070, Vulkan | 3 164 t/s | ≈ 1,3 s |
La differenza tra queste schede si misura quindi in frazioni di secondo su un documento breve. Diventa percepibile quando il prompt raggiunge decine di migliaia di token, come nel caso di un intero repository di codice o di un insieme di PDF, oppure quando ogni richiesta di un agente rilegge contesti di grandi dimensioni. Per un utilizzo a basso volume, scegli la scheda in base al costo per GB di VRAM, non in base a questo criterio.
#Rispetto alla RX 9070: stessa VRAM, RDNA 4
La RX 9070 è l'altra scheda da 16 GB della gamma attuale. Ha 640 GB/s di banda contro 576 GB/s, un TDP di 220 W contro 260 W e 3.584 processori di flusso. Con Vulkan, genera a 119,71 token al secondo e legge a 3.164: è più veloce del 35% nella lettura del prompt e quasi alla pari nella generazione. La differenza pratica è altrove: ROCm, Ollama e Windows si comportano diversamente per queste due generazioni, come spiegato nella pagina della RX 9070. Un esempio concreto: la documentazione di Ollama elenca la RX 9070 tra le schede ROCm su Linux ma non su Windows, dove utilizza Vulkan, mentre la RX 7900 GRE compare negli elenchi di entrambi i sistemi. Se lavori su Windows e vuoi usare ROCm, questo favorisce la GRE; se accetti Vulkan, la differenza scompare.
| Criterio | RX 7900 GRE | RX 9070 |
|---|---|---|
| Larghezza di banda | 576 GB/s | 640 GB/s |
| Potenza della scheda | 260 W | 220 W |
| Lettura pp512 | 2 336,31 t/s | 3 164,10 t/s |
| Generazione tg128 | 116,11 t/s | 119,71 t/s |
#Avvio
- 01Scegliere il sistemaAMD supporta le Radeon RX 7000 solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Su Windows, Ollama utilizza uno stack ROCm v7 o HIP7.
- 02Installare OllamaSu Linux è richiesto il driver ROCm v7. Vulkan, attivato per impostazione predefinita, funge da fallback e dà buoni risultati su questa scheda.
- 03Caricare un modello che rientri nella memoria disponibileProva prima un 12B o un 20B, poi un 24B, con un contesto breve. Verifica con ollama ps che il modello sia interamente sulla GPU.
- 04Confrontare i due backendAvvia llama-bench con Vulkan e poi con ROCm, con e senza Flash Attention. Su questa scheda, Flash Attention ha rallentato la generazione con Vulkan nelle misurazioni pubblicate.
#Per quale uso scegliere la 7900 GRE
Il criterio che la distingue è il rapporto tra calcolo e memoria: molta potenza di calcolo per 16 GB e 576 GB/s. È adatta quando il tempo prima della prima parola conta quanto la velocità di scrittura, ad esempio per un assistente che elabora documenti lunghi o un flusso RAG il cui prompt contiene migliaia di token. Per una chat breve, il vantaggio scompare e la 7800 XT, con maggiore banda passante, fa altrettanto bene o meglio.
| Uso | Scheda da preferire | Motivo |
|---|---|---|
| Chat, generazione di testo | RX 7800 XT o RX 9070 | Banda passante più elevata, generazione più veloce o altrettanto veloce |
| RAG, documenti lunghi | RX 9070, poi RX 7900 GRE | Lettura del prompt più rapida |
| Modelli da 30 a 32B | Nessuna delle tre | Servono da 20 a 24 GB di VRAM |
| Budget limitato per l'acquisto di una scheda usata | La meno costosa delle tre | Il costo per GB di VRAM su /prix-gpu-ia è decisivo |
In sintesi per le tre schede da 16 GB: la 7800 XT è la scelta semplice per la conversazione, la 9070 la scelta più veloce in lettura e con i consumi più contenuti, a 220 W, e la 7900 GRE la scelta opportunistica quando il prezzo scende sotto quello delle altre due. Nessuna delle tre sblocca i modelli da 30 miliardi di parametri, che richiedono più memoria.
#Verdetto 2026
- Un'opzione pertinente
- Se trovi la GRE allo stesso prezzo di una 7800 XT o a meno e i tuoi prompt sono lunghi.
- Una scelta meno pertinente
- Se costa più di una 7800 XT e fai soprattutto conversazione: paghi una potenza di calcolo che la generazione non utilizza.
- Da verificare prima dell'acquisto
- Che il sistema rilevi correttamente 16 GB di VRAM e il modello corretto della scheda, usando rocminfo su Linux o Gestione attività su Windows.
- Prezzi delle schede grafiche per l'IA locale, rilevati due volte a settimana
- Documentazione Ollama: schede AMD supportate
- Compatibilità delle GPU con ROCm, documentazione AMD
- Classifica Vulkan del repository llama.cpp
#Domande frequenti
La RX 7900 GRE è adatta per gli LLM locali?+
RX 7900 GRE o RX 7800 XT per l'IA locale?+
Quali modelli eseguire su una RX 7900 GRE da 16 GB?+
La RX 7900 GRE funziona con Ollama?+
Vulkan o ROCm su RX 7900 GRE?+
Quando la RX 7900 GRE non basta più?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.