Quale LLM su Radeon RX 7900 XTX (24 GB) ?
La RX 7900 XTX (24 GB di GDDR6, fino a 960 GB/s secondo AMD) è un’ottima scheda per i LLM in locale con Ollama o llama.cpp: può ospitare qualsiasi modello i cui pesi rimangano sotto circa 20 GB in Q4, come un modello denso da 27B o un MoE da 30-35B. È supportata da ROCm 7; oltre i 24 GB, parte del modello viene trasferita nella RAM.
La 7900 XTX risale al 2022, ma i suoi 24 GB ne fanno ancora una scheda di riferimento tra quelle AMD. Questa guida spiega cosa riesce a eseguire, con quali software, a quale velocità secondo i benchmark pubblici e quando è preferibile una RTX o una scheda più recente.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RX 7900 XTX per gli LLM: cosa cambia con 24 GB
La Radeon RX 7900 XTX esegue senza difficoltà un LLM locale purché il modello rientri nei suoi 24 GB di VRAM: un modello da 7B a 9B in Q4 gira senza problemi, un modello da 27B in Q4 (circa 16 GB per i pesi) lascia spazio al contesto e un modello MoE da 30 a 35 miliardi di parametri, di cui 3 miliardi attivi, ci sta ancora, ma a malapena. Due condizioni: usare Ollama, LM Studio o llama.cpp, tutti compatibili con i suoi driver, e restare sotto i 24 GB, perché oltre questa soglia il modello viene trasferito in parte nella RAM e la velocità crolla. È la scheda con la maggiore quantità di VRAM della gamma consumer AMD RDNA 3.
Il costruttore fornisce i numeri che contano per l'IA locale: 24 GB di GDDR6 e una banda passante della memoria che può raggiungere 960 GB/s. La banda passante è il numero più utile qui, perché la generazione di testo legge a ogni token la maggior parte dei pesi del modello: più è alta, più è alto il limite di token al secondo.
| Caratteristica | Valore |
|---|---|
| Memoria | 24 GB GDDR6 |
| Larghezza di banda | fino a 960 GB/s |
| Processori di flusso / unità di calcolo | 6 144 / 96 |
| Acceleratori IA | 192 |
| Potenza tipica della scheda | 355 W |
| Potenza minima consigliata dell'alimentatore | 800 W |
| Formati matriciali elencati | FP16 (123 TFLOPs), INT8, INT4; senza FP8 |
#Driver e software: ciò che è compatibile nel 2026
Per una scheda AMD, la prima questione riguarda lo stack software. La 7900 XTX figura nella matrice di compatibilità ROCm della documentazione Radeon di AMD, nella versione 7.2.1, per Ubuntu 22.04, 24.04 e 25.10. Ollama, da parte sua, indica che richiede il driver AMD ROCm v7 su Linux ed elenca la 7900 XTX sia per Linux che per Windows. Due conseguenze pratiche: su Linux, l'installazione passa attraverso l'utilità amdgpu-install; su Windows, la scheda viene riconosciuta senza interventi particolari.
Se ROCm ti crea problemi, esiste una seconda possibilità. Ollama precisa che il supporto per ulteriori GPU su Windows e Linux passa attraverso Vulkan, attivato per impostazione predefinita quando il backend è installato. Vulkan è anche il backend di ripiego di llama.cpp: la guida su llama.cpp con Vulkan spiega la compilazione. Per vLLM, la documentazione attuale elenca le Radeon RX 7900 (gfx1100 e gfx1101) con ROCm 6.3 o superiore e propone pacchetti precompilati per ROCm 7.0 e 7.2.1 con Python 3.12.
#Installare Ollama su una 7900 XTX (Linux)
- 01Installare il driver ROCmSegui la documentazione ROCm di AMD e usa l'utilità amdgpu-install, come richiesto da Ollama, poi aggiungi l'utente ai gruppi render e video e riavvia.
- 02Verificare che la scheda venga rilevataEsegui rocminfo e poi rocm-smi: la 7900 XTX deve comparire con 24 GB. Se non compare nulla, Ollama passerà al processore.
- 03Installare OllamaUsa lo script ufficiale o la guida all'installazione di Ollama su Linux, poi scarica un modello che rientri in 24 GB.
- 04Controllare il posizionamentoDopo una prima risposta, ollama ps indica la percentuale del modello allocata sulla GPU. Deve mostrare 100 % GPU; altrimenti il modello o il contesto è troppo grande.
#Quali modelli entrano in 24 GB e a quale velocità
La lista completa dei modelli per fascia di memoria si trova nella guida «Quale LLM per 24 GB di VRAM»; ecco l'essenziale per questa scheda. I pesi riportati di seguito provengono dal catalogo QuelLLM, in Q4, senza includere il contesto. Il limite teorico è la banda passante divisa per i pesi letti a ogni token: non può essere superato e non viene raggiunto nella pratica.
| Modello | Pesi Q4 | Margine su 24 GB | Limite teorico |
|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 18 GB | 160 token/s |
| gpt-oss 20B (MoE) | 13 GB | 11 GB | dipende dai pesi attivi |
| Devstral Small 2 24B | 14 GB | 10 GB | ≈ 68 token/s |
| Qwen 3.8 27B | 16 GB | 8 GB | 60 token/s |
| Granite 4.1 30B | 17 GB | 7 GB | ≈ 56 token/s |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | dipende dai pesi attivi |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | dipende dai pesi attivi |
Questa tabella si può leggere in due modi. Innanzitutto, il margine: su 24 GB, un modello da 21 GB lascia soltanto 3 GB per la cache KV e il sistema, quindi un contesto breve. Qwen 3.8 27B, con 8 GB di margine, offre più spazio per un contesto lungo. Poi, i MoE: un modello 35B-A3B legge soltanto i suoi 3 miliardi di parametri attivi a ogni token, quindi genera molto più velocemente di un modello denso da 27 miliardi, ma deve comunque stare interamente nella VRAM.
#Ciò che i benchmark pubblici misurano su questa scheda
La tabella di riferimento della comunità llama.cpp misura, su ROCm e con lo stesso modello (Llama 2 7B in Q4_0), la velocità di lettura del prompt (pp512) e quella di generazione (tg128). Sulla 7900 XTX, un partecipante rileva 3552 token/s nell'elaborazione del prompt e 167 token/s nella generazione senza Flash Attention, poi 3874 e 170 con Flash Attention. L'autore della tabella avverte che i risultati variano in base al driver, al sistema e al produttore della scheda, anche a parità di chip.
| Scheda | Larghezza di banda AMD | Prompt pp512 | Generazione tg128 |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
Questa tabella mostra due cose. La generazione segue la larghezza di banda: la 7900 XTX (960 GB/s) genera circa 1,65 volte più velocemente della 9070 XT (640 GB/s) e 2,5 volte più velocemente della 9060 XT (320 GB/s). La lettura del prompt, invece, dipende maggiormente dalla potenza di calcolo matriciale, e la 9070 XT, di generazione più recente, supera la 7900 XTX sotto questo aspetto. Per un uso in chat con risposte lunghe, la larghezza di banda e i 24 GB hanno la priorità; per il RAG con documenti di grandi dimensioni in ingresso, la velocità di lettura del prompt conta di più.
#70B, 30B MoE e due schede: fino a dove andare
Un modello denso da 70B in Q4 ha circa 40 GB di pesi secondo il riferimento del sito, quasi il doppio della VRAM: sarebbe necessario caricare più di 16 GB nella RAM di sistema e la velocità sarebbe quindi limitata dalla RAM e dal bus PCIe, non dalla scheda. Non forniamo un valore di throughput per questo caso, perché manca una fonte verificabile; tieni presente soltanto che non offre un'esperienza d'uso confortevole. I MoE da 30 a 35 miliardi di parametri, a parità di qualità generale, rappresentano la soluzione pratica a questo limite di 24 GB.
Due 7900 XTX fanno la differenza in termini di capacità. In llama.cpp, la modalità di ripartizione predefinita divide gli strati del modello tra le schede, con un funzionamento a pipeline, e un'opzione permette di scegliere le proporzioni per ciascuna scheda. Ottieni così un totale di 48 GB, sufficienti per un 70B in Q4 con un po' di contesto. Il vantaggio riguarda le dimensioni dei modelli che entrano in memoria, non la velocità per token: ogni token attraversa le due schede una dopo l'altra. Sul piano hardware, due schede da 355 W assorbono complessivamente 710 W, senza contare il resto del PC, il che richiede un alimentatore adeguatamente dimensionato, due slot PCIe adatti e un case ventilato.
#Contesto e cache KV: la vera limitazione dei 24 GB
Il peso di un modello è solo una parte della memoria utilizzata: la cache KV cresce con la lunghezza del contesto. Secondo la sua documentazione, Ollama utilizza per impostazione predefinita una finestra di contesto di 4.096 token, modificabile con la variabile OLLAMA_CONTEXT_LENGTH; i modelli recenti dichiarano da 128.000 a 262.000 token, ma per utilizzare questi contesti serve memoria aggiuntiva. Due possibilità: attivare Flash Attention, che Ollama utilizza automaticamente quando il backend e la scheda lo permettono, e quantizzare la cache KV con OLLAMA_KV_CACHE_TYPE (f16 per impostazione predefinita, q8_0 per ridurre la memoria). La guida sulla quantizzazione della cache KV spiega questi parametri in dettaglio.
#7900 XTX, RTX 3090 o 4090: come scegliere
Sulla carta, anche la RTX 3090 offre 24 GB di GDDR6X, secondo NVIDIA. La scelta dipende quindi dallo stack software, dall'ambiente e dal prezzo del momento, che qui non fissiamo: consulta il monitoraggio dei prezzi delle schede per l'IA locale prima di acquistare.
| La tua situazione | Scheda da preferire | Perché |
|---|---|---|
| Linux, Ollama o llama.cpp, budget limitato | RX 7900 XTX | Supporto per 24 GB con ROCm 7 e Vulkan |
| Windows, strumenti che richiedono CUDA (alcuni progetti di fine-tuning) | RTX 3090 o 4090 | CUDA rimane la piattaforma di riferimento predefinita per la maggior parte dei progetti |
| Vuoi vLLM in produzione | Verifica il tuo modello | vLLM elenca le 7900 con ROCm; il supporto dipende dalla versione |
| Contesto lungo e MoE di grandi dimensioni | Tutte le schede da 24 GB | La VRAM ha la priorità sulla marca |
| Servono più di 24 GB | RTX 5090 (32 GB) o due schede | Nessuna scheda da 24 GB può contenere un 70B in Q4 |
Se sei indeciso tra una scheda nuova e una usata, ricorda che la 7900 XTX risale a dicembre 2022: la garanzia del produttore è spesso scaduta su una scheda usata, e una scheda utilizzata per il mining o rimasta in funzione continuamente merita un controllo delle temperature prima dell'acquisto.
- Quale LLM per 24 GB di VRAM: la lista completa dei modelli
- Ollama con GPU AMD (ROCm): configurazione dettagliata
- LLM su RX 7900 XT (20 GB)
- LLM su RTX 3090 (24 GB)
- Quantizzare la cache KV per risparmiare VRAM
- Prezzi delle schede grafiche per l'IA locale
- Fonte: scheda AMD della Radeon RX 7900 XTX
- Fonte: documentazione GPU di Ollama
- Fonte: tabella delle prestazioni di llama.cpp su ROCm
- Fonte: installazione di vLLM su GPU
#Domande frequenti
La RX 7900 XTX è adatta per i LLM locali?+
Qual modello scegliere su RX 7900 XTX?+
È possibile usare due RX 7900 XTX insieme?+
La RX 7900 XTX supporta FP8?+
ROCm o Vulkan per RX 7900 XTX?+
La 7900 XTX funziona con vLLM?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.