Intermedio 11 minRadeon RX 7000

Quale LLM su Radeon RX 7900 XTX (24 GB) ?

Risposta diretta

La RX 7900 XTX (24 GB di GDDR6, fino a 960 GB/s secondo AMD) è un’ottima scheda per i LLM in locale con Ollama o llama.cpp: può ospitare qualsiasi modello i cui pesi rimangano sotto circa 20 GB in Q4, come un modello denso da 27B o un MoE da 30-35B. È supportata da ROCm 7; oltre i 24 GB, parte del modello viene trasferita nella RAM.

La 7900 XTX risale al 2022, ma i suoi 24 GB ne fanno ancora una scheda di riferimento tra quelle AMD. Questa guida spiega cosa riesce a eseguire, con quali software, a quale velocità secondo i benchmark pubblici e quando è preferibile una RTX o una scheda più recente.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RX 7900 XTX per gli LLM: cosa cambia con 24 GB

La Radeon RX 7900 XTX esegue senza difficoltà un LLM locale purché il modello rientri nei suoi 24 GB di VRAM: un modello da 7B a 9B in Q4 gira senza problemi, un modello da 27B in Q4 (circa 16 GB per i pesi) lascia spazio al contesto e un modello MoE da 30 a 35 miliardi di parametri, di cui 3 miliardi attivi, ci sta ancora, ma a malapena. Due condizioni: usare Ollama, LM Studio o llama.cpp, tutti compatibili con i suoi driver, e restare sotto i 24 GB, perché oltre questa soglia il modello viene trasferito in parte nella RAM e la velocità crolla. È la scheda con la maggiore quantità di VRAM della gamma consumer AMD RDNA 3.

Il costruttore fornisce i numeri che contano per l'IA locale: 24 GB di GDDR6 e una banda passante della memoria che può raggiungere 960 GB/s. La banda passante è il numero più utile qui, perché la generazione di testo legge a ogni token la maggior parte dei pesi del modello: più è alta, più è alto il limite di token al secondo.

Scheda tecnica RX 7900 XTX (fonte: AMD)
CaratteristicaValore
Memoria24 GB GDDR6
Larghezza di bandafino a 960 GB/s
Processori di flusso / unità di calcolo6 144 / 96
Acceleratori IA192
Potenza tipica della scheda355 W
Potenza minima consigliata dell'alimentatore800 W
Formati matriciali elencatiFP16 (123 TFLOPs), INT8, INT4; senza FP8
i
Alimentazione: 800 W, non 850 W
AMD indica un alimentatore da almeno 800 W come raccomandazione per questa scheda. Alcuni produttori di schede partner raccomandano una potenza maggiore: segui la scheda tecnica del modello esatto che acquisti e prevedi un margine se il processore consuma molto.

#Driver e software: ciò che è compatibile nel 2026

Per una scheda AMD, la prima questione riguarda lo stack software. La 7900 XTX figura nella matrice di compatibilità ROCm della documentazione Radeon di AMD, nella versione 7.2.1, per Ubuntu 22.04, 24.04 e 25.10. Ollama, da parte sua, indica che richiede il driver AMD ROCm v7 su Linux ed elenca la 7900 XTX sia per Linux che per Windows. Due conseguenze pratiche: su Linux, l'installazione passa attraverso l'utilità amdgpu-install; su Windows, la scheda viene riconosciuta senza interventi particolari.

Se ROCm ti crea problemi, esiste una seconda possibilità. Ollama precisa che il supporto per ulteriori GPU su Windows e Linux passa attraverso Vulkan, attivato per impostazione predefinita quando il backend è installato. Vulkan è anche il backend di ripiego di llama.cpp: la guida su llama.cpp con Vulkan spiega la compilazione. Per vLLM, la documentazione attuale elenca le Radeon RX 7900 (gfx1100 e gfx1101) con ROCm 6.3 o superiore e propone pacchetti precompilati per ROCm 7.0 e 7.2.1 con Python 3.12.

#Installare Ollama su una 7900 XTX (Linux)

  1. 01
    Installare il driver ROCm
    Segui la documentazione ROCm di AMD e usa l'utilità amdgpu-install, come richiesto da Ollama, poi aggiungi l'utente ai gruppi render e video e riavvia.
  2. 02
    Verificare che la scheda venga rilevata
    Esegui rocminfo e poi rocm-smi: la 7900 XTX deve comparire con 24 GB. Se non compare nulla, Ollama passerà al processore.
  3. 03
    Installare Ollama
    Usa lo script ufficiale o la guida all'installazione di Ollama su Linux, poi scarica un modello che rientri in 24 GB.
  4. 04
    Controllare il posizionamento
    Dopo una prima risposta, ollama ps indica la percentuale del modello allocata sulla GPU. Deve mostrare 100 % GPU; altrimenti il modello o il contesto è troppo grande.
Verifiche
rocminfo | head -30
rocm-smi
ollama run gpt-oss:20b
ollama ps

#Quali modelli entrano in 24 GB e a quale velocità

La lista completa dei modelli per fascia di memoria si trova nella guida «Quale LLM per 24 GB di VRAM»; ecco l'essenziale per questa scheda. I pesi riportati di seguito provengono dal catalogo QuelLLM, in Q4, senza includere il contesto. Il limite teorico è la banda passante divisa per i pesi letti a ogni token: non può essere superato e non viene raggiunto nella pratica.

Dimensioni in Q4 (catalogo QuelLLM) e limite teorico calcolato su una banda di 960 GB/s
ModelloPesi Q4Margine su 24 GBLimite teorico
Qwen 3.5 9B6 GB18 GB160 token/s
gpt-oss 20B (MoE)13 GB11 GBdipende dai pesi attivi
Devstral Small 2 24B14 GB10 GB≈ 68 token/s
Qwen 3.8 27B16 GB8 GB60 token/s
Granite 4.1 30B17 GB7 GB≈ 56 token/s
Qwen3-Coder 30B-A3B (MoE)19 GB5 GBdipende dai pesi attivi
Qwen 3.6 35B-A3B (MoE)21 GB3 GBdipende dai pesi attivi

Questa tabella si può leggere in due modi. Innanzitutto, il margine: su 24 GB, un modello da 21 GB lascia soltanto 3 GB per la cache KV e il sistema, quindi un contesto breve. Qwen 3.8 27B, con 8 GB di margine, offre più spazio per un contesto lungo. Poi, i MoE: un modello 35B-A3B legge soltanto i suoi 3 miliardi di parametri attivi a ogni token, quindi genera molto più velocemente di un modello denso da 27 miliardi, ma deve comunque stare interamente nella VRAM.

!
Nessun valore di token/s inventato
Le velocità di elaborazione riportate online dipendono dal modello, dalla quantizzazione, dal contesto e dalla versione del software. L'unico riferimento pubblico comparabile che citiamo è la tabella della comunità llama.cpp qui sotto, relativa a un modello piccolo. Per i tuoi modelli, misura con llama-bench o con le statistiche restituite da Ollama.

#Ciò che i benchmark pubblici misurano su questa scheda

La tabella di riferimento della comunità llama.cpp misura, su ROCm e con lo stesso modello (Llama 2 7B in Q4_0), la velocità di lettura del prompt (pp512) e quella di generazione (tg128). Sulla 7900 XTX, un partecipante rileva 3552 token/s nell'elaborazione del prompt e 167 token/s nella generazione senza Flash Attention, poi 3874 e 170 con Flash Attention. L'autore della tabella avverte che i risultati variano in base al driver, al sistema e al produttore della scheda, anche a parità di chip.

Llama 2 7B Q4_0, llama.cpp ROCm (tabella della comunità, senza Flash Attention)
SchedaLarghezza di banda AMDPrompt pp512Generazione tg128
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

Questa tabella mostra due cose. La generazione segue la larghezza di banda: la 7900 XTX (960 GB/s) genera circa 1,65 volte più velocemente della 9070 XT (640 GB/s) e 2,5 volte più velocemente della 9060 XT (320 GB/s). La lettura del prompt, invece, dipende maggiormente dalla potenza di calcolo matriciale, e la 9070 XT, di generazione più recente, supera la 7900 XTX sotto questo aspetto. Per un uso in chat con risposte lunghe, la larghezza di banda e i 24 GB hanno la priorità; per il RAG con documenti di grandi dimensioni in ingresso, la velocità di lettura del prompt conta di più.

i
Piccolo modello, grande distanza dalla realtà
Un 7B in Q4_0 pesa molto meno dei modelli da 24 GB della sezione precedente. Non dedurre da questi dati la velocità di un 27B: a banda passante identica, sarà molte volte più bassa.

#70B, 30B MoE e due schede: fino a dove andare

Un modello denso da 70B in Q4 ha circa 40 GB di pesi secondo il riferimento del sito, quasi il doppio della VRAM: sarebbe necessario caricare più di 16 GB nella RAM di sistema e la velocità sarebbe quindi limitata dalla RAM e dal bus PCIe, non dalla scheda. Non forniamo un valore di throughput per questo caso, perché manca una fonte verificabile; tieni presente soltanto che non offre un'esperienza d'uso confortevole. I MoE da 30 a 35 miliardi di parametri, a parità di qualità generale, rappresentano la soluzione pratica a questo limite di 24 GB.

Due 7900 XTX fanno la differenza in termini di capacità. In llama.cpp, la modalità di ripartizione predefinita divide gli strati del modello tra le schede, con un funzionamento a pipeline, e un'opzione permette di scegliere le proporzioni per ciascuna scheda. Ottieni così un totale di 48 GB, sufficienti per un 70B in Q4 con un po' di contesto. Il vantaggio riguarda le dimensioni dei modelli che entrano in memoria, non la velocità per token: ogni token attraversa le due schede una dopo l'altra. Sul piano hardware, due schede da 355 W assorbono complessivamente 710 W, senza contare il resto del PC, il che richiede un alimentatore adeguatamente dimensionato, due slot PCIe adatti e un case ventilato.

#Contesto e cache KV: la vera limitazione dei 24 GB

Il peso di un modello è solo una parte della memoria utilizzata: la cache KV cresce con la lunghezza del contesto. Secondo la sua documentazione, Ollama utilizza per impostazione predefinita una finestra di contesto di 4.096 token, modificabile con la variabile OLLAMA_CONTEXT_LENGTH; i modelli recenti dichiarano da 128.000 a 262.000 token, ma per utilizzare questi contesti serve memoria aggiuntiva. Due possibilità: attivare Flash Attention, che Ollama utilizza automaticamente quando il backend e la scheda lo permettono, e quantizzare la cache KV con OLLAMA_KV_CACHE_TYPE (f16 per impostazione predefinita, q8_0 per ridurre la memoria). La guida sulla quantizzazione della cache KV spiega questi parametri in dettaglio.

Contesto e cache KV ridotti
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#7900 XTX, RTX 3090 o 4090: come scegliere

Sulla carta, anche la RTX 3090 offre 24 GB di GDDR6X, secondo NVIDIA. La scelta dipende quindi dallo stack software, dall'ambiente e dal prezzo del momento, che qui non fissiamo: consulta il monitoraggio dei prezzi delle schede per l'IA locale prima di acquistare.

Criteri di decisione per 24 GB
La tua situazioneScheda da preferirePerché
Linux, Ollama o llama.cpp, budget limitatoRX 7900 XTXSupporto per 24 GB con ROCm 7 e Vulkan
Windows, strumenti che richiedono CUDA (alcuni progetti di fine-tuning)RTX 3090 o 4090CUDA rimane la piattaforma di riferimento predefinita per la maggior parte dei progetti
Vuoi vLLM in produzioneVerifica il tuo modellovLLM elenca le 7900 con ROCm; il supporto dipende dalla versione
Contesto lungo e MoE di grandi dimensioniTutte le schede da 24 GBLa VRAM ha la priorità sulla marca
Servono più di 24 GBRTX 5090 (32 GB) o due schedeNessuna scheda da 24 GB può contenere un 70B in Q4

Se sei indeciso tra una scheda nuova e una usata, ricorda che la 7900 XTX risale a dicembre 2022: la garanzia del produttore è spesso scaduta su una scheda usata, e una scheda utilizzata per il mining o rimasta in funzione continuamente merita un controllo delle temperature prima dell'acquisto.

→
Alternative a 20 GB e 16 GB
Se 24 GB superano il tuo budget, la RX 7900 XT (20 GB) e la RX 9070 XT (16 GB) hanno ciascuna la propria guida. La 9070 XT è più recente, con FP8 elencato da AMD, ma con 8 GB in meno.

#Domande frequenti

Domande frequenti
La RX 7900 XTX è adatta per i LLM locali?+
Sì, principalmente grazie ai suoi 24 GB di VRAM e alla banda passante di 960 GB/s secondo AMD. Esegue senza dover trasferire parte del modello nella RAM di sistema i modelli fino a circa 27 miliardi di parametri in Q4, nonché i MoE da 30 a 35 miliardi. È compatibile con Ollama, llama.cpp e LM Studio, con ROCm 7 o Vulkan.
Qual modello scegliere su RX 7900 XTX?+
Per un uso generale, un modello denso da 27 miliardi come Qwen 3.8 27B in Q4, circa 16 GB di pesi, lascia 8 GB per il contesto. Per la velocità, un modello MoE come gpt-oss 20B o Qwen 3.6 35B-A3B. Per il coding, Devstral Small 2 24B o Qwen3-Coder 30B-A3B. Verifica sempre con ollama ps che tutto sia sulla GPU.
È possibile usare due RX 7900 XTX insieme?+
Sì, con llama.cpp, la cui modalità predefinita distribuisce i layer e la cache KV tra le schede. Ottieni 48 GB, abbastanza per un 70B in Q4, ma non una maggiore velocità per token, perché le schede lavorano in pipeline. Prevedi più di 710 W per le due schede, quindi un alimentatore con una potenza nettamente superiore a 1.000 W.
La RX 7900 XTX supporta FP8?+
Non secondo la scheda tecnica di AMD, che per questa scheda elenca FP16, INT8 e INT4 per il calcolo matriciale, ma non FP8. Per le Radeon RX 9000, della generazione RDNA 4, è elencato FP8. Per la maggior parte degli usi con modelli GGUF quantizzati in Q4 o Q5, questo punto non ha conseguenze dirette.
ROCm o Vulkan per RX 7900 XTX?+
Inizia con ROCm, la soluzione ufficiale di Ollama su Linux con il driver ROCm v7. Se l'installazione dà problemi, Vulkan, attivato per impostazione predefinita in Ollama, permette di avviare senza ROCm, generalmente con prestazioni che variano in base al driver. Confronta i due con llama-bench sul modello che usi prima di decidere.
La 7900 XTX funziona con vLLM?+
Sì, secondo la documentazione di vLLM, che elenca le Radeon RX 7900 (gfx1100 e gfx1101) con ROCm 6.3 o superiore e offre pacchetti precompilati per ROCm 7.0 e 7.2.1. Tuttavia, l'installazione è più impegnativa rispetto a quella di Ollama ed è soprattutto utile se servi più utenti contemporaneamente.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.