Principiante 11 minRadeon RX 9000

Quale LLM su Radeon RX 9060 XT (8 / 16 GB) ?

Risposta diretta

La RX 9060 XT può essere utilizzata per i modelli LLM locali, a condizione di scegliere la versione da 16 GB: gli stessi 320 GB/s di quella da 8 GB secondo AMD, ma abbastanza memoria per modelli da 12 a 24 miliardi di parametri in Q4. La versione da 8 GB è limitata ai modelli da 9 miliardi. È supportata da ROCm 7 su Linux.

La RX 9060 XT è la Radeon RDNA 4 di fascia entry-level per l'IA locale. Questa guida confronta le due versioni con diversa capacità di memoria, spiega cosa può stare in ciascuna, indica il limite massimo di velocità consentito dalla sua banda passante di 320 GB/s e precisa la compatibilità con Linux e Windows.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-29·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.

#RX 9060 XT: la versione 16 GB è l'unica seria per gli LLM

Per eseguire LLM in locale, scegli la Radeon RX 9060 XT nella versione da 16 GB. Le due versioni condividono lo stesso processore grafico e la stessa larghezza di banda di 320 GB/s; cambia soltanto la capacità, ed è questa a determinare cosa puoi caricare. Con 8 GB, sei limitato ai modelli da 7 a 9 miliardi di parametri in Q4, con un contesto breve. Con 16 GB, passi ai modelli da 12 a 24 miliardi di parametri, a un contesto più lungo e a una quantizzazione più fedele. Al lancio, AMD indicava 299 dollari per la versione da 8 GB e 349 dollari per quella da 16 GB: una differenza di 50 dollari per raddoppiare la memoria.

RX 9060 XT 8 GB e 16 GB secondo AMD
Caratteristica8 GB16 GB
Memoria8 GB GDDR616 GB GDDR6
Bus di memoria e banda passante128 bit, fino a 320 GB/s128 bit, fino a 320 GB/s
Potenza tipica della scheda150 W160 W
Potenza minima consigliata dell'alimentatore450 W450 W
Prezzo consigliato americano al lancio (maggio 2025)299 $349 $

I prezzi cambiano; per conoscere il prezzo del giorno e quello per gigabyte di VRAM, consulta il monitoraggio dei prezzi delle schede grafiche per l'IA locale. Il principio da ricordare: su una scheda economica, il sovrapprezzo per la versione da 16 GB è basso rispetto alle possibilità che offre.

#Compatibilità con ROCm, Vulkan e Windows

La RX 9060 XT figura nella matrice di compatibilità ROCm 7.2.1 delle Radeon, per Ubuntu 22.04, 24.04 e 25.10. Ollama la elenca anche tra le schede supportate da ROCm su Linux, con il driver ROCm v7. Su Linux, l'installazione di Ollama con ROCm segue quindi la stessa procedura delle altre Radeon: la guida Ollama con GPU AMD spiega nel dettaglio come procedere.

Su Windows, attenzione. L'elenco delle schede riportato nella documentazione di Ollama per ROCm su Windows si ferma alle RX 7000 e non menziona le RX 9000. Ollama indica inoltre che Vulkan offre un supporto aggiuntivo su Windows e Linux, abilitato per impostazione predefinita. Una RX 9060 XT può quindi funzionare su Windows tramite Vulkan; verifica con ollama ps che il modello sia effettivamente sulla GPU e non sul processore. LM Studio e llama.cpp offrono anche un backend Vulkan.

i
Un punto da verificare personalmente
Il sito non testa le schede: la compatibilità riportata sopra è quella dichiarata da AMD e Ollama. Dopo l'installazione, bastano due comandi per confermarla: rocm-smi su Linux per vedere la scheda e ollama ps dopo una risposta per leggere la percentuale caricata sulla GPU.

#Ciò che entra in 8 GB e in 16 GB

I pesi di seguito provengono dal catalogo QuelLLM, in Q4 salvo indicazione contraria. Ai pesi si aggiungono la cache KV, che cresce con il contesto, e un margine di circa un gigabyte per il sistema e i buffer. Un modello i cui soli pesi occupano il 100% della memoria della scheda è quindi troppo grande.

Dimensioni dei modelli (catalogo QuelLLM) e valutazioni per versione
ModelloDimensione del modello8 GB16 GB
Qwen 3.5 9B Q46 GBAl limite, contesto breveComodo
Qwen 3.5 9B Q810 GBNoComodo
Gemma 4 12B Q47 GBTroppo strettoComodo
Gemma 4 12B Q813 GBNoStretto
gpt-oss 20B Q413 GBNoSì, contesto moderato
Mistral Small 24B Q414 GBNoPoco margine, 2 GB per il contesto
Qwen 3.8 27B Q416 GBNoNo, supera la capacità disponibile

La conclusione pratica si riassume in una frase: la scheda da 16 GB dà accesso alla categoria dei modelli da 12 a 24 miliardi di parametri, in cui si trovano modelli nettamente più capaci nel ragionamento, nella programmazione e in francese. La guida sui 16 GB di VRAM fornisce l’elenco completo, quella sugli 8 GB i trucchi per sfruttare al massimo la memoria.

#Velocità attesa: la banda passante determina il limite massimo

La generazione di testo legge, a ogni token, la maggior parte dei pesi del modello: la velocità massima è quindi la banda passante divisa per la dimensione dei pesi letti. Con 320 GB/s, si ottiene un limite teorico di circa 53 token al secondo per un Qwen 3.5 9B in Q4 (6 GB), 46 per un Gemma 4 12B (7 GB), 23 per un Mistral Small 24B (14 GB), e circa 32 per lo stesso Qwen 3.5 9B in Q8 (10 GB). Questi valori sono limiti teorici, mai raggiunti esattamente; i modelli MoE, che leggono solo i propri pesi attivi, sfuggono in parte a questo vincolo.

L'unico riferimento pubblico comparabile è la tabella della comunità llama.cpp su ROCm: per la RX 9060 XT, un partecipante riporta 1 420 token al secondo nella lettura del prompt e 68 nella generazione con un Llama 2 7B in Q4_0, senza Flash Attention. Questo piccolo modello è molto più leggero di quelli della tabella precedente. Dà un ordine di grandezza, non la velocità di un 12B o di un 24B sulla tua installazione, che varierà in base al driver, al sistema e alla scheda del produttore.

Limite teorico con una banda passante di 320 GB/s (banda passante ÷ peso dei modelli Q4 del catalogo)
ModelloPesi letti per tokenLimite teorico
Qwen 3.5 9B Q46 GB≈ 53 token/s
Qwen 3.5 9B Q810 GB≈ 32 token/s
Gemma 4 12B Q47 GB≈ 46 tokens/s
Mistral Small 24B Q414 GB≈ 23 token/s
→
Q8 o Q4: il vero costo
Passare da Q4 a Q8 quasi raddoppia la quantità di pesi letti per ogni token, quindi dimezza approssimativamente la velocità massima. Su una scheda con una banda di 320 GB/s, Q4_K_M resta il miglior compromesso per la chat; riserva il Q8 alle attività in cui la precisione conta più della fluidità.

#Configurare Ollama per non superare i 16 GB

Con 16 GB, ogni gigabyte di margine conta. Tre impostazioni evitano il passaggio silenzioso di parte del modello al processore, che fa crollare la velocità senza messaggi di errore. La prima è la dimensione del contesto: la documentazione di Ollama indica una finestra predefinita di 4.096 token, modificabile con OLLAMA_CONTEXT_LENGTH; ogni raddoppio del contesto aumenta la cache KV. La seconda è la cache KV stessa, che può essere quantizzata con OLLAMA_KV_CACHE_TYPE (f16 per impostazione predefinita, q8_0 per ridurla) quando Flash Attention è attiva. La terza è il controllo: dopo una risposta, ollama ps mostra la ripartizione tra GPU e processore.

Server con contesto 16k e cache KV in q8_0
OLLAMA_CONTEXT_LENGTH=16384 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve
# dans un autre terminal
ollama run <nom-du-modèle>
ollama ps

Un esempio di ragionamento: un modello da 14 GB come Mistral Small 24B in Q4 su una scheda da 16 GB lascia circa 2 GB per il contesto, la cache e i buffer. Se ollama ps mostra una ripartizione tra GPU e processore, riduci prima il contesto, poi quantizza la cache KV, poi scendi di un livello di quantizzazione, anziché lasciare che il modello venga caricato in parte nella RAM di sistema. La guida sulla quantizzazione della cache KV illustra in dettaglio la procedura.

#Acquistare, aspettare o puntare a 24 GB

Si presentano tre situazioni. Se hai già un PC desktop recente e un alimentatore da 450 W o più, la 9060 XT da 16 GB è un modo semplice per passare da un uso limitato ai piccoli modelli a un uso serio della chat, della traduzione e della programmazione leggera. Se punti a modelli con 27-35 miliardi di parametri, né i 16 GB né la sua banda passante di 320 GB/s bastano: guarda le schede da 24 GB, consultando anche la guida alla RX 7900 XTX. Se non riesci a decidere in base al prezzo, confronta il costo per gigabyte di VRAM nel monitoraggio dei prezzi del sito: è il criterio giusto per l'IA locale.

#Due RX 9060 XT: 32 GB a un prezzo più basso?

La domanda ricorre nelle ricerche. In llama.cpp, la modalità di ripartizione predefinita suddivide il modello per layer tra le schede, in pipeline, e un'opzione regola la proporzione assegnata a ciascuna scheda. Due 9060 XT da 16 GB offrono complessivamente 32 GB di VRAM per circa 320 W di potenza tipica secondo AMD, il che permette di caricare un Qwen 3.8 27B in Q4 (16 GB di pesi) con molto contesto, oppure un MoE da 30 a 35 miliardi di parametri (da 19 a 21 GB).

Due limiti da conoscere. La velocità per token non raddoppia: le schede lavorano una dopo l'altra su ogni token e ciascuna mantiene la propria banda passante di 320 GB/s. Inoltre, servono una scheda madre con due slot PCIe utilizzabili e un case ventilato. Una singola scheda da 24 GB, come la 7900 XTX, offre 960 GB/s su un solo bus; per un modello che entra nella sua memoria, genera nettamente più velocemente.

#FP8: un vantaggio sulla carta, poche conseguenze con Ollama

Le Radeon RX 9000 appartengono alla generazione RDNA 4, e AMD indica per la 9060 XT una capacità di calcolo FP8 di 205 TFLOPs, che la scheda tecnica della RX 7900 XTX non menziona. Per un uso comune con Ollama o LM Studio, questo punto conta poco: i modelli in formato GGUF sono quantizzati in interi (Q4, Q5, Q8), non in FP8. Diventa utile con motori che sfruttano pesi FP8, come vLLM, la cui documentazione elenca le RX 9000. Non usarlo come argomento d'acquisto se continui a usare Ollama.

#RX 9060 XT o RTX 5060 Ti: il duello a 16 GB

NVIDIA propone la RTX 5060 Ti nelle versioni da 16 GB e da 8 GB, con memoria GDDR7 su un bus da 128 bit, contro la GDDR6 su 128 bit della scheda AMD. La memoria più veloce dà a NVIDIA il vantaggio in termini di banda passante, quindi di velocità di generazione; consulta la scheda tecnica NVIDIA per la banda passante esatta. L'altro vantaggio riguarda il software: CUDA è la piattaforma di riferimento predefinita per la maggior parte dei progetti di IA.

Criteri di decisione a 16 GB
La tua prioritàSceltaMotivo
Velocità massima di generazione, CUDA richiestoRTX 5060 Ti 16 GBMemoria GDDR7, ecosistema CUDA
Linux, Ollama o llama.cpp, budget contenutoRX 9060 XT 16 GBROCm 7 e Vulkan coprono l'uso comune
Windows, nessuna voglia di debuggareRTX 5060 Ti 16 GBDriver e strumenti più universali
Modelli superiori ai 16 GBNé l'una né l'altraPunta a 24 GB: RX 7900 XTX o RTX 3090
Budget molto limitatoRX 9060 XT 8 GBDa riservare ai modelli da 9 miliardi di parametri
!
Nessun consiglio d'acquisto senza prezzo del giorno
Le differenze di prezzo tra queste schede cambiano ogni settimana e possono ribaltare la decisione. Confrontale sul monitoraggio dei prezzi del sito prima di decidere.

#Domande frequenti

Domande frequenti
RX 9060 XT 8 GB o 16 GB per gli LLM?+
Prendi la versione da 16 GB. Entrambe hanno 320 GB/s di larghezza di banda secondo AMD, ma la versione da 8 GB si limita ai modelli da 9 miliardi di parametri in Q4 con un contesto breve. La versione da 16 GB carica Gemma 4 12B, gpt-oss 20B o Mistral Small 24B in Q4. Al lancio, la differenza tra i prezzi consigliati era di 50 dollari.
Quanti token al secondo fa una RX 9060 XT?+
Dipende dal modello. Il limite teorico è la banda passante (320 GB/s) divisa per i pesi: circa 53 token/s per un 9B in Q4 e 23 per un 24B. Su un Llama 2 7B in Q4_0, un partecipante alla tabella di llama.cpp segnala 68 token/s in generazione su ROCm.
La RX 9060 XT funziona con Ollama?+
Sì, su Linux: Ollama la include nell'elenco delle schede supportate con ROCm v7. Su Windows, il suo elenco ROCm si ferma alle RX 7000, ma Vulkan, attivato per impostazione predefinita, offre un supporto aggiuntivo. Verifica con ollama ps che il modello sia allocato al 100% sulla GPU.
La RX 9060 XT gestisce il FP8?+
La scheda tecnica AMD elenca 205 TFLOPs di calcolo matriciale FP8, un dato che non compare nella scheda tecnica della RX 7900 XTX. Ollama e i modelli GGUF in Q4 non ne traggono vantaggio direttamente. L'FP8 interessa soprattutto vLLM, che elenca le Radeon RX 9000 tra i dispositivi supportati.
È possibile collegare due RX 9060 XT per ottenere 32 GB?+
Sì, con llama.cpp, che distribuisce gli strati tra le GPU per impostazione predefinita. Ottieni 32 GB di capacità, ma non il doppio della velocità: ogni scheda mantiene i suoi 320 GB/s e lavora a turno. Calcola circa 320 W per le due schede secondo AMD, più il consumo del resto del PC.
Quale alimentatore per una RX 9060 XT?+
AMD suggerisce almeno 450 W per entrambe le versioni, con un consumo tipico di 150 W per la versione 8 GB e di 160 W per la versione 16 GB. Aggiungi il consumo del processore e dei dischi per dimensionare l'alimentazione, poi verifica la scheda del tuo modello esatto, poiché alcuni produttori di schede raccomandano un valore superiore al minimo di AMD.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.