Quale LLM su Radeon RX 9060 XT (8 / 16 GB) ?
La RX 9060 XT può essere utilizzata per i modelli LLM locali, a condizione di scegliere la versione da 16 GB: gli stessi 320 GB/s di quella da 8 GB secondo AMD, ma abbastanza memoria per modelli da 12 a 24 miliardi di parametri in Q4. La versione da 8 GB è limitata ai modelli da 9 miliardi. È supportata da ROCm 7 su Linux.
La RX 9060 XT è la Radeon RDNA 4 di fascia entry-level per l'IA locale. Questa guida confronta le due versioni con diversa capacità di memoria, spiega cosa può stare in ciascuna, indica il limite massimo di velocità consentito dalla sua banda passante di 320 GB/s e precisa la compatibilità con Linux e Windows.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QualeLLM realizza un profitto sugli acquisti idonei.
#RX 9060 XT: la versione 16 GB è l'unica seria per gli LLM
Per eseguire LLM in locale, scegli la Radeon RX 9060 XT nella versione da 16 GB. Le due versioni condividono lo stesso processore grafico e la stessa larghezza di banda di 320 GB/s; cambia soltanto la capacità, ed è questa a determinare cosa puoi caricare. Con 8 GB, sei limitato ai modelli da 7 a 9 miliardi di parametri in Q4, con un contesto breve. Con 16 GB, passi ai modelli da 12 a 24 miliardi di parametri, a un contesto più lungo e a una quantizzazione più fedele. Al lancio, AMD indicava 299 dollari per la versione da 8 GB e 349 dollari per quella da 16 GB: una differenza di 50 dollari per raddoppiare la memoria.
| Caratteristica | 8 GB | 16 GB |
|---|---|---|
| Memoria | 8 GB GDDR6 | 16 GB GDDR6 |
| Bus di memoria e banda passante | 128 bit, fino a 320 GB/s | 128 bit, fino a 320 GB/s |
| Potenza tipica della scheda | 150 W | 160 W |
| Potenza minima consigliata dell'alimentatore | 450 W | 450 W |
| Prezzo consigliato americano al lancio (maggio 2025) | 299 $ | 349 $ |
I prezzi cambiano; per conoscere il prezzo del giorno e quello per gigabyte di VRAM, consulta il monitoraggio dei prezzi delle schede grafiche per l'IA locale. Il principio da ricordare: su una scheda economica, il sovrapprezzo per la versione da 16 GB è basso rispetto alle possibilità che offre.
#Compatibilità con ROCm, Vulkan e Windows
La RX 9060 XT figura nella matrice di compatibilità ROCm 7.2.1 delle Radeon, per Ubuntu 22.04, 24.04 e 25.10. Ollama la elenca anche tra le schede supportate da ROCm su Linux, con il driver ROCm v7. Su Linux, l'installazione di Ollama con ROCm segue quindi la stessa procedura delle altre Radeon: la guida Ollama con GPU AMD spiega nel dettaglio come procedere.
Su Windows, attenzione. L'elenco delle schede riportato nella documentazione di Ollama per ROCm su Windows si ferma alle RX 7000 e non menziona le RX 9000. Ollama indica inoltre che Vulkan offre un supporto aggiuntivo su Windows e Linux, abilitato per impostazione predefinita. Una RX 9060 XT può quindi funzionare su Windows tramite Vulkan; verifica con ollama ps che il modello sia effettivamente sulla GPU e non sul processore. LM Studio e llama.cpp offrono anche un backend Vulkan.
#Ciò che entra in 8 GB e in 16 GB
I pesi di seguito provengono dal catalogo QuelLLM, in Q4 salvo indicazione contraria. Ai pesi si aggiungono la cache KV, che cresce con il contesto, e un margine di circa un gigabyte per il sistema e i buffer. Un modello i cui soli pesi occupano il 100% della memoria della scheda è quindi troppo grande.
| Modello | Dimensione del modello | 8 GB | 16 GB |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | Al limite, contesto breve | Comodo |
| Qwen 3.5 9B Q8 | 10 GB | No | Comodo |
| Gemma 4 12B Q4 | 7 GB | Troppo stretto | Comodo |
| Gemma 4 12B Q8 | 13 GB | No | Stretto |
| gpt-oss 20B Q4 | 13 GB | No | Sì, contesto moderato |
| Mistral Small 24B Q4 | 14 GB | No | Poco margine, 2 GB per il contesto |
| Qwen 3.8 27B Q4 | 16 GB | No | No, supera la capacità disponibile |
La conclusione pratica si riassume in una frase: la scheda da 16 GB dà accesso alla categoria dei modelli da 12 a 24 miliardi di parametri, in cui si trovano modelli nettamente più capaci nel ragionamento, nella programmazione e in francese. La guida sui 16 GB di VRAM fornisce l’elenco completo, quella sugli 8 GB i trucchi per sfruttare al massimo la memoria.
#Velocità attesa: la banda passante determina il limite massimo
La generazione di testo legge, a ogni token, la maggior parte dei pesi del modello: la velocità massima è quindi la banda passante divisa per la dimensione dei pesi letti. Con 320 GB/s, si ottiene un limite teorico di circa 53 token al secondo per un Qwen 3.5 9B in Q4 (6 GB), 46 per un Gemma 4 12B (7 GB), 23 per un Mistral Small 24B (14 GB), e circa 32 per lo stesso Qwen 3.5 9B in Q8 (10 GB). Questi valori sono limiti teorici, mai raggiunti esattamente; i modelli MoE, che leggono solo i propri pesi attivi, sfuggono in parte a questo vincolo.
L'unico riferimento pubblico comparabile è la tabella della comunità llama.cpp su ROCm: per la RX 9060 XT, un partecipante riporta 1 420 token al secondo nella lettura del prompt e 68 nella generazione con un Llama 2 7B in Q4_0, senza Flash Attention. Questo piccolo modello è molto più leggero di quelli della tabella precedente. Dà un ordine di grandezza, non la velocità di un 12B o di un 24B sulla tua installazione, che varierà in base al driver, al sistema e alla scheda del produttore.
| Modello | Pesi letti per token | Limite teorico |
|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | ≈ 53 token/s |
| Qwen 3.5 9B Q8 | 10 GB | ≈ 32 token/s |
| Gemma 4 12B Q4 | 7 GB | ≈ 46 tokens/s |
| Mistral Small 24B Q4 | 14 GB | ≈ 23 token/s |
#Configurare Ollama per non superare i 16 GB
Con 16 GB, ogni gigabyte di margine conta. Tre impostazioni evitano il passaggio silenzioso di parte del modello al processore, che fa crollare la velocità senza messaggi di errore. La prima è la dimensione del contesto: la documentazione di Ollama indica una finestra predefinita di 4.096 token, modificabile con OLLAMA_CONTEXT_LENGTH; ogni raddoppio del contesto aumenta la cache KV. La seconda è la cache KV stessa, che può essere quantizzata con OLLAMA_KV_CACHE_TYPE (f16 per impostazione predefinita, q8_0 per ridurla) quando Flash Attention è attiva. La terza è il controllo: dopo una risposta, ollama ps mostra la ripartizione tra GPU e processore.
Un esempio di ragionamento: un modello da 14 GB come Mistral Small 24B in Q4 su una scheda da 16 GB lascia circa 2 GB per il contesto, la cache e i buffer. Se ollama ps mostra una ripartizione tra GPU e processore, riduci prima il contesto, poi quantizza la cache KV, poi scendi di un livello di quantizzazione, anziché lasciare che il modello venga caricato in parte nella RAM di sistema. La guida sulla quantizzazione della cache KV illustra in dettaglio la procedura.
#Acquistare, aspettare o puntare a 24 GB
Si presentano tre situazioni. Se hai già un PC desktop recente e un alimentatore da 450 W o più, la 9060 XT da 16 GB è un modo semplice per passare da un uso limitato ai piccoli modelli a un uso serio della chat, della traduzione e della programmazione leggera. Se punti a modelli con 27-35 miliardi di parametri, né i 16 GB né la sua banda passante di 320 GB/s bastano: guarda le schede da 24 GB, consultando anche la guida alla RX 7900 XTX. Se non riesci a decidere in base al prezzo, confronta il costo per gigabyte di VRAM nel monitoraggio dei prezzi del sito: è il criterio giusto per l'IA locale.
#Due RX 9060 XT: 32 GB a un prezzo più basso?
La domanda ricorre nelle ricerche. In llama.cpp, la modalità di ripartizione predefinita suddivide il modello per layer tra le schede, in pipeline, e un'opzione regola la proporzione assegnata a ciascuna scheda. Due 9060 XT da 16 GB offrono complessivamente 32 GB di VRAM per circa 320 W di potenza tipica secondo AMD, il che permette di caricare un Qwen 3.8 27B in Q4 (16 GB di pesi) con molto contesto, oppure un MoE da 30 a 35 miliardi di parametri (da 19 a 21 GB).
Due limiti da conoscere. La velocità per token non raddoppia: le schede lavorano una dopo l'altra su ogni token e ciascuna mantiene la propria banda passante di 320 GB/s. Inoltre, servono una scheda madre con due slot PCIe utilizzabili e un case ventilato. Una singola scheda da 24 GB, come la 7900 XTX, offre 960 GB/s su un solo bus; per un modello che entra nella sua memoria, genera nettamente più velocemente.
#FP8: un vantaggio sulla carta, poche conseguenze con Ollama
Le Radeon RX 9000 appartengono alla generazione RDNA 4, e AMD indica per la 9060 XT una capacità di calcolo FP8 di 205 TFLOPs, che la scheda tecnica della RX 7900 XTX non menziona. Per un uso comune con Ollama o LM Studio, questo punto conta poco: i modelli in formato GGUF sono quantizzati in interi (Q4, Q5, Q8), non in FP8. Diventa utile con motori che sfruttano pesi FP8, come vLLM, la cui documentazione elenca le RX 9000. Non usarlo come argomento d'acquisto se continui a usare Ollama.
#RX 9060 XT o RTX 5060 Ti: il duello a 16 GB
NVIDIA propone la RTX 5060 Ti nelle versioni da 16 GB e da 8 GB, con memoria GDDR7 su un bus da 128 bit, contro la GDDR6 su 128 bit della scheda AMD. La memoria più veloce dà a NVIDIA il vantaggio in termini di banda passante, quindi di velocità di generazione; consulta la scheda tecnica NVIDIA per la banda passante esatta. L'altro vantaggio riguarda il software: CUDA è la piattaforma di riferimento predefinita per la maggior parte dei progetti di IA.
| La tua priorità | Scelta | Motivo |
|---|---|---|
| Velocità massima di generazione, CUDA richiesto | RTX 5060 Ti 16 GB | Memoria GDDR7, ecosistema CUDA |
| Linux, Ollama o llama.cpp, budget contenuto | RX 9060 XT 16 GB | ROCm 7 e Vulkan coprono l'uso comune |
| Windows, nessuna voglia di debuggare | RTX 5060 Ti 16 GB | Driver e strumenti più universali |
| Modelli superiori ai 16 GB | Né l'una né l'altra | Punta a 24 GB: RX 7900 XTX o RTX 3090 |
| Budget molto limitato | RX 9060 XT 8 GB | Da riservare ai modelli da 9 miliardi di parametri |
- Quali LLM per 16 GB di VRAM: la lista completa
- Quali LLM per 8 GB di VRAM: consigli e limiti
- Ollama con GPU AMD (ROCm): installazione passo passo
- LLM su RTX 5060 Ti (8 / 16 GB)
- LLM su RX 7900 XTX (24 GB)
- Prezzi delle schede grafiche per l'IA locale
- Fonte: scheda AMD della RX 9060 XT (16 GB)
- Fonte: documentazione GPU di Ollama
- Fonte: compatibilità ROCm su Radeon
- Fonte: tabella delle prestazioni di llama.cpp su ROCm
#Domande frequenti
RX 9060 XT 8 GB o 16 GB per gli LLM?+
Quanti token al secondo fa una RX 9060 XT?+
La RX 9060 XT funziona con Ollama?+
La RX 9060 XT gestisce il FP8?+
È possibile collegare due RX 9060 XT per ottenere 32 GB?+
Quale alimentatore per una RX 9060 XT?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.