Quale LLM su Radeon RX 7700 XT (12 GB) ?
La Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) è supportata ufficialmente da ROCm e da Ollama, sia su Linux che su Windows. Esegue senza compromessi modelli da 8 a 14 miliardi di parametri in Q4, ma non arriva ai modelli da 20 a 24 miliardi, che richiedono da 13 a 14 GB. Nei tabelloni dei benchmark di llama.cpp non è pubblicato alcun dato di throughput per questa scheda: le sue prestazioni si collocano tra quelle di una RX 6700 XT e quelle di una RX 7800 XT.
Il valore della RX 7700 XT sta soprattutto in ciò che consentono i suoi 12 GB e nella sua posizione nella gamma: più veloce e meglio supportata rispetto alla generazione precedente, ma limitata dalla capacità inferiore alla soglia dei 16 GB che permette di eseguire modelli da 20 a 24B. Ecco gli elementi per decidere se è sufficiente, con misurazioni accompagnate dalle relative fonti e stime chiaramente indicate come tali.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Cosa fa una RX 7700 XT nel 2026
Una RX 7700 XT è adatta a un LLM locale di dimensioni medie: i suoi 12 GB accolgono Llama 3.1 8B, Gemma 4 12B o Phi-4 14B in Q4 con spazio per il contesto. La sua larghezza di banda di 432 GB/s, superiore del 12,5% a quella di una RX 6700 XT, fissa il limite massimo della velocità di generazione: circa 113 token al secondo sul modello di riferimento da 7B delle classifiche, contro 163 per una RX 7800 XT. Ha un vantaggio netto rispetto alla 6700 XT: ROCm e Ollama la elencano ufficialmente, anche su Windows. Il suo difetto è la capacità, che la esclude dai modelli da 20 a 24 miliardi di parametri, per i quali i 16 GB della 7800 XT diventano preziosi.
- Architettura
- RDNA 3, chip Navi 32 composto da chiplet (1 GCD e 3 MCD), lanciato il 6 settembre 2023.
- Calcolo
- 3 456 processori di flusso, 54 unità di calcolo.
- Memoria
- 12 GB GDDR6, bus 192 bit, 432 GB/s.
- Consumo
- 245 W di potenza della scheda.
- Prezzo
- Non indicato qui: consulta /prix-gpu-ia per il prezzo più basso rilevato ogni settimana.
#ROCm, Ollama e Windows: supporto ufficiale
È questo il punto che la distingue dalla generazione precedente. La tabella di compatibilità di AMD elenca la RX 7700 XT come scheda RDNA 3, con target gfx1101, come la RX 7800 XT. La documentazione Ollama la cita tra le schede supportate su Linux e su Windows. Una precisazione incide sulla scelta del sistema: secondo AMD, le Radeon RX 7000 e 9000 sono supportate solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Un'altra distribuzione può funzionare, ma senza garanzie. Vulkan resta la rete di sicurezza: Ollama lo attiva per impostazione predefinita quando il backend è installato.
| Ambiente | Stato | Fonte |
|---|---|---|
| ROCm su Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | Ufficiale, per gfx1101 | Tabella di compatibilità AMD |
| Ollama sotto Linux | Elenco delle schede supportate | Documentazione Ollama, ROCm v7 richiesto |
| Ollama su Windows | Elenco delle schede supportate | Documentazione Ollama, stack ROCm v7 / HIP7 |
| Vulkan (Ollama, llama.cpp) | Alternativa generalista | Attivato per impostazione predefinita in Ollama |
#Ciò che entra in 12 GB di VRAM
Su una scheda da 12 GB, considera circa 11 GB disponibili per il modello e la sua cache KV, se la scheda non gestisce anche lo schermo. I pesi indicati provengono dal catalogo QuelLLM; la cache KV si aggiunge e cresce con la lunghezza della conversazione.
| Modello | Pesi in Q4 | Margine per il contesto | Verdetto |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 GB | Molto comodo |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 GB | Utilizzo agevole, possibilità di un contesto lungo |
| Phi-4 14B | ≈ 9 GB | ≈ 2 GB | Entra in memoria, contesto da limitare |
| gpt-oss 20B | ≈ 13 GB | nessuna | Supera la capacità della VRAM, offload parziale verso il processore |
| Devstral Small 2 24B | ≈ 14 GB | nessuna | Servono almeno 16 GB |
Per andare oltre i 14B senza cambiare scheda, esistono due possibilità: quantizzare la cache KV per recuperare uno o due gigabyte, oppure scegliere un modello a esperti (MoE) in cui solo pochi parametri sono attivi per token. La memoria occupata corrisponde comunque alla dimensione completa del modello, quindi un MoE da 20B non entra più facilmente in 12 GB, ma genera più velocemente se entra in memoria.
- Quale LLM per 12 GB di VRAM, indipendentemente dalla scheda
- Quantizzare la cache KV per recuperare VRAM
- Calcolatore di VRAM per il tuo modello e il tuo contesto
#Velocità: ciò che sappiamo e ciò che stimiamo
Siamo precisi sullo stato delle evidenze: le due discussioni pubbliche del repository llama.cpp, una con Vulkan e l'altra con ROCm, che elencano le schede AMD con lo stesso modello (Llama 2 7B in Q4_0), non contengono alcuna riga relativa alla RX 7700 XT al momento della stesura. Non abbiamo effettuato alcuna misurazione noi stessi. Ciò che possiamo fare è collocarla tra due schede misurate: la RX 6700 XT a 83,88 token al secondo in generazione (banda passante 384 GB/s) e la RX 7800 XT a 118,27 (624 GB/s), entrambe con Vulkan.
Il ragionamento basato sulla banda passante dà un limite massimo: 432 GB/s divisi per 3,82 GB di pesi danno circa 113 token al secondo sul modello di riferimento 7B. Le schede AMD della stessa discussione raggiungono tra il 59% e l'83% di questo limite (83% per la 6700 XT, 72% per la 7800 XT). Su questa base, un valore compreso tra 65 e 95 token al secondo sembra plausibile per la 7700 XT: si tratta di un'ipotesi di lavoro, non di un risultato, da confermare con llama-bench.
| Modello (Q4) | Dimensione del modello | Limite di 432 GB/s | Stima al 60-80 % del limite massimo |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 72 token/s | ≈ 43–58 token/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 62 token/s | ≈ da 37 a 49 token/s |
| Phi-4 14B | ≈ 9 GB | ≈ 48 token/s | ≈ 29–38 token/s |
Per la conversazione, una velocità superiore a una decina di token al secondo permette una lettura agevole; queste stime restano quindi ben al di sopra della soglia necessaria per l'uso, anche con un ampio margine di errore.
#A confronto con le sue concorrenti dirette: 6700 XT, 7800 XT e RTX 4070
Spesso si sceglie tra tre schede simili. Le misurazioni pubblicate con Vulkan aiutano a collocare la RTX 4070, una delle schede da 12 GB della generazione Ada considerate: 92,29 token al secondo in generazione e 3.179 in lettura del prompt. I suoi 12 GB, come quelli della 7700 XT, limitano le due schede agli stessi modelli; la differenza si gioca sull'ecosistema software, sulla lettura del prompt, sull'efficienza energetica e sul prezzo. Le velocità della RX 7700 XT restano da misurare, quelle delle altre tre sono pubblicate.
| Scheda | VRAM | Larghezza di banda | Lettura pp512 | Generazione tg128 |
|---|---|---|---|---|
| RX 6700 XT | 12 GB | 384 GB/s | 1 051,20 t/s | 83,88 t/s |
| RX 7700 XT | 12 GB | 432 GB/s | non pubblicato | non pubblicato |
| RTX 4070 | 12 GB | non citato | 3 179,37 t/s | 92,29 t/s |
| RX 7800 XT | 16 GB | 624 GB/s | 2 017,33 t/s | 118,27 t/s |
Leggi questo tabellone: passare dalla 7700 XT alla 7800 XT non costa solo una velocità maggiore, aggiunge 4 GB di VRAM, cioè l'accesso ai modelli da 20 a 24B. È l'unico criterio che cambia realmente ciò che puoi avviare. Se il tuo uso è un modello da 8B o da 12B, la 7700 XT non è limitante; se miri a modelli di codice da 24B, sì.
- Radeon RX 7800 XT, lo stesso chip con 16 GB
- Radeon RX 6700 XT, la generazione precedente con 12 GB
- RTX 4070: l’alternativa NVIDIA da 12 GB
#Avvio sotto Linux
- 01Verificare il sistemaVerifica che la tua distribuzione sia una tra Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7, le sole versioni elencate da AMD per questa scheda.
- 02Installare il driver ROCmOllama richiede il driver ROCm v7 su Linux. Installalo con l'utilità amdgpu-install descritta nella documentazione AMD.
- 03Installare Ollama, poi un modelloScarica Gemma 4 12B in Q4_K_M o un 8B, poi avvialo con ollama run.
- 04Verificare che la GPU stia lavorandoEsegui ollama ps: la colonna del processore deve indicare l'esecuzione sulla GPU. Se la scheda non viene rilevata, aggiungi l'utente ollama al gruppo render.
- 05Misurare e confrontareAvvia llama-bench con il GGUF della discussione pubblica per confrontare la tua scheda con le misurazioni degli altri e pubblicare la tua.
Su Windows, la documentazione di Ollama prevede uno stack ROCm v7 o HIP7 per le Radeon RX 7000; l'installazione si limita al driver Radeon aggiornato e poi a Ollama. La guida su Ollama e le GPU AMD descrive in dettaglio le variabili d'ambiente utili per selezionare una scheda quando il sistema ne conta più di una.
#Quando 12 GB non sono più sufficienti
La soglia è netta: oltre 11 GB di pesi, il modello non entra più interamente nella VRAM. Ollama e llama.cpp trasferiscono allora parte dei layer sul processore, e la velocità crolla perché la memoria di sistema è molto più lenta della GDDR6. Tre situazioni ricorrono: un modello per il codice da 24B, un contesto lungo su un 14B, o un secondo modello caricato contemporaneamente per il RAG. Ognuna si risolve con più VRAM, non con più potenza di calcolo.
| Il tuo utilizzo | 12 GB sono sufficienti? | Cosa cambia successivamente |
|---|---|---|
| Chat, riassunto, traduzione con un modello da 8B a 12B | Sì | Niente |
| Assistente alla programmazione con un 14B, contesto breve | Sì | Monitorare la cache KV |
| Modello per la programmazione da 24B o gpt-oss 20B | No | Scegliere almeno 16 GB |
| RAG con generazione, embedding e reranker caricati insieme | Esatto | Scegliere 16 GB per evitare continui passaggi avanti e indietro |
| Contesto di 32.000 token o più su un 14B | No | Quantizzare la cache KV o scegliere 16 GB |
Prima di acquistarla usata, verifica tre punti concreti. La potenza della scheda di 245 W richiede un alimentatore adeguato e due connettori di alimentazione PCIe correttamente collegati. Il modello esatto conta poco per gli LLM, dato che la memoria di 12 GB è identica per tutti i produttori; cambia soltanto la qualità del raffreddamento, che conta per lunghe sessioni di generazione. Infine, testa la scheda con un vero modello da 9 a 10 GB prima di confermare l'acquisto: è l'unico test che mette sotto carico gran parte dei 12 GB di memoria e sollecita la rilettura continua dei pesi effettuata da un LLM, un carico del tutto diverso da quello di un videogioco.
#Verdetto 2026
- Se l'hai già
- Tienila: copre tutti i modelli fino a 14B con supporto ufficiale, senza dover ricorrere a soluzioni alternative.
- Se acquisti di seconda mano
- Confronta il prezzo con quello di una RX 7800 XT su /prix-gpu-ia: se la differenza è modesta, i 4 GB in più della 7800 XT valgono la differenza.
- Se punti a modelli da 24B
- Passa direttamente a 16 GB o più: non è la velocità, ma la capacità che limita.
- Prezzi delle schede grafiche per l'IA locale, rilevati due volte a settimana
- Documentazione Ollama : GPU AMD supportati
- Tabella di compatibilità ROCm di AMD
- Classifica Vulkan del repository llama.cpp
#Domande frequenti
La RX 7700 XT è adatta per i LLM locali?+
Quali modelli è possibile eseguire su 12 GB con una RX 7700 XT?+
Quanti token al secondo fa una RX 7700 XT?+
La RX 7700 XT funziona con Ollama su Windows?+
RX 7700 XT o RX 7800 XT per l'IA locale?+
Serve Ubuntu per usare la RX 7700 XT con ROCm?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.