Principiante 11 minRadeon RX 7000

Quale LLM su Radeon RX 7700 XT (12 GB) ?

Risposta diretta

La Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) è supportata ufficialmente da ROCm e da Ollama, sia su Linux che su Windows. Esegue senza compromessi modelli da 8 a 14 miliardi di parametri in Q4, ma non arriva ai modelli da 20 a 24 miliardi, che richiedono da 13 a 14 GB. Nei tabelloni dei benchmark di llama.cpp non è pubblicato alcun dato di throughput per questa scheda: le sue prestazioni si collocano tra quelle di una RX 6700 XT e quelle di una RX 7800 XT.

Il valore della RX 7700 XT sta soprattutto in ciò che consentono i suoi 12 GB e nella sua posizione nella gamma: più veloce e meglio supportata rispetto alla generazione precedente, ma limitata dalla capacità inferiore alla soglia dei 16 GB che permette di eseguire modelli da 20 a 24B. Ecco gli elementi per decidere se è sufficiente, con misurazioni accompagnate dalle relative fonti e stime chiaramente indicate come tali.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Cosa fa una RX 7700 XT nel 2026

Una RX 7700 XT è adatta a un LLM locale di dimensioni medie: i suoi 12 GB accolgono Llama 3.1 8B, Gemma 4 12B o Phi-4 14B in Q4 con spazio per il contesto. La sua larghezza di banda di 432 GB/s, superiore del 12,5% a quella di una RX 6700 XT, fissa il limite massimo della velocità di generazione: circa 113 token al secondo sul modello di riferimento da 7B delle classifiche, contro 163 per una RX 7800 XT. Ha un vantaggio netto rispetto alla 6700 XT: ROCm e Ollama la elencano ufficialmente, anche su Windows. Il suo difetto è la capacità, che la esclude dai modelli da 20 a 24 miliardi di parametri, per i quali i 16 GB della 7800 XT diventano preziosi.

Architettura
RDNA 3, chip Navi 32 composto da chiplet (1 GCD e 3 MCD), lanciato il 6 settembre 2023.
Calcolo
3 456 processori di flusso, 54 unità di calcolo.
Memoria
12 GB GDDR6, bus 192 bit, 432 GB/s.
Consumo
245 W di potenza della scheda.
Prezzo
Non indicato qui: consulta /prix-gpu-ia per il prezzo più basso rilevato ogni settimana.

#ROCm, Ollama e Windows: supporto ufficiale

È questo il punto che la distingue dalla generazione precedente. La tabella di compatibilità di AMD elenca la RX 7700 XT come scheda RDNA 3, con target gfx1101, come la RX 7800 XT. La documentazione Ollama la cita tra le schede supportate su Linux e su Windows. Una precisazione incide sulla scelta del sistema: secondo AMD, le Radeon RX 7000 e 9000 sono supportate solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Un'altra distribuzione può funzionare, ma senza garanzie. Vulkan resta la rete di sicurezza: Ollama lo attiva per impostazione predefinita quando il backend è installato.

Supporto per la RX 7700 XT
AmbienteStatoFonte
ROCm su Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)Ufficiale, per gfx1101Tabella di compatibilità AMD
Ollama sotto LinuxElenco delle schede supportateDocumentazione Ollama, ROCm v7 richiesto
Ollama su WindowsElenco delle schede supportateDocumentazione Ollama, stack ROCm v7 / HIP7
Vulkan (Ollama, llama.cpp)Alternativa generalistaAttivato per impostazione predefinita in Ollama

#Ciò che entra in 12 GB di VRAM

Su una scheda da 12 GB, considera circa 11 GB disponibili per il modello e la sua cache KV, se la scheda non gestisce anche lo schermo. I pesi indicati provengono dal catalogo QuelLLM; la cache KV si aggiunge e cresce con la lunghezza della conversazione.

Cosa può ospitare una 7700 XT (Q4, solo pesi)
ModelloPesi in Q4Margine per il contestoVerdetto
Llama 3.1 8B≈ 6 GB≈ 5 GBMolto comodo
Gemma 4 12B≈ 7 GB≈ 4 GBUtilizzo agevole, possibilità di un contesto lungo
Phi-4 14B≈ 9 GB≈ 2 GBEntra in memoria, contesto da limitare
gpt-oss 20B≈ 13 GBnessunaSupera la capacità della VRAM, offload parziale verso il processore
Devstral Small 2 24B≈ 14 GBnessunaServono almeno 16 GB

Per andare oltre i 14B senza cambiare scheda, esistono due possibilità: quantizzare la cache KV per recuperare uno o due gigabyte, oppure scegliere un modello a esperti (MoE) in cui solo pochi parametri sono attivi per token. La memoria occupata corrisponde comunque alla dimensione completa del modello, quindi un MoE da 20B non entra più facilmente in 12 GB, ma genera più velocemente se entra in memoria.

#Velocità: ciò che sappiamo e ciò che stimiamo

Siamo precisi sullo stato delle evidenze: le due discussioni pubbliche del repository llama.cpp, una con Vulkan e l'altra con ROCm, che elencano le schede AMD con lo stesso modello (Llama 2 7B in Q4_0), non contengono alcuna riga relativa alla RX 7700 XT al momento della stesura. Non abbiamo effettuato alcuna misurazione noi stessi. Ciò che possiamo fare è collocarla tra due schede misurate: la RX 6700 XT a 83,88 token al secondo in generazione (banda passante 384 GB/s) e la RX 7800 XT a 118,27 (624 GB/s), entrambe con Vulkan.

Il ragionamento basato sulla banda passante dà un limite massimo: 432 GB/s divisi per 3,82 GB di pesi danno circa 113 token al secondo sul modello di riferimento 7B. Le schede AMD della stessa discussione raggiungono tra il 59% e l'83% di questo limite (83% per la 6700 XT, 72% per la 7800 XT). Su questa base, un valore compreso tra 65 e 95 token al secondo sembra plausibile per la 7700 XT: si tratta di un'ipotesi di lavoro, non di un risultato, da confermare con llama-bench.

Limite teorico per modello su una 7700 XT (calcolo)
Modello (Q4)Dimensione del modelloLimite di 432 GB/sStima al 60-80 % del limite massimo
Llama 3.1 8B≈ 6 GB≈ 72 token/s≈ 43–58 token/s
Gemma 4 12B≈ 7 GB≈ 62 token/s≈ da 37 a 49 token/s
Phi-4 14B≈ 9 GB≈ 48 token/s≈ 29–38 token/s

Per la conversazione, una velocità superiore a una decina di token al secondo permette una lettura agevole; queste stime restano quindi ben al di sopra della soglia necessaria per l'uso, anche con un ampio margine di errore.

#A confronto con le sue concorrenti dirette: 6700 XT, 7800 XT e RTX 4070

Spesso si sceglie tra tre schede simili. Le misurazioni pubblicate con Vulkan aiutano a collocare la RTX 4070, una delle schede da 12 GB della generazione Ada considerate: 92,29 token al secondo in generazione e 3.179 in lettura del prompt. I suoi 12 GB, come quelli della 7700 XT, limitano le due schede agli stessi modelli; la differenza si gioca sull'ecosistema software, sulla lettura del prompt, sull'efficienza energetica e sul prezzo. Le velocità della RX 7700 XT restano da misurare, quelle delle altre tre sono pubblicate.

7700 XT e schede simili (Llama 2 7B Q4_0, Vulkan, senza Flash Attention)
SchedaVRAMLarghezza di bandaLettura pp512Generazione tg128
RX 6700 XT12 GB384 GB/s1 051,20 t/s83,88 t/s
RX 7700 XT12 GB432 GB/snon pubblicatonon pubblicato
RTX 407012 GBnon citato3 179,37 t/s92,29 t/s
RX 7800 XT16 GB624 GB/s2 017,33 t/s118,27 t/s

Leggi questo tabellone: passare dalla 7700 XT alla 7800 XT non costa solo una velocità maggiore, aggiunge 4 GB di VRAM, cioè l'accesso ai modelli da 20 a 24B. È l'unico criterio che cambia realmente ciò che puoi avviare. Se il tuo uso è un modello da 8B o da 12B, la 7700 XT non è limitante; se miri a modelli di codice da 24B, sì.

#Avvio sotto Linux

  1. 01
    Verificare il sistema
    Verifica che la tua distribuzione sia una tra Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7, le sole versioni elencate da AMD per questa scheda.
  2. 02
    Installare il driver ROCm
    Ollama richiede il driver ROCm v7 su Linux. Installalo con l'utilità amdgpu-install descritta nella documentazione AMD.
  3. 03
    Installare Ollama, poi un modello
    Scarica Gemma 4 12B in Q4_K_M o un 8B, poi avvialo con ollama run.
  4. 04
    Verificare che la GPU stia lavorando
    Esegui ollama ps: la colonna del processore deve indicare l'esecuzione sulla GPU. Se la scheda non viene rilevata, aggiungi l'utente ollama al gruppo render.
  5. 05
    Misurare e confrontare
    Avvia llama-bench con il GGUF della discussione pubblica per confrontare la tua scheda con le misurazioni degli altri e pubblicare la tua.
Terminale
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Su Windows, la documentazione di Ollama prevede uno stack ROCm v7 o HIP7 per le Radeon RX 7000; l'installazione si limita al driver Radeon aggiornato e poi a Ollama. La guida su Ollama e le GPU AMD descrive in dettaglio le variabili d'ambiente utili per selezionare una scheda quando il sistema ne conta più di una.

#Quando 12 GB non sono più sufficienti

La soglia è netta: oltre 11 GB di pesi, il modello non entra più interamente nella VRAM. Ollama e llama.cpp trasferiscono allora parte dei layer sul processore, e la velocità crolla perché la memoria di sistema è molto più lenta della GDDR6. Tre situazioni ricorrono: un modello per il codice da 24B, un contesto lungo su un 14B, o un secondo modello caricato contemporaneamente per il RAG. Ognuna si risolve con più VRAM, non con più potenza di calcolo.

Conviene restare a 12 GB?
Il tuo utilizzo12 GB sono sufficienti?Cosa cambia successivamente
Chat, riassunto, traduzione con un modello da 8B a 12BSìNiente
Assistente alla programmazione con un 14B, contesto breveSìMonitorare la cache KV
Modello per la programmazione da 24B o gpt-oss 20BNoScegliere almeno 16 GB
RAG con generazione, embedding e reranker caricati insiemeEsattoScegliere 16 GB per evitare continui passaggi avanti e indietro
Contesto di 32.000 token o più su un 14BNoQuantizzare la cache KV o scegliere 16 GB

Prima di acquistarla usata, verifica tre punti concreti. La potenza della scheda di 245 W richiede un alimentatore adeguato e due connettori di alimentazione PCIe correttamente collegati. Il modello esatto conta poco per gli LLM, dato che la memoria di 12 GB è identica per tutti i produttori; cambia soltanto la qualità del raffreddamento, che conta per lunghe sessioni di generazione. Infine, testa la scheda con un vero modello da 9 a 10 GB prima di confermare l'acquisto: è l'unico test che mette sotto carico gran parte dei 12 GB di memoria e sollecita la rilettura continua dei pesi effettuata da un LLM, un carico del tutto diverso da quello di un videogioco.

#Verdetto 2026

Se l'hai già
Tienila: copre tutti i modelli fino a 14B con supporto ufficiale, senza dover ricorrere a soluzioni alternative.
Se acquisti di seconda mano
Confronta il prezzo con quello di una RX 7800 XT su /prix-gpu-ia: se la differenza è modesta, i 4 GB in più della 7800 XT valgono la differenza.
Se punti a modelli da 24B
Passa direttamente a 16 GB o più: non è la velocità, ma la capacità che limita.

#Domande frequenti

FAQ
La RX 7700 XT è adatta per i LLM locali?+
Sì per i modelli da 8 a 14 miliardi di parametri in Q4, con supporto ufficiale da parte di ROCm e Ollama. I suoi 12 GB la limitano a modelli più piccoli di quelli da 20 a 24B: è questo il suo principale difetto rispetto alla RX 7800 XT e ai suoi 16 GB.
Quali modelli è possibile eseguire su 12 GB con una RX 7700 XT?+
Llama 3.1 8B, Gemma 4 12B e Phi-4 14B in Q4, con pesi che occupano da 6 a 9 GB e spazio disponibile per il contesto. Un modello da 20 a 24B occupa da 13 a 14 GB in Q4: supera la capacità della memoria video e viene eseguito in parte sul processore, con un notevole calo di velocità.
Quanti token al secondo fa una RX 7700 XT?+
Nessuna misura pubblicata nelle discussioni del repository llama.cpp. Il calcolo dà un limite massimo di circa 113 token al secondo su un modello 7B in Q4_0, e sulle schede AMD simili si osserva abitualmente dal 59 all'83% di questo limite. Misura tu stesso le prestazioni della scheda con llama-bench prima di fornire una cifra.
La RX 7700 XT funziona con Ollama su Windows?+
Sì: la documentazione di Ollama la elenca tra le Radeon RX supportate su Windows e richiede uno stack ROCm v7 o HIP7. Su Linux è anch'essa elencata, con il driver ROCm v7. Vulkan, attivato per impostazione predefinita in Ollama, funge da soluzione di ripiego se il rilevamento fallisce.
RX 7700 XT o RX 7800 XT per l'IA locale?+
La 7800 XT se si mira a modelli da 20 a 24B, grazie ai suoi 16 GB e alla sua banda passante di 624 GB/s contro i 432 GB/s. La 7700 XT basta se l'uso rimane tra 8 e 14 miliardi di parametri. Confronta i prezzi attuali prima di decidere.
Serve Ubuntu per usare la RX 7700 XT con ROCm?+
AMD supporta ufficialmente le Radeon RX 7000 solo su Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 e RHEL 9.7. Una distribuzione diversa può funzionare, ma senza supporto garantito. Su Windows, Ollama si basa su uno stack ROCm v7 o HIP7; Vulkan rimane possibile ovunque.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.