Principiante 11 minRadeon RX 6000

Quale LLM su Radeon RX 6700 XT (12 GB) ?

Risposta diretta

La RX 6700 XT (12 GB, 384 GB/s) gestisce senza problemi modelli fino a 14B in Q4 (circa 9 GB) e un 12B come Gemma 4 12B con margine per il contesto. Utilizza Vulkan piuttosto che ROCm: non figura né nella lista ufficiale ROCm né in quella di Ollama. Nella generazione, eguaglia o supera una RTX 3060 12 GB; nella lettura del prompt, è quasi due volte più lenta.

Questa scheda del 2021 non è mai stata progettata per l'IA, eppure il software non l'ha dimenticata. Questa guida spiega cosa riesce a eseguire oggi, con quali soluzioni software, a quale velocità secondo misurazioni pubblicate e quando sostituirla diventa più conveniente che ostinarsi a usarla.

Stai scegliendo un computer? Le nostre scelte per budget →

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux
Hardware consigliato

Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.

Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →

Confronta tutte le opzioni per budget, da 800 a 3 500 € →

In mobilità: quale portatile per l'IA locale →

Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.

#Cosa fa una RX 6700 XT nel 2026

Una Radeon RX 6700 XT funziona molto bene come scheda grafica entry-level per un LLM locale a patto di accettare tre fatti: i suoi 12 GB di memoria accolgono un modello di 14 miliardi di parametri in Q4 (circa 9 GB di pesi) ma non uno da 24B; la soluzione software affidabile per questa scheda è Vulkan, tramite llama.cpp o Ollama, perché AMD non la include nell'elenco delle schede supportate da ROCm; e la sua velocità di generazione, limitata dalla banda passante di 384 GB/s, basta per una conversazione fluida con un modello da 8B a 12B. Su un modello da 7B in Q4_0, una misurazione pubblicata sul repository llama.cpp indica 83,88 token al secondo in generazione con Vulkan, un po' di più della RTX 3060 12 GB misurata nella stessa discussione. Il vero punto debole è la lettura del prompt, due volte più lenta.

Architettura
RDNA 2, chip Navi 22, lanciata il 18 marzo 2021 (scheda Wikipedia della serie RX 6000).
Calcolo
2.560 processori di flusso, 40 unità di calcolo
Memoria
12 GB GDDR6, bus 192 bit, 384 GB/s.
Consumo
230 W di potenza della scheda.
Prezzo
Non indicato qui: i prezzi dell’usato cambiano ogni settimana; consulta /prix-gpu-ia.

#Ollama, ROCm o Vulkan: il percorso che funziona

L'errore più comune con questa scheda è cercare una guida ROCm. La documentazione di Ollama elenca, per Linux, le Radeon RX dalla 6800 alla 9070 XT: la 6700 XT non compare nell'elenco. Per quanto riguarda ROCm, la tabella di compatibilità di AMD cita, per RDNA 2, soltanto schede professionali come la PRO W6800 o la V620. Ollama amplia questa copertura con Vulkan, attivato per impostazione predefinita quando il backend è installato, ed è questa la strada che rimane disponibile per una 6700 XT. Esiste una soluzione alternativa per ROCm: la variabile HSA_OVERRIDE_GFX_VERSION, che forza un target LLVM simile, ma il suo uso è riservato alla sperimentazione.

Tre opzioni software per una RX 6700 XT
PercorsoStato di questa schedaQuando sceglierlo
Vulkan (Ollama, llama.cpp, LM Studio)Funziona, con misurazioni pubbliche effettuate con llama.cppPredefinito, su Windows come su Linux
ROCm ufficialeScheda assente dall'elenco ROCm e da quello di OllamaDa evitare: nessuna garanzia di supporto
ROCm forzato (HSA_OVERRIDE_GFX_VERSION)Soluzione alternativa documentata da Ollama per altre schedeSolo per fare test, senza aspettarsi un miglioramento comprovato
!
Non contare su ROCm per questa scheda
Ollama scrive che ROCm non supporta tutte le schede AMD e propone la variabile HSA_OVERRIDE_GFX_VERSION come soluzione alternativa in caso di problemi. Per la 6700 XT, nessuna fonte mostra un vantaggio rispetto a Vulkan, i cui risultati sono pubblicati. Verifica il target della tua GPU con il comando rocminfo prima di qualsiasi tentativo.

#Ciò che entra in 12 GB di VRAM

La regola del sito rimane la stessa: il peso del modello in Q4 più la cache KV più un margine per il driver e la gestione dello schermo. Su 12 GB, un budget realistico lascia circa 11 GB al modello e al suo contesto se la scheda non gestisce lo schermo. Le dimensioni qui sotto provengono dal catalogo QuelLLM e dai nostri riferimenti abituali; si riferiscono ai soli pesi.

Cosa può ospitare una scheda da 12 GB (Q4, solo pesi)
ModelloPesi in Q4Memoria restante per il contestoVerdetto
Llama 3.1 8B≈ 6 GB≈ 5–6 GBUtilizzo molto agevole, possibilità di un contesto lungo
Gemma 4 12B≈ 7 GB≈ 4–5 GBComodo, con un contesto da medio a lungo
Phi-4 14B≈ 9 GB≈ 2–3 GBEntra in memoria, contesto da limitare
gpt-oss 20B≈ 13 GBnegativoNon entra interamente in VRAM: passaggio parziale al processore
Devstral Small 2 24B≈ 14 GBnegativoTroppo grande per 12 GB in Q4

La cache KV cresce con la lunghezza della conversazione, il che spiega perché un modello 14B «ci sta» sulla carta ma diventa molto lento appena la cronologia si allunga. Il calcolatore di VRAM del sito fornisce il totale esatto per il tuo modello e il tuo contesto, e la guida sulla quantizzazione della cache KV spiega come recuperare uno o due gigabyte. Per tutte le schede da 12 GB, la pagina dedicata confronta i modelli senza limitarsi ad AMD.

#Velocità misurate e limite della larghezza di banda

Nessun dato di throughput riportato in questa pagina è una misura effettuata dal sito. I numeri provengono dalla discussione pubblica del repository llama.cpp che confronta le schede con Vulkan usando lo stesso modello, Llama 2 7B in Q4_0 (3,56 GiB), e il comando llama-bench. I valori rilevanti sono due: pp512, la velocità di lettura di un prompt di 512 token, e tg128, la velocità di scrittura di 128 token. Per la RX 6700 XT, la discussione riporta 1.051 token al secondo in lettura e 83,88 in generazione; con Flash Attention attivata, 1.011 e 81,86.

Questo risultato si può confrontare con un limite semplice: durante la generazione, ogni token obbliga la scheda a rileggere tutti i pesi, quindi la velocità massima è approssimativamente pari alla larghezza di banda divisa per la dimensione del modello. Qui 384 GB/s divisi per 3,82 GB di pesi danno un limite teorico di 100 token al secondo; la scheda ne raggiunge l'83 %, un buon rendimento, migliore di quello di diverse schede più recenti citate nella stessa discussione.

Stima per modelli comuni (calcolo, non misurazione)
Modello (Q4)Dimensione del modelloLimite teorico di 384 GB/sOrdine di grandezza realistico (83 %)
Llama 3.1 8B≈ 6 GB≈ 64 token/s≈ 50–55 token/s
Gemma 4 12B≈ 7 GB≈ 55 token/s≈ 45 token/s
Phi-4 14B≈ 9 GB≈ 43 token/s≈ 35 token/s

Questi ordini di grandezza presuppongono che l'efficienza misurata sul 7B si ritrovi nei modelli più grandi, il che non è garantito: un driver, una versione di llama.cpp o una quantizzazione diversa può modificare il risultato di diversi punti. Per la lettura dei prompt, tieni presente soltanto il rapporto tra le schede: è questa fase a incidere sull'uso del RAG con documenti lunghi.

#Rispetto alla RTX 3060 12 GB: la generazione vince, il prompt perde

Il confronto abituale vede prevalere la RTX 3060 12 GB grazie a CUDA. Le misurazioni pubblicate con Vulkan ridimensionano questa conclusione automatica. Nella generazione, la RX 6700 XT supera la RTX 3060 in entrambe le modalità; nella lettura del prompt, la RTX 3060 ottiene prestazioni quasi doppie. Le due serie provengono dalla stessa discussione ma da versioni diverse di llama.cpp: interpreta il divario come un ordine di grandezza, non come una classifica definitiva.

RX 6700 XT e RTX 3060 su Vulkan (Llama 2 7B Q4_0, discussione llama.cpp)
MisurazioneRX 6700 XTRTX 3060 (12 GB)
Lettura del prompt (pp512), senza Flash Attention1 051,20 t/s1 815,70 t/s
Generazione (tg128), senza Flash Attention83,88 t/s75,94 t/s
Lettura del prompt (pp512), con Flash Attention1 010,90 t/s2 012,88 t/s
Generazione (tg128), con Flash Attention81,86 t/s80,59 t/s

La conseguenza pratica: per conversare con un modello, le due schede si equivalgono; per interrogare un documento lungo, la RTX 3060 è più rapida nel generare la prima parola. CUDA mantiene anche il vantaggio dell'ecosistema, con meno soluzioni alternative da conoscere. A parità di prezzo sul mercato dell'usato, la RTX 3060 da 12 GB resta la scelta prudente, e la 6700 XT è un buon affare solo se è già nel tuo PC o costa nettamente meno.

#Avvio passo passo

  1. 01
    Verificare il driver Vulkan
    Su Windows, il driver Radeon include Vulkan e Ollama non richiede ulteriori passaggi. Su Linux, installa i componenti Vulkan di Mesa (RADV) o il driver AMD, come indicato nella documentazione di Ollama.
  2. 02
    Installare Ollama o compilare llama.cpp
    Ollama attiva per impostazione predefinita Vulkan una volta installato il backend. Con llama.cpp, compila con l'opzione -DGGML_VULKAN=on.
  3. 03
    Concedere l'accesso alla scheda sotto Linux
    Aggiungi l'utente ollama al gruppo render se la scheda non viene rilevata. Per consentire a Ollama di leggere la quantità di VRAM libera, avvialo come root oppure concedigli la capability indicata nel comando qui sotto.
  4. 04
    Avviare un primo modello
    Scarica un modello da 8B o Gemma 4 12B in Q4_K_M, avvialo con il comando ollama run, poi verifica con ollama ps che il modello sia caricato sulla GPU e non sul processore.
  5. 05
    Misurare a casa tua
    Esegui llama-bench con lo stesso GGUF della discussione pubblica per confrontare la tua scheda con i suoi risultati prima di cercare la causa della lentezza.
Terminale
sudo setcap cap_perfmon+ep /usr/local/bin/ollama
# llama.cpp avec Vulkan
cmake .. -DGGML_VULKAN=on -DCMAKE_BUILD_TYPE=Release
./bin/llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Se il throughput sembra basso con RADV, la discussione di llama.cpp suggerisce di avviare con la variabile d'ambiente RADV_PERFTEST=nogttspill, che corregge diversi problemi di prestazioni. Gli altri parametri Vulkan si trovano nel manuale di compilazione dedicato.

#Limiti e quando passare ad altro

Emergono tre limiti. Innanzitutto la memoria: 12 GB escludono i modelli da 20 a 32 miliardi di parametri, una fascia decisiva per la qualità degli assistenti di programmazione e ragionamento. Poi l'elaborazione del prompt, che rende faticose le sessioni con documenti lunghi. Infine il supporto: una scheda non inclusa nell'elenco ufficiale dipende dalla disponibilità a mantenerne il supporto negli aggiornamenti di Vulkan e llama.cpp, senza garanzie a lungo termine.

Quando restare, quando cambiare
Il tuo bisognoRestare sulla RX 6700 XT?Possibile alternativa
Chat quotidiana con un modello da 8B a 12BSìNessuna
Assistente di programmazione locale con un modello da 14BSì, contesto breveUna scheda da 16 GB se il contesto aumenta
Modelli da 20 a 30B (gpt-oss 20B, Devstral 24B)No, memoria insufficienteScheda da 16 a 20 GB, pagina dedicata qui sotto
RAG su documenti di grandi dimensioniPossibile, ma lento a produrre la prima parolaScheda con una migliore elaborazione del prompt
Supporto ufficiale garantitoNoRadeon RX 7000 o 9000, RTX

#Verdetto 2026

Ne vale la pena
Se è già nel tuo computer: è una delle poche schede del 2021 che riesce ancora a eseguire un 14B in Q4 con un rendimento di generazione superiore all'80% del suo limite teorico.
Compera piuttosto una RTX 3060 12 GB
Se parti da zero e punti allo stesso budget: lettura del prompt due volte più veloce e nessun espediente software necessario.
Cambia la scheda
Non appena vuoi modelli da 20 a 30 miliardi di parametri; i prezzi cambiano ogni settimana e su /prix-gpu-ia trovi il costo per GB di VRAM.

#Domande frequenti

FAQ
RX 6700 XT LLM: quali modelli possiamo far girare?+
I modelli fino a 14 miliardi di parametri in Q4, cioè circa 9 GB per i pesi, più la memoria per il contesto: Llama 3.1 8B, Gemma 4 12B, Phi-4 14B. Un modello da 20B come gpt-oss (circa 13 GB) o da 24B supera i 12 GB e passa in parte al processore, con una netta diminuzione della velocità.
Una 6700 XT funziona con Ollama?+
Sì, tramite Vulkan. Ollama non la menziona nella sua lista ROCm, che inizia con la RX 6800 su Linux, ma attiva Vulkan per impostazione predefinita quando il backend è installato. Verifica con il comando ollama ps che il modello sia effettivamente caricato sulla GPU.
ROCm è una soluzione praticabile sulla RX 6700 XT?+
Non ufficialmente: la scheda non compare né nella tabella di compatibilità ROCm di AMD, che per RDNA 2 cita solo schede professionali, né nell'elenco di Ollama. Esiste una soluzione alternativa tramite la variabile HSA_OVERRIDE_GFX_VERSION, ma resta sperimentale e nessuna misurazione pubblica mostra un vantaggio rispetto a Vulkan, i cui risultati sono pubblicati.
Quanti token al secondo su una RX 6700 XT?+
Su Llama 2 7B in Q4_0, la discussione pubblica nel repository llama.cpp riporta 83,88 token al secondo in generazione con Vulkan. Per Gemma 4 12B in Q4, il rapporto tra banda passante e peso del modello suggerisce circa 45 token al secondo: una stima calcolata, da verificare sul tuo sistema con llama-bench prima di citarla.
RX 6700 XT o RTX 3060 12 GB per un LLM?+
In generazione, le due schede si equivalgono; nei test pubblicati con Vulkan la Radeon è persino leggermente avanti. Nella lettura del prompt, la RTX 3060 è quasi due volte più veloce e CUDA evita soluzioni alternative. A parità di prezzo sul mercato dell’usato, la RTX 3060 da 12 GB resta la scelta più semplice.
Quando si deve abbandonare la RX 6700 XT per l'IA locale?+
Quando vuoi modelli da 20 a 32 miliardi di parametri, che non entrano in 12 GB, o quando la lentezza nell'elaborazione dei prompt lunghi ostacola il tuo utilizzo. Una scheda da 16 a 20 GB, come le Radeon RX 7800 XT o 7900 XT, è allora il passo successivo logico.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.