Quale LLM su Radeon RX 6700 XT (12 GB) ?
La RX 6700 XT (12 GB, 384 GB/s) gestisce senza problemi modelli fino a 14B in Q4 (circa 9 GB) e un 12B come Gemma 4 12B con margine per il contesto. Utilizza Vulkan piuttosto che ROCm: non figura né nella lista ufficiale ROCm né in quella di Ollama. Nella generazione, eguaglia o supera una RTX 3060 12 GB; nella lettura del prompt, è quasi due volte più lenta.
Questa scheda del 2021 non è mai stata progettata per l'IA, eppure il software non l'ha dimenticata. Questa guida spiega cosa riesce a eseguire oggi, con quali soluzioni software, a quale velocità secondo misurazioni pubblicate e quando sostituirla diventa più conveniente che ostinarsi a usarla.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Radeon RX 9070 XT 16 GB.
Perché questa scelta? La nostra scheda completa su Radeon RX 9070 XT 16 GB →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#Cosa fa una RX 6700 XT nel 2026
Una Radeon RX 6700 XT funziona molto bene come scheda grafica entry-level per un LLM locale a patto di accettare tre fatti: i suoi 12 GB di memoria accolgono un modello di 14 miliardi di parametri in Q4 (circa 9 GB di pesi) ma non uno da 24B; la soluzione software affidabile per questa scheda è Vulkan, tramite llama.cpp o Ollama, perché AMD non la include nell'elenco delle schede supportate da ROCm; e la sua velocità di generazione, limitata dalla banda passante di 384 GB/s, basta per una conversazione fluida con un modello da 8B a 12B. Su un modello da 7B in Q4_0, una misurazione pubblicata sul repository llama.cpp indica 83,88 token al secondo in generazione con Vulkan, un po' di più della RTX 3060 12 GB misurata nella stessa discussione. Il vero punto debole è la lettura del prompt, due volte più lenta.
- Architettura
- RDNA 2, chip Navi 22, lanciata il 18 marzo 2021 (scheda Wikipedia della serie RX 6000).
- Calcolo
- 2.560 processori di flusso, 40 unità di calcolo
- Memoria
- 12 GB GDDR6, bus 192 bit, 384 GB/s.
- Consumo
- 230 W di potenza della scheda.
- Prezzo
- Non indicato qui: i prezzi dell’usato cambiano ogni settimana; consulta /prix-gpu-ia.
#Ollama, ROCm o Vulkan: il percorso che funziona
L'errore più comune con questa scheda è cercare una guida ROCm. La documentazione di Ollama elenca, per Linux, le Radeon RX dalla 6800 alla 9070 XT: la 6700 XT non compare nell'elenco. Per quanto riguarda ROCm, la tabella di compatibilità di AMD cita, per RDNA 2, soltanto schede professionali come la PRO W6800 o la V620. Ollama amplia questa copertura con Vulkan, attivato per impostazione predefinita quando il backend è installato, ed è questa la strada che rimane disponibile per una 6700 XT. Esiste una soluzione alternativa per ROCm: la variabile HSA_OVERRIDE_GFX_VERSION, che forza un target LLVM simile, ma il suo uso è riservato alla sperimentazione.
| Percorso | Stato di questa scheda | Quando sceglierlo |
|---|---|---|
| Vulkan (Ollama, llama.cpp, LM Studio) | Funziona, con misurazioni pubbliche effettuate con llama.cpp | Predefinito, su Windows come su Linux |
| ROCm ufficiale | Scheda assente dall'elenco ROCm e da quello di Ollama | Da evitare: nessuna garanzia di supporto |
| ROCm forzato (HSA_OVERRIDE_GFX_VERSION) | Soluzione alternativa documentata da Ollama per altre schede | Solo per fare test, senza aspettarsi un miglioramento comprovato |
#Ciò che entra in 12 GB di VRAM
La regola del sito rimane la stessa: il peso del modello in Q4 più la cache KV più un margine per il driver e la gestione dello schermo. Su 12 GB, un budget realistico lascia circa 11 GB al modello e al suo contesto se la scheda non gestisce lo schermo. Le dimensioni qui sotto provengono dal catalogo QuelLLM e dai nostri riferimenti abituali; si riferiscono ai soli pesi.
| Modello | Pesi in Q4 | Memoria restante per il contesto | Verdetto |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5–6 GB | Utilizzo molto agevole, possibilità di un contesto lungo |
| Gemma 4 12B | ≈ 7 GB | ≈ 4–5 GB | Comodo, con un contesto da medio a lungo |
| Phi-4 14B | ≈ 9 GB | ≈ 2–3 GB | Entra in memoria, contesto da limitare |
| gpt-oss 20B | ≈ 13 GB | negativo | Non entra interamente in VRAM: passaggio parziale al processore |
| Devstral Small 2 24B | ≈ 14 GB | negativo | Troppo grande per 12 GB in Q4 |
La cache KV cresce con la lunghezza della conversazione, il che spiega perché un modello 14B «ci sta» sulla carta ma diventa molto lento appena la cronologia si allunga. Il calcolatore di VRAM del sito fornisce il totale esatto per il tuo modello e il tuo contesto, e la guida sulla quantizzazione della cache KV spiega come recuperare uno o due gigabyte. Per tutte le schede da 12 GB, la pagina dedicata confronta i modelli senza limitarsi ad AMD.
- Calcolatore di VRAM per un modello e un contesto dati
- Quale LLM per 12 GB di VRAM, indipendentemente dalla scheda
- Quantizzare la cache KV per risparmiare VRAM
#Velocità misurate e limite della larghezza di banda
Nessun dato di throughput riportato in questa pagina è una misura effettuata dal sito. I numeri provengono dalla discussione pubblica del repository llama.cpp che confronta le schede con Vulkan usando lo stesso modello, Llama 2 7B in Q4_0 (3,56 GiB), e il comando llama-bench. I valori rilevanti sono due: pp512, la velocità di lettura di un prompt di 512 token, e tg128, la velocità di scrittura di 128 token. Per la RX 6700 XT, la discussione riporta 1.051 token al secondo in lettura e 83,88 in generazione; con Flash Attention attivata, 1.011 e 81,86.
Questo risultato si può confrontare con un limite semplice: durante la generazione, ogni token obbliga la scheda a rileggere tutti i pesi, quindi la velocità massima è approssimativamente pari alla larghezza di banda divisa per la dimensione del modello. Qui 384 GB/s divisi per 3,82 GB di pesi danno un limite teorico di 100 token al secondo; la scheda ne raggiunge l'83 %, un buon rendimento, migliore di quello di diverse schede più recenti citate nella stessa discussione.
| Modello (Q4) | Dimensione del modello | Limite teorico di 384 GB/s | Ordine di grandezza realistico (83 %) |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 64 token/s | ≈ 50–55 token/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 55 token/s | ≈ 45 token/s |
| Phi-4 14B | ≈ 9 GB | ≈ 43 token/s | ≈ 35 token/s |
Questi ordini di grandezza presuppongono che l'efficienza misurata sul 7B si ritrovi nei modelli più grandi, il che non è garantito: un driver, una versione di llama.cpp o una quantizzazione diversa può modificare il risultato di diversi punti. Per la lettura dei prompt, tieni presente soltanto il rapporto tra le schede: è questa fase a incidere sull'uso del RAG con documenti lunghi.
#Rispetto alla RTX 3060 12 GB: la generazione vince, il prompt perde
Il confronto abituale vede prevalere la RTX 3060 12 GB grazie a CUDA. Le misurazioni pubblicate con Vulkan ridimensionano questa conclusione automatica. Nella generazione, la RX 6700 XT supera la RTX 3060 in entrambe le modalità; nella lettura del prompt, la RTX 3060 ottiene prestazioni quasi doppie. Le due serie provengono dalla stessa discussione ma da versioni diverse di llama.cpp: interpreta il divario come un ordine di grandezza, non come una classifica definitiva.
| Misurazione | RX 6700 XT | RTX 3060 (12 GB) |
|---|---|---|
| Lettura del prompt (pp512), senza Flash Attention | 1 051,20 t/s | 1 815,70 t/s |
| Generazione (tg128), senza Flash Attention | 83,88 t/s | 75,94 t/s |
| Lettura del prompt (pp512), con Flash Attention | 1 010,90 t/s | 2 012,88 t/s |
| Generazione (tg128), con Flash Attention | 81,86 t/s | 80,59 t/s |
La conseguenza pratica: per conversare con un modello, le due schede si equivalgono; per interrogare un documento lungo, la RTX 3060 è più rapida nel generare la prima parola. CUDA mantiene anche il vantaggio dell'ecosistema, con meno soluzioni alternative da conoscere. A parità di prezzo sul mercato dell'usato, la RTX 3060 da 12 GB resta la scelta prudente, e la 6700 XT è un buon affare solo se è già nel tuo PC o costa nettamente meno.
#Avvio passo passo
- 01Verificare il driver VulkanSu Windows, il driver Radeon include Vulkan e Ollama non richiede ulteriori passaggi. Su Linux, installa i componenti Vulkan di Mesa (RADV) o il driver AMD, come indicato nella documentazione di Ollama.
- 02Installare Ollama o compilare llama.cppOllama attiva per impostazione predefinita Vulkan una volta installato il backend. Con llama.cpp, compila con l'opzione -DGGML_VULKAN=on.
- 03Concedere l'accesso alla scheda sotto LinuxAggiungi l'utente ollama al gruppo render se la scheda non viene rilevata. Per consentire a Ollama di leggere la quantità di VRAM libera, avvialo come root oppure concedigli la capability indicata nel comando qui sotto.
- 04Avviare un primo modelloScarica un modello da 8B o Gemma 4 12B in Q4_K_M, avvialo con il comando ollama run, poi verifica con ollama ps che il modello sia caricato sulla GPU e non sul processore.
- 05Misurare a casa tuaEsegui llama-bench con lo stesso GGUF della discussione pubblica per confrontare la tua scheda con i suoi risultati prima di cercare la causa della lentezza.
Se il throughput sembra basso con RADV, la discussione di llama.cpp suggerisce di avviare con la variabile d'ambiente RADV_PERFTEST=nogttspill, che corregge diversi problemi di prestazioni. Gli altri parametri Vulkan si trovano nel manuale di compilazione dedicato.
#Limiti e quando passare ad altro
Emergono tre limiti. Innanzitutto la memoria: 12 GB escludono i modelli da 20 a 32 miliardi di parametri, una fascia decisiva per la qualità degli assistenti di programmazione e ragionamento. Poi l'elaborazione del prompt, che rende faticose le sessioni con documenti lunghi. Infine il supporto: una scheda non inclusa nell'elenco ufficiale dipende dalla disponibilità a mantenerne il supporto negli aggiornamenti di Vulkan e llama.cpp, senza garanzie a lungo termine.
| Il tuo bisogno | Restare sulla RX 6700 XT? | Possibile alternativa |
|---|---|---|
| Chat quotidiana con un modello da 8B a 12B | Sì | Nessuna |
| Assistente di programmazione locale con un modello da 14B | Sì, contesto breve | Una scheda da 16 GB se il contesto aumenta |
| Modelli da 20 a 30B (gpt-oss 20B, Devstral 24B) | No, memoria insufficiente | Scheda da 16 a 20 GB, pagina dedicata qui sotto |
| RAG su documenti di grandi dimensioni | Possibile, ma lento a produrre la prima parola | Scheda con una migliore elaborazione del prompt |
| Supporto ufficiale garantito | No | Radeon RX 7000 o 9000, RTX |
- Radeon RX 7700 XT, il passaggio a RDNA 3 con 12 GB e supporto ufficiale
- Radeon RX 7800 XT, 16 GB per passare ai modelli da 20 a 24B
#Verdetto 2026
- Ne vale la pena
- Se è già nel tuo computer: è una delle poche schede del 2021 che riesce ancora a eseguire un 14B in Q4 con un rendimento di generazione superiore all'80% del suo limite teorico.
- Compera piuttosto una RTX 3060 12 GB
- Se parti da zero e punti allo stesso budget: lettura del prompt due volte più veloce e nessun espediente software necessario.
- Cambia la scheda
- Non appena vuoi modelli da 20 a 30 miliardi di parametri; i prezzi cambiano ogni settimana e su /prix-gpu-ia trovi il costo per GB di VRAM.
- Prezzi delle schede grafiche per l'IA locale, aggiornati due volte a settimana
- Documentazione Ollama: GPU supportate, ROCm e Vulkan
- Scoreboard Vulkan del repository llama.cpp (Llama 2 7B Q4_0)
- Compatibilità delle GPU con ROCm, documentazione AMD
#Domande frequenti
RX 6700 XT LLM: quali modelli possiamo far girare?+
Una 6700 XT funziona con Ollama?+
ROCm è una soluzione praticabile sulla RX 6700 XT?+
Quanti token al secondo su una RX 6700 XT?+
RX 6700 XT o RTX 3060 12 GB per un LLM?+
Quando si deve abbandonare la RX 6700 XT per l'IA locale?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.