Quale LLM eseguire su una scheda AMD Radeon 6700XT?
La ricerca «6700xt llm» ricorre spesso tra chi possiede una scheda della generazione RDNA 2 e vuole un modello locale senza acquistare una nuova GPU. Buone notizie per l'abbinamento 6700xt llm: i 12 GB di GDDR6 di questa scheda bastano per modelli da 7 a 14 miliardi di parametri con quantizzazione a 4 bit, con una velocità adeguata per la chat, la programmazione e il riassunto di documenti. Il vincolo principale non è la potenza di calcolo, ma la memoria video, e il secondo ostacolo è software: la RX 6700 XT non è ufficialmente supportata da ROCm, il che richiede una modifica alla configurazione oppure l'uso del backend Vulkan. Questo articolo descrive in dettaglio le specifiche utili, la VRAM per quantizzazione, le velocità realistiche e le licenze, poi risponde alle domande frequenti prima di indirizzarti al configuratore.
La RX 6700 XT e l'inferenza locale
Sulla carta, la Radeon RX 6700 XT è una scheda da gaming del 2021. Per un LLM, contano davvero tre numeri.
- VRAM : 12 GB di GDDR6, bus da 192 bit.
- Banda passante della memoria : 384 GB/s. È questo valore che limita la velocità in token/sec, poiché ogni token generato rilegge tutti i pesi attivi.
- Architettura : RDNA 2, identificativo
gfx1031, 40 unità di calcolo, senza core matriciali dedicati.
A titolo di confronto, una scheda da 16 GB come quella descritta nel guida LLM Radeon RX 6800 XT permette di eseguire modelli 24B in Q4, e una da 24 GB come la RX 7900 XTX raggiunge i 32B. La 6700 XT resta nella classe dei 12 GB, come la RTX 3060 12 GB dal lato NVIDIA. Il guida dedicata alla RX 6700 XT e la selezione migliore LLM per Radeon RX 6700 XT elencano i modelli del catalogo che rientrano in questo limite di memoria.
VRAM utilizzata per livello di quantizzazione: Q4, Q5, Q8, FP16
La regola di calcolo è semplice: numero di parametri × byte per parametro, più la cache KV che cresce con la lunghezza del contesto. Gli ordini di grandezza qui sotto presuppongono un contesto di 8.192 token e una cache KV a 8 bit; sono stimati a partire dai file GGUF comuni.
- Modello da 7 a 8B : Q4 ≈ 5 GB, Q5 ≈ 6 GB, Q8 ≈ 9 GB, FP16 ≈ 16 GB. Tutte le versioni fino a Q8 incluso rientrano nei 12 GB, FP16 escluso.
- Modello da 12 a 14B : Q4 ≈ da 8 a 9 GB, Q5 ≈ 10 GB, Q8 ≈ 15 GB. Q4 e Q5 rientrano nella VRAM disponibile, Q8 richiede anche la RAM di sistema.
- Modello da 24 a 27B : Q4 ≈ da 15 a 17 GB. Non entra interamente in memoria; un Q3 da 12 GB è possibile ma degrada la qualità.
- Modello MoE 30B con 3B attivi : Q4 ≈ 18 GB di pesi, ma solo gli esperti attivi vengono letti a ogni token. Con gli esperti trasferiti sulla CPU, il throughput rimane utilizzabile.
Il punto di svolta è netto: oltre i 12 GB, llama.cpp e Ollama trasferiscono i livelli rimanenti sul processore e il throughput cala di un fattore da 5 a 10. La guida « quale LLM per 12 GB di VRAM » descrive nel dettaglio le combinazioni dimensione × quantizzazione × contesto che restano al 100% sulla GPU.
Cosa non riuscirà a eseguire il top del catalogo
Una parte del catalogo quelllm.fr è fuori dalla portata di una 6700 XT, ed è meglio dirlo chiaramente piuttosto che far sperare in un miracolo software.
- DeepSeek R1 671B : circa 400 GB in Q4, licenza MIT. Impossibile farlo girare in locale su un PC di fascia consumer, qualunque sia la scheda.
- Qwen 3 235B-A22B : ~142 GB in Q4, Apache 2.0. Fuori portata anche con 128 GB di RAM.
- DeepSeek V4 Flash 284B : ~170 GB in Q4, MIT. Riservato ai server multi-GPU o ai Mac di fascia alta con memoria unificata.
- GLM 5.3 Flash 320B-A18B : ~186 GB in Q4, MIT. Stesso giudizio.
Il caso limite interessante è quello dei modelli MoE di circa 120B con pochi parametri attivi. Qwen 3.5 122B-A10B pesa circa 73 GB in Q4 sotto licenza Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 GB con soli 6B attivi, e Mistral Small 4 ~72 GB sotto licenza Apache 2.0. Con 64 GB di RAM di sistema e i 12 GB della scheda, llama.cpp può caricare questi modelli trasferendo gli esperti sulla CPU. Il throughput ottenuto è di pochi token al secondo, stimato tra 3 e 8 a seconda della RAM e della CPU, da confermare sulla tua configurazione. È utilizzabile per elaborazioni in batch durante la notte, non per una chat interattiva. I pesi sono pubblicati su la pagina Alibaba su Hugging Face et la pagina Mistral su Hugging Face.
Tokens/sec reali e scelta del software
Su RDNA 2, il throughput dipende tanto dal backend quanto dal modello. Due approcci funzionano.
- Ollama con ROCm : la 6700 XT non è presente nell'elenco ufficiale, ma la variabile
HSA_OVERRIDE_GFX_VERSION=10.3.0la fa riconoscere come una scheda della stessa famiglia. La procedura completa è nel guida Ollama GPU AMD ROCm ; il repository Ollama su GitHub documenta le variabili d'ambiente. - llama.cpp con Vulkan : nessun driver specifico, funziona su Windows come su Linux. Il backend è mantenuto nel repository llama.cpp. La generazione è simile a ROCm, l'elaborazione del prompt è un po' più lenta.
- vLLM : non è un'opzione realistica su RDNA 2; la documentazione vLLM si rivolge alle schede per data center e alle schede RDNA 3 recenti.
Ordini di grandezza misurati dalla comunità sulla 6700 XT, da confermare sul tuo computer:
- 8B in Q4_K_M : da 35 a 45 token/sec in generazione.
- 14B in Q4_K_M : da 18 a 25 token/sec.
- MoE 30B-A3B con esperti su CPU : da 12 a 20 token/sec, secondo una stima.
- 24B in Q4 parzialmente trasferito nella RAM di sistema : da 4 a 8 token/sec, valore stimato.
Per un'interfaccia di chat che si appoggia a Ollama, Open WebUI si distribuisce in un container e gestisce la cronologia, i documenti e diversi modelli.
Licenze e casi d'uso concreti
La licenza determina cosa puoi fare con gli output e se il modello può essere utilizzato in un prodotto. Il catalogo mostra la licenza in ogni scheda; le principali famiglie di licenze presenti per i modelli di dimensioni compatibili con 12 GB sono Apache 2.0, MIT, Llama Community e alcune licenze specifiche dei produttori. Il filtro per licenza del catalogo permette di escludere subito le licenze con clausole di restrizione commerciale.
Cosa fa bene una 6700 XT nel quotidiano:
- Assistente di programmazione : un modello da 7 a 14 miliardi di parametri in Q4 risponde abbastanza velocemente per il completamento e la revisione del codice in un editor. I punteggi HumanEval e LiveCodeBench delle schede aiutano a scegliere tra i candidati.
- Riepilogo e RAG sui documenti privati : un contesto da 8k a 16k entra nella VRAM con un modello 8B in Q5; oltre questo intervallo, ridurre la quantizzazione della cache KV.
- Chat in francese : privilegiare i modelli la cui scheda indica un punteggio MMLU multilingue o una valutazione in francese, piuttosto che il solo punteggio MMLU in inglese.
- Elaborazione in batch offline : classificazione, estrazione dei campi, riformulazione, dove la velocità conta meno della riservatezza.
Per confrontare i punteggi tra modelli, l' Open LLM Leaderboard rimane il riferimento pubblico, con la consueta riserva: un benchmark misura un compito specifico, non il tuo utilizzo.
Serve cambiare scheda?
Se ti scontri con il limite dei 12 GB, AMD offre tre livelli.
- 16 GB : RX 6800 XT usata, RX 7800 XT o RX 9060 XT nuova. Il benchmark della 9060 XT 16 GB mostra cosa offrono 4 GB in più e RDNA 4 sui modelli 24B.
- 20 GB : RX 7900 XT, che ospita un 27B in Q5.
- 24 GB : RX 7900 XTX, l'unica scheda AMD consumer che carica un modello da 32B in Q4 con un contesto utile.
Le comparatore affianca due schede per vedere cosa sblocca realmente la VRAM aggiuntiva su un modello specifico.
FAQ
Q: La RX 6700 XT è compatibile con ROCm?
Non ufficialmente. AMD non elenca il gfx1031 tra le architetture supportate da ROCm. In pratica, Ollama e llama.cpp compilati per ROCm funzionano forzando HSA_OVERRIDE_GFX_VERSION=10.3.0, che presenta la scheda come un gfx1030. Se questo parametro crea problemi, il backend Vulkan di llama.cpp offre una velocità simile senza dipendere da ROCm.
Q: Qual è la dimensione massima del modello con 12 GB?
Un 14B in Q4 o Q5 resta interamente in VRAM con 8k di contesto. Un 24B o 27B richiede un Q3 aggressivo o un offloading parziale sulla CPU, con un netto calo del throughput. I MoE da 30B con 3B attivi sono il miglior compromesso oltre i 14B, a condizione di spostare gli esperti sul processore.
Q: È possibile eseguire DeepSeek R1 671B o Qwen 3 235B su una 6700 XT?
No. DeepSeek R1 671B richiede circa 400 GB in Q4, Qwen 3 235B-A22B circa 142 GB. Nessuna combinazione di RAM + 12 GB di VRAM su PC desktop è sufficiente. I modelli MoE di circa 120B con da 6 a 10B attivi rappresentano il limite assoluto, con 64 GB di RAM e un throughput di pochi token al secondo.
Q: Windows o Linux per un LLM su 6700 XT?
Entrambi funzionano. Su Windows, il backend Vulkan di llama.cpp e le build recenti di Ollama permettono di evitare l'installazione di ROCm. Su Linux, ROCm con la variabile di override offre un'elaborazione del prompt leggermente più veloce. La differenza stimata nella velocità di generazione resta nell'ordine del 10% e non giustifica da sola un cambio di sistema.
Q: Quanta RAM di sistema occorre prevedere in aggiunta?
32 GB sono sufficienti per i modelli che rientrano nella VRAM e per un MoE 30B-A3B con gli esperti sulla CPU. Passare a 64 GB ha senso solo per provare MoE di circa 120B con offload completo sulla CPU, come Qwen3.8 Flash Next 125B-A6B, a costo di un throughput ridotto.
Q: È possibile un contesto lungo con 12 GB?
Sì, con compromessi. La cache KV di un modello 8B occupa circa 1 GB per ogni blocco di 8k token a 16 bit; quantizzandola a 8 bit, un modello 8B in Q4 raggiunge 32k di contesto entro i 12 GB. Un modello 14B si limita a 16k nelle stesse condizioni. Le schede del catalogo indicano il contesto massimo supportato da ogni modello.
Conclusione
Per la ricerca 6700xt llm, la risposta si riassume in una frase: un modello da 7 a 14 miliardi di parametri in Q4 o Q5, caricato tramite Ollama con l'override ROCm o tramite llama.cpp con Vulkan, gira interamente in VRAM a una velocità di generazione confortevole. I MoE con esperti trasferiti nella RAM di sistema ampliano le possibilità, mentre la fascia alta del catalogo resta fuori portata. Per ottenere l'elenco esatto dei modelli compatibili con i tuoi 12 GB, la tua RAM e la licenza desiderata, usa il configuratore quelllm.fr.
L'hardware per eseguire un LLM in locale
Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:
Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.