Quale LLM eseguire su una scheda AMD Radeon 6700XT?

La ricerca «6700xt llm» ricorre spesso tra chi possiede una scheda della generazione RDNA 2 e vuole un modello locale senza acquistare una nuova GPU. Buone notizie per l'abbinamento 6700xt llm: i 12 GB di GDDR6 di questa scheda bastano per modelli da 7 a 14 miliardi di parametri con quantizzazione a 4 bit, con una velocità adeguata per la chat, la programmazione e il riassunto di documenti. Il vincolo principale non è la potenza di calcolo, ma la memoria video, e il secondo ostacolo è software: la RX 6700 XT non è ufficialmente supportata da ROCm, il che richiede una modifica alla configurazione oppure l'uso del backend Vulkan. Questo articolo descrive in dettaglio le specifiche utili, la VRAM per quantizzazione, le velocità realistiche e le licenze, poi risponde alle domande frequenti prima di indirizzarti al configuratore.

La RX 6700 XT e l'inferenza locale

Sulla carta, la Radeon RX 6700 XT è una scheda da gaming del 2021. Per un LLM, contano davvero tre numeri.

A titolo di confronto, una scheda da 16 GB come quella descritta nel guida LLM Radeon RX 6800 XT permette di eseguire modelli 24B in Q4, e una da 24 GB come la RX 7900 XTX raggiunge i 32B. La 6700 XT resta nella classe dei 12 GB, come la RTX 3060 12 GB dal lato NVIDIA. Il guida dedicata alla RX 6700 XT e la selezione migliore LLM per Radeon RX 6700 XT elencano i modelli del catalogo che rientrano in questo limite di memoria.

VRAM utilizzata per livello di quantizzazione: Q4, Q5, Q8, FP16

La regola di calcolo è semplice: numero di parametri × byte per parametro, più la cache KV che cresce con la lunghezza del contesto. Gli ordini di grandezza qui sotto presuppongono un contesto di 8.192 token e una cache KV a 8 bit; sono stimati a partire dai file GGUF comuni.

Il punto di svolta è netto: oltre i 12 GB, llama.cpp e Ollama trasferiscono i livelli rimanenti sul processore e il throughput cala di un fattore da 5 a 10. La guida « quale LLM per 12 GB di VRAM » descrive nel dettaglio le combinazioni dimensione × quantizzazione × contesto che restano al 100% sulla GPU.

Cosa non riuscirà a eseguire il top del catalogo

Una parte del catalogo quelllm.fr è fuori dalla portata di una 6700 XT, ed è meglio dirlo chiaramente piuttosto che far sperare in un miracolo software.

Il caso limite interessante è quello dei modelli MoE di circa 120B con pochi parametri attivi. Qwen 3.5 122B-A10B pesa circa 73 GB in Q4 sotto licenza Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 GB con soli 6B attivi, e Mistral Small 4 ~72 GB sotto licenza Apache 2.0. Con 64 GB di RAM di sistema e i 12 GB della scheda, llama.cpp può caricare questi modelli trasferendo gli esperti sulla CPU. Il throughput ottenuto è di pochi token al secondo, stimato tra 3 e 8 a seconda della RAM e della CPU, da confermare sulla tua configurazione. È utilizzabile per elaborazioni in batch durante la notte, non per una chat interattiva. I pesi sono pubblicati su la pagina Alibaba su Hugging Face et la pagina Mistral su Hugging Face.

Tokens/sec reali e scelta del software

Su RDNA 2, il throughput dipende tanto dal backend quanto dal modello. Due approcci funzionano.

Ordini di grandezza misurati dalla comunità sulla 6700 XT, da confermare sul tuo computer:

Per un'interfaccia di chat che si appoggia a Ollama, Open WebUI si distribuisce in un container e gestisce la cronologia, i documenti e diversi modelli.

Licenze e casi d'uso concreti

La licenza determina cosa puoi fare con gli output e se il modello può essere utilizzato in un prodotto. Il catalogo mostra la licenza in ogni scheda; le principali famiglie di licenze presenti per i modelli di dimensioni compatibili con 12 GB sono Apache 2.0, MIT, Llama Community e alcune licenze specifiche dei produttori. Il filtro per licenza del catalogo permette di escludere subito le licenze con clausole di restrizione commerciale.

Cosa fa bene una 6700 XT nel quotidiano:

Per confrontare i punteggi tra modelli, l' Open LLM Leaderboard rimane il riferimento pubblico, con la consueta riserva: un benchmark misura un compito specifico, non il tuo utilizzo.

Serve cambiare scheda?

Se ti scontri con il limite dei 12 GB, AMD offre tre livelli.

Le comparatore affianca due schede per vedere cosa sblocca realmente la VRAM aggiuntiva su un modello specifico.

FAQ

Q: La RX 6700 XT è compatibile con ROCm?

Non ufficialmente. AMD non elenca il gfx1031 tra le architetture supportate da ROCm. In pratica, Ollama e llama.cpp compilati per ROCm funzionano forzando HSA_OVERRIDE_GFX_VERSION=10.3.0, che presenta la scheda come un gfx1030. Se questo parametro crea problemi, il backend Vulkan di llama.cpp offre una velocità simile senza dipendere da ROCm.

Q: Qual è la dimensione massima del modello con 12 GB?

Un 14B in Q4 o Q5 resta interamente in VRAM con 8k di contesto. Un 24B o 27B richiede un Q3 aggressivo o un offloading parziale sulla CPU, con un netto calo del throughput. I MoE da 30B con 3B attivi sono il miglior compromesso oltre i 14B, a condizione di spostare gli esperti sul processore.

Q: È possibile eseguire DeepSeek R1 671B o Qwen 3 235B su una 6700 XT?

No. DeepSeek R1 671B richiede circa 400 GB in Q4, Qwen 3 235B-A22B circa 142 GB. Nessuna combinazione di RAM + 12 GB di VRAM su PC desktop è sufficiente. I modelli MoE di circa 120B con da 6 a 10B attivi rappresentano il limite assoluto, con 64 GB di RAM e un throughput di pochi token al secondo.

Q: Windows o Linux per un LLM su 6700 XT?

Entrambi funzionano. Su Windows, il backend Vulkan di llama.cpp e le build recenti di Ollama permettono di evitare l'installazione di ROCm. Su Linux, ROCm con la variabile di override offre un'elaborazione del prompt leggermente più veloce. La differenza stimata nella velocità di generazione resta nell'ordine del 10% e non giustifica da sola un cambio di sistema.

Q: Quanta RAM di sistema occorre prevedere in aggiunta?

32 GB sono sufficienti per i modelli che rientrano nella VRAM e per un MoE 30B-A3B con gli esperti sulla CPU. Passare a 64 GB ha senso solo per provare MoE di circa 120B con offload completo sulla CPU, come Qwen3.8 Flash Next 125B-A6B, a costo di un throughput ridotto.

Q: È possibile un contesto lungo con 12 GB?

Sì, con compromessi. La cache KV di un modello 8B occupa circa 1 GB per ogni blocco di 8k token a 16 bit; quantizzandola a 8 bit, un modello 8B in Q4 raggiunge 32k di contesto entro i 12 GB. Un modello 14B si limita a 16k nelle stesse condizioni. Le schede del catalogo indicano il contesto massimo supportato da ogni modello.

Conclusione

Per la ricerca 6700xt llm, la risposta si riassume in una frase: un modello da 7 a 14 miliardi di parametri in Q4 o Q5, caricato tramite Ollama con l'override ROCm o tramite llama.cpp con Vulkan, gira interamente in VRAM a una velocità di generazione confortevole. I MoE con esperti trasferiti nella RAM di sistema ampliano le possibilità, mentre la fascia alta del catalogo resta fuori portata. Per ottenere l'elenco esatto dei modelli compatibili con i tuoi 12 GB, la tua RAM e la licenza desiderata, usa il configuratore quelllm.fr.

L'hardware per eseguire un LLM in locale

Per eseguire questi modelli comodamente in locale, una RTX 5070 Ti offre un eccellente rapporto prezzo/prestazioni. Confronta i prezzi:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Link affiliati — QuelLLM può percepire una commissione sugli acquisti, senza costo aggiuntivo per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno sugli acquisti che soddisfano i requisiti necessari.

Articolo pubblicato e aggiornato il da Mohamed Meguedmi · Fonte dati: /api/models.json · Licenza dei contenuti: CC BY 4.0.

Un errore o un aggiornamento da segnalare? Contribuire.