Ollama + GPU AMD (ROCm) : configurare Radeon RX 6000 a 9000
AMD è stata a lungo indietro rispetto a CUDA, ma ROCm 6 ha recuperato abbastanza terreno da rendere le Radeon RX 6000, 7000 e 9000 pienamente utilizzabili per l'inferenza LLM. Questa guida tratta l'installazione pulita, la configurazione di Ollama e l'override che permette di far funzionare schede non elencate ufficialmente.
#Perché ROCm
Per utilizzare la GPU AMD, Ollama (che si basa su llama.cpp) deve passare attraverso ROCm — l'equivalente AMD di CUDA. Senza ROCm, la scheda non viene rilevata per l'inferenza e tutto viene eseguito sulla CPU.
#Carte ufficialmente compatibili
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- RX 7900 XTX / XT / GRE
- gfx1100. Supporto ufficiale. Circa l'80% delle prestazioni di una RTX 4080.
- RX 7800 / 7700 XT
- gfx1101. Supporto ufficiale da ROCm 6.1.
- RX 6900 / 6800 / 6700 XT
- gfx1030/1031. Supporto ufficiale per le schede più grandi, override per quelle più piccole.
- Instinct MI200 / MI300
- Schede per data center. Supporto nativo completo.
#1. Installare ROCm
Le due distribuzioni meglio supportate sono Ubuntu 22.04/24.04 e RHEL/Fedora. Le versioni Debian, Arch e simili richiedono aggiustamenti aggiuntivi.
#2. Ollama e ROCm
Ollama 0.3+ rileva automaticamente ROCm. Se hai installato Ollama PRIMA di ROCm, reinstallalo — lo script rileva quindi la GPU AMD e installa le librerie corrette.
#3. Forzare una scheda non supportata
Se rocminfo non elenca la tua GPU, o se Ollama continua a utilizzare la CPU, la variabile HSA_OVERRIDE_GFX_VERSION costringe ROCm a fingere.
- RX 6600 / 6700
- HSA_OVERRIDE_GFX_VERSION=10.3.0
- RX 5700 XT
- HSA_OVERRIDE_GFX_VERSION=10.1.0 (supporto fragile)
- RX 6800 / 6900
- Supportate nativamente, nessun override necessario.
#4. Prestazioni attese
Con Qwen 3.5 9B Q4_K_M (6,6 GB, la scelta di riferimento per 8 GB nel 2026), ecco gli ordini di grandezza in token/secondo durante l'inferenza:
- RX 7900 XTX (24 GB)
- ~90 tok/s. Simile a una RTX 4080.
- RX 7800 XT (16 GB)
- ~62 tok/s. Tra RTX 4070 e 4070 Ti.
- RX 6900 XT (16 GB)
- ~52 tok/s. Equivalente a una RTX 3080 da 10 GB.
- RX 6700 XT (12 GB, override)
- ~33 tok/s. Tra RTX 3060 e 3060 Ti.
#Risoluzione dei problemi
- rocminfo è vuoto
- Driver non installati o utente non presente nel gruppo render. Verifica groups $USER.
- Ollama utilizza la CPU nonostante ROCm
- Spesso si tratta di un'incompatibilità dell'architettura. Prova l'HSA_OVERRIDE corrispondente alla generazione successiva.
- Crash su grandi modelli (OOM)
- rocm-smi per vedere la VRAM consumata. Se superi il limite, riduci num_ctx o passa a Q3_K_M.
- Versione ROCm incompatibile con Ollama
- Ollama è distribuito in pacchetti per ROCm 6.x. ROCm 5 non funziona. Aggiorna.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.