llama.cpp con Vulkan (GPU universel)
Vulkan è l'API grafica compatibile con GPU di diversi produttori: funziona su NVIDIA, AMD, Intel Arc e persino sulle iGPU. Compilare llama.cpp con il backend Vulkan permette di evitare completamente i problemi di CUDA/ROCm e di avere una soluzione che funziona ovunque. In cambio, le prestazioni sono inferiori del 10-20% rispetto a un backend nativo — spesso un buon compromesso per le configurazioni eterogenee.
#Perché Vulkan
- Vendor-agnostic
- Lo stesso binario funziona su GeForce, Radeon, Arc, Iris. Pratico per distribuire uno strumento o testare un modello prima di acquistare una scheda.
- Installazione semplice
- I driver Vulkan sono inclusi nei driver grafici standard. Non serve installare un Toolkit di diversi GB.
- Schede meno recenti
- Una GTX 1060 da 6 GB o una RX 580 funziona tramite Vulkan, anche dove CUDA non è più supportato e ROCm non offre supporto.
- Intel Arc
- Le Arc A580/A750/A770 sono correttamente supportate tramite Vulkan, mentre il supporto tramite oneAPI è meno stabile.
#GPU compatibili
- NVIDIA
- Tutte le schede Maxwell+ (GTX 900 e successive). Vulkan è supportato in tutti i driver NVIDIA recenti.
- AMD
- Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa su Linux, driver ufficiali su Windows.
- Intel Arc
- Alchemist (A380-A770) e Battlemage. Ottimo rapporto tra prestazioni e prezzo per l'IA locale.
- iGPU Intel
- Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Utile per i piccoli modelli su laptop senza GPU dedicata.
#Prerequisiti
#1. Build
Gli shader Vulkan vengono compilati durante la build. Calcola 3-8 minuti, a seconda della CPU.
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
#2. Testare
All'avvio, llama.cpp mostra la GPU rilevata tramite Vulkan: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Se hai più GPU, usa -mg N (indice della GPU principale) per scegliere.
#3. Prestazioni vs CUDA / ROCm
Token al secondo su Qwen 3.5 9B Q4_K_M, con Flash Attention attiva (ordini di grandezza):
- RTX 4070 — CUDA nativo
- ~82 tok/s (riferimento).
- RTX 4070 — Vulkan
- ~70 tok/s (-15 %).
- RX 7800 XT — ROCm
- ~56 tok/s.
- RX 7800 XT — Vulkan
- ~48 tok/s (-15 %). A volte il più veloce quando ROCm si blocca.
- Arc A770 16 GB — Vulkan
- ~43 tok/s. Migliore rapporto qualità/prezzo.
- iGPU Intel Xe (Lunar Lake)
- ~8-13 tok/s. Utilizzabile per un modello da 2-3B, fa fatica con uno da 9B.
#Quando scegliere Vulkan
- Hai una scheda Intel Arc
- Vulkan > oneAPI nel 2026. Prestazioni stabili, nessuna procedura di installazione insolita.
- ROCm rifiuta di collaborare
- Scheda AMD non ufficialmente supportata, override che va in crash: Vulkan è la soluzione di riserva che funziona.
- Configurazione multi-fornitore
- Una macchina con GeForce + Intel Arc, un laptop con Thunderbolt+eGPU variabile. Vulkan accetta tutto.
- Distribuzione di un tool
- Stai sviluppando un’app che deve funzionare su macchine sconosciute: il binario Vulkan è il più compatibile.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.