Avanzato 12 minllama.cpp

llama.cpp con Vulkan (GPU universel)

Vulkan è l'API grafica compatibile con GPU di diversi produttori: funziona su NVIDIA, AMD, Intel Arc e persino sulle iGPU. Compilare llama.cpp con il backend Vulkan permette di evitare completamente i problemi di CUDA/ROCm e di avere una soluzione che funziona ovunque. In cambio, le prestazioni sono inferiori del 10-20% rispetto a un backend nativo — spesso un buon compromesso per le configurazioni eterogenee.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché Vulkan

Vendor-agnostic
Lo stesso binario funziona su GeForce, Radeon, Arc, Iris. Pratico per distribuire uno strumento o testare un modello prima di acquistare una scheda.
Installazione semplice
I driver Vulkan sono inclusi nei driver grafici standard. Non serve installare un Toolkit di diversi GB.
Schede meno recenti
Una GTX 1060 da 6 GB o una RX 580 funziona tramite Vulkan, anche dove CUDA non è più supportato e ROCm non offre supporto.
Intel Arc
Le Arc A580/A750/A770 sono correttamente supportate tramite Vulkan, mentre il supporto tramite oneAPI è meno stabile.

#GPU compatibili

NVIDIA
Tutte le schede Maxwell+ (GTX 900 e successive). Vulkan è supportato in tutti i driver NVIDIA recenti.
AMD
Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa su Linux, driver ufficiali su Windows.
Intel Arc
Alchemist (A380-A770) e Battlemage. Ottimo rapporto tra prestazioni e prezzo per l'IA locale.
iGPU Intel
Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Utile per i piccoli modelli su laptop senza GPU dedicata.

#Prerequisiti

Ubuntu / Debian
sudo apt update
sudo apt install libvulkan-dev vulkan-tools glslang-tools \
  cmake build-essential git
Fedora
sudo dnf install vulkan-headers vulkan-tools \
  glslang-devel cmake gcc-c++ git
Windows
# Installer le SDK Vulkan LunarG (fournit les headers et shaderc)
winget install KhronosGroup.VulkanSDK
Verificare che Vulkan rilevi la GPU
vulkaninfo | grep -i "deviceName"
# Doit afficher votre GPU

#1. Build

Terminale
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

Gli shader Vulkan vengono compilati durante la build. Calcola 3-8 minuti, a seconda della CPU.

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

#2. Testare

Avviare
./build/bin/llama-cli \
  -m ./models/qwen3.5-9b-q4_k_m.gguf \
  -p "Bonjour" -n 128 -ngl 99

All'avvio, llama.cpp mostra la GPU rilevata tramite Vulkan: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Se hai più GPU, usa -mg N (indice della GPU principale) per scegliere.

#3. Prestazioni vs CUDA / ROCm

Token al secondo su Qwen 3.5 9B Q4_K_M, con Flash Attention attiva (ordini di grandezza):

RTX 4070 — CUDA nativo
~82 tok/s (riferimento).
RTX 4070 — Vulkan
~70 tok/s (-15 %).
RX 7800 XT — ROCm
~56 tok/s.
RX 7800 XT — Vulkan
~48 tok/s (-15 %). A volte il più veloce quando ROCm si blocca.
Arc A770 16 GB — Vulkan
~43 tok/s. Migliore rapporto qualità/prezzo.
iGPU Intel Xe (Lunar Lake)
~8-13 tok/s. Utilizzabile per un modello da 2-3B, fa fatica con uno da 9B.

#Quando scegliere Vulkan

Hai una scheda Intel Arc
Vulkan > oneAPI nel 2026. Prestazioni stabili, nessuna procedura di installazione insolita.
ROCm rifiuta di collaborare
Scheda AMD non ufficialmente supportata, override che va in crash: Vulkan è la soluzione di riserva che funziona.
Configurazione multi-fornitore
Una macchina con GeForce + Intel Arc, un laptop con Thunderbolt+eGPU variabile. Vulkan accetta tutto.
Distribuzione di un tool
Stai sviluppando un’app che deve funzionare su macchine sconosciute: il binario Vulkan è il più compatibile.
i
Non per Mac
Su macOS, Vulkan passa attraverso MoltenVK (strato di traduzione verso Metal). Usa invece il backend Metal nativo di llama.cpp — è più veloce.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.