Gemma 4 localmente con Ollama: installazione, VRAM, perfs
Gemma 4 è la nuova generazione di modelli open-weight di Google, uscita nel 2026. Multimodalità nativa, contesto lungo, licenza Apache 2.0 e tre taglie utili nella libreria Ollama: E2B (compatta), 12B e 26B-A4B (un MoE). Questa guida ti mostra come far girare Gemma 4 con Ollama, quale quantizzazione scegliere in base alla tua VRAM, gli ordini di grandezza delle prestazioni in token/sec su RTX e Apple Silicon e cosa cambia concretamente rispetto a Gemma 3.
#Perché Gemma 4 in locale
Gemma 4 è uno dei migliori modelli open-weight della sua dimensione per il francese. Il 12B Q4 rientra comodamente in 8–12 GB di VRAM, quindi può essere eseguito su una RTX 3060, una 4070 o un Mac della serie M di fascia media. Il 26B-A4B, un MoE che attiva solo 4 miliardi di parametri, sfrutta le schede da 24 GB (3090, 4090, 7900 XTX) e i Mac con abbondante memoria unificata, mantenendo comunque una buona velocità. Per un assistente in francese, il RAG o la programmazione generalista, è un'ottima scelta predefinita.
L'altra ragione per farlo girare in locale: da aprile 2026 Gemma 4 è distribuito con licenza Apache 2.0, il che elimina le restrizioni dei precedenti Gemma Terms of Use (uso commerciale, redistribuzione e fine-tuning liberi), e Ollama gestisce il pull, la quantizzazione e l'inferenza senza dover intervenire direttamente su Python, CUDA o llama.cpp.
#Cosa cambia rispetto a Gemma 3
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Gemma 3 (marzo 2025) ha introdotto la multimodalità e un contesto di 128k. Gemma 4 mantiene questi progressi e si sviluppa su tre fronti: qualità (un grande salto misurato nei benchmark di ragionamento e di codice), efficienza (il 12B sostituisce vantaggiosamente il 27B di Gemma 3 in molte attività, e il 26B-A4B in MoE permette di eseguire l'equivalente di un grande modello alla velocità di uno piccolo) e tokenizer (vocabolario più denso, che riduce il numero di token a parità di contenuto generato — quindi più token utili al secondo).
- Dimensioni
- Gemma 3: 1B, 4B, 12B, 27B (densi). Gemma 4: E2B (compatto), 12B (denso) e 26B-A4B (MoE, 4B attivi). La gamma aumenta di efficienza piuttosto che di dimensione totale.
- Multimodale
- Visione nativa sul 12B e sul 26B-A4B (testo + immagini). L'E2B resta la versione compatta orientata al testo.
- Contesto
- 128k token su tutta la gamma. Gli stessi vincoli di memoria di prima: la cache KV occupa rapidamente molta memoria.
- Tokenizer
- SentencePiece, vocabolario aggiornato per coprire meglio il francese, il codice e le lingue non latine. A parità di prompt, si consuma circa il 5–15% di token in meno.
- Licenza
- Apache 2.0 da aprile 2026. Uso commerciale, redistribuzione e fine-tuning liberi, senza una clausola specifica sull'uso accettabile — un vero cambiamento rispetto ai Gemma Terms of Use di Gemma 3.
#Prerequisiti
- Ollama installato
- Versione recente (≥ 0.5). Consultare le guide di installazione per Windows, macOS o Linux se l'installazione non è già stata effettuata.
- Spazio su disco
- Prevedere 4,3 GB per l'E2B, 7,6 GB per il 12B Q4, 19 GB per il 26B-A4B Q4. Le varianti Q5 e Q8 del 12B e del 26B hanno dimensioni da 1,3 a 2 volte quelle indicate.
- VRAM o memoria unificata
- Minimo pratico: 6 GB per l'E2B, da 8 a 12 GB per il 12B in Q4, 24 GB per il 26B-A4B in Q4. Al di sotto, parte del modello passa alla CPU e la velocità crolla.
- Driver GPU aggiornati
- CUDA 12.x per NVIDIA, ROCm 6.x per AMD, Metal nativo per Apple Silicon. Ollama rileva automaticamente il backend.
#1. Pull e avvio con un solo comando
Il tag Ollama per Gemma 4 segue la convenzione abituale: gemma4 (latest punta al 12B Q4 per impostazione predefinita), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Per esplicitare la quantizzazione, si aggiunge un suffisso: gemma4:12b-instruct-q4_K_M.
Alla prima esecuzione, Ollama scarica il modello (~7,6 GB per il 12B Q4) e poi apre direttamente un prompt interattivo. Le volte successive, l'avvio è istantaneo finché il modello rimane nella cache in memoria.
Per verificare in tempo reale ciò che è caricato in VRAM :
La colonna PROCESSOR deve mostrare 100% GPU. Se vedi 70%/30% GPU/CPU, significa che il modello non entra interamente nella VRAM: passa a una quantizzazione più aggressiva o a un modello più piccolo.
#2. VRAM per dimensione e quantizzazione
I valori qui sotto includono i pesi del modello più una cache KV per una finestra di contesto di 8k token (il valore predefinito di Ollama). Per arrivare a 32k o 128k, prevedi da 2 a 8 GB aggiuntivi a seconda della dimensione.
- Gemma 4 E2B — QAT int4
- ≈ 4,5 GB VRAM. Version compatta (QAT, ~2B attivi come MatFormer). Funziona su qualsiasi GTX 1660 (6 GB), RTX 3050 (8 GB) o Mac con 8 GB unificati.
- Gemma 4 12B — Q4_K_M
- ≈ 8 GB di VRAM. Hardware di riferimento: RTX 3060 12 GB, 4070 12 GB, 5070 12 GB, Mac con almeno 16 GB.
- Gemma 4 12B — Q5_K_M
- ≈ 9,5 GB di VRAM. Rientra in 12 GB con un contesto modesto, con più margine su 16 GB (4070 Ti Super, 5080).
- Gemma 4 12B — Q8_0
- ≈ 13 GB di VRAM. Riservato alle schede da almeno 16 GB o a macchine Apple Silicon con abbondante memoria.
- Gemma 4 26B-A4B — Q4_K_M
- ≈ 19 GB di VRAM. Configurazioni ideali: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE: carica solo 4B di parametri attivi, quindi è veloce nonostante l'occupazione di memoria.
- Gemma 4 26B-A4B — Q5_K_M
- ≈ 23 GB di VRAM. Vicino al limite dei 24 GB; altrimenti puntare su un Mac con almeno 48 GB di memoria unificata o su una configurazione multi-GPU.
- Gemma 4 26B-A4B — Q8_0
- ≈ 30 GB di VRAM. Per le schede da 32 GB+ (RTX 5090) o i Mac con memoria unificata da 48 GB in su.
#3. Token/sec: RTX e Apple Silicon
Ordini di grandezza osservati con una versione recente di Ollama, contesto 8k, prompt breve e generazione di 200 token. I valori variano di ±15 % in base al contenuto generato e alla versione di Ollama. Essendo un MoE (4B attivi), il 26B-A4B gira molto più velocemente di un modello denso 26B, una volta caricato in memoria.
- RTX 3060 12 GB
- Gemma 4 E2B: ~90 tok/s. Gemma 4 12B Q4: ~28 tok/s. 26B-A4B: non entra interamente in VRAM (19 GB), da evitare.
- RTX 4070 12 GB
- E2B: ~130 tok/s. 12B Q4: ~46 tok/s. 26B-A4B: supera la capacità della VRAM.
- RTX 4080 Super 16 GB
- 12B Q4: ~66 tok/s. 12B Q8: ~40 tok/s. 26B-A4B: non entra in 16 GB.
- RTX 4090 24 GB
- 12B Q4: ~100 tok/s. 26B-A4B Q4: ~58 tok/s. 26B-A4B Q5: ~50 tok/s.
- RTX 5090 32 GB
- 12B Q4: ~150 tok/s. 26B-A4B Q4: ~88 tok/s. 26B-A4B Q8: ~48 tok/s.
- Mac M3 Max 64 GB
- 12B Q4: ~38 tok/s. 26B-A4B Q4: ~30 tok/s. Buona costanza delle prestazioni grazie alla memoria unificata.
- Mac M4 Pro 48 GB
- 12B Q4: ~34 tok/s. 26B-A4B Q4: ~24 tok/s. Il MoE ci sta senza problemi e resta reattivo per le sue dimensioni.
- Mac M4 Max 128 GB
- 26B-A4B Q4: ~36 tok/s. 26B-A4B Q8: ~20 tok/s. Il Mac più a proprio agio con il 26B nel quotidiano.
#4. Primo prompt e impostazioni utili
Gemma 4 risponde bene in francese senza un particolare prompt di sistema, ma alcuni parametri meritano di essere regolati in base al caso d'uso.
Per regolare i parametri al volo dal prompt interattivo:
- temperature
- 0,7 di default. Abbassala a 0,2-0,4 per contenuti fattuali, codice e RAG. Aumentala a 0,9-1,1 per il brainstorming.
- num_ctx
- Finestra di contesto. 4096 o 8192 di default a seconda delle build. Aumenta in base al tuo utilizzo e alla VRAM disponibile.
- num_predict
- Numero massimo di token generati. -1 per nessun limite (fino allo stop). Utile per limitare la lunghezza delle risposte.
- repeat_penalty
- 1.1 per impostazione predefinita. Se Gemma 4 entra in un ciclo di ripetizioni, aumenta a 1.15-1.2. Se le risposte sembrano troppo costruite, riduci a 1.05.
#5. API e integrazione dal tuo codice
Ollama espone un endpoint compatibile con OpenAI su http://localhost:11434/v1. Qualsiasi SDK che comunica con OpenAI funziona semplicemente impostando base_url in modo che punti al tuo server locale.
Per la versione multimodale (12B e 26B-A4B), si passa l'immagine in base64 o tramite URL locale nel messaggio — stesso protocollo di GPT-4o.
#Risoluzione dei problemi
- "Error: model gemma4 not found"
- Il tag non esiste ancora nella tua versione di Ollama, oppure c'è un errore di battitura. Controlla i modelli installati con ollama list e consulta la documentazione della libreria Ollama per i tag ufficiali.
- Modello eseguito in parte sulla CPU
- ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
- Velocità divisa per 3 dopo qualche ora
- Il KV-cache si frammenta con alcuni driver. Riavvia il servizio Ollama (sudo systemctl restart ollama su Linux, riavviare l'app su Mac/Windows).
- Risposte troncate dopo ~400 parole
- num_predict troppo basso. Imposta 2048 o -1 per non avere limiti e aumenta num_ctx di conseguenza.
- Francese approssimativo su E2B
- È normale: l'E2B è potente per le sue dimensioni, ma rimane una variante compatta. Se hai esigenze elevate per il francese, scegli il 12B.
- OOM su RTX 4060 da 8 GB con il modello 12B
- Il 12B in Q4 entra appena in 8 GB, senza margine per il contesto. Scegli gemma4:e2b-it-qat, oppure accetta l'offload sulla CPU (~3-5 tok/s), oppure cambia scheda.
#Per approfondire
Gemma 4 è in esecuzione. Ecco alcuni spunti per andare oltre, a seconda di ciò che vuoi farne:
- Cos'è Ollama e come funziona
- Se stai scoprendo Ollama, questa guida per principianti riprende i comandi essenziali e il modello mentale completo.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per capire esattamente cosa si perde passando dal Q8 al Q4, e in quali casi conta davvero.
- Open WebUI con Ollama
- Per un'interfaccia simile a ChatGPT basata su Gemma 4: cronologia delle conversazioni, RAG integrato, condivisione multiutente.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.