Intermedio 10 minGemma

Gemma 4 localmente con Ollama: installazione, VRAM, perfs

Gemma 4 è la nuova generazione di modelli open-weight di Google, uscita nel 2026. Multimodalità nativa, contesto lungo, licenza Apache 2.0 e tre taglie utili nella libreria Ollama: E2B (compatta), 12B e 26B-A4B (un MoE). Questa guida ti mostra come far girare Gemma 4 con Ollama, quale quantizzazione scegliere in base alla tua VRAM, gli ordini di grandezza delle prestazioni in token/sec su RTX e Apple Silicon e cosa cambia concretamente rispetto a Gemma 3.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché Gemma 4 in locale

Gemma 4 è uno dei migliori modelli open-weight della sua dimensione per il francese. Il 12B Q4 rientra comodamente in 8–12 GB di VRAM, quindi può essere eseguito su una RTX 3060, una 4070 o un Mac della serie M di fascia media. Il 26B-A4B, un MoE che attiva solo 4 miliardi di parametri, sfrutta le schede da 24 GB (3090, 4090, 7900 XTX) e i Mac con abbondante memoria unificata, mantenendo comunque una buona velocità. Per un assistente in francese, il RAG o la programmazione generalista, è un'ottima scelta predefinita.

L'altra ragione per farlo girare in locale: da aprile 2026 Gemma 4 è distribuito con licenza Apache 2.0, il che elimina le restrizioni dei precedenti Gemma Terms of Use (uso commerciale, redistribuzione e fine-tuning liberi), e Ollama gestisce il pull, la quantizzazione e l'inferenza senza dover intervenire direttamente su Python, CUDA o llama.cpp.

i
In due parole
Gemma 4 + Ollama significa un comando per scaricare il modello, un comando per conversare e un endpoint compatibile con OpenAI su localhost:11434. Il resto è solo configurazione.

#Cosa cambia rispetto a Gemma 3

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Gemma 3 (marzo 2025) ha introdotto la multimodalità e un contesto di 128k. Gemma 4 mantiene questi progressi e si sviluppa su tre fronti: qualità (un grande salto misurato nei benchmark di ragionamento e di codice), efficienza (il 12B sostituisce vantaggiosamente il 27B di Gemma 3 in molte attività, e il 26B-A4B in MoE permette di eseguire l'equivalente di un grande modello alla velocità di uno piccolo) e tokenizer (vocabolario più denso, che riduce il numero di token a parità di contenuto generato — quindi più token utili al secondo).

Dimensioni
Gemma 3: 1B, 4B, 12B, 27B (densi). Gemma 4: E2B (compatto), 12B (denso) e 26B-A4B (MoE, 4B attivi). La gamma aumenta di efficienza piuttosto che di dimensione totale.
Multimodale
Visione nativa sul 12B e sul 26B-A4B (testo + immagini). L'E2B resta la versione compatta orientata al testo.
Contesto
128k token su tutta la gamma. Gli stessi vincoli di memoria di prima: la cache KV occupa rapidamente molta memoria.
Tokenizer
SentencePiece, vocabolario aggiornato per coprire meglio il francese, il codice e le lingue non latine. A parità di prompt, si consuma circa il 5–15% di token in meno.
Licenza
Apache 2.0 da aprile 2026. Uso commerciale, redistribuzione e fine-tuning liberi, senza una clausola specifica sull'uso accettabile — un vero cambiamento rispetto ai Gemma Terms of Use di Gemma 3.
→
Quando tenere Gemma 3
Se hai già una pipeline RAG collaudata su Gemma 3 12B e la qualità ti basta, non migrare per principio. Gemma 4 12B è migliore, ma il leggero aumento della VRAM richiesta (~8 GB contro ~7 GB in Q4) e la nuova messa a punto dei prompt si giustificano solo se stai raggiungendo i limiti di Gemma 3 12B.

#Prerequisiti

Ollama installato
Versione recente (≥ 0.5). Consultare le guide di installazione per Windows, macOS o Linux se l'installazione non è già stata effettuata.
Spazio su disco
Prevedere 4,3 GB per l'E2B, 7,6 GB per il 12B Q4, 19 GB per il 26B-A4B Q4. Le varianti Q5 e Q8 del 12B e del 26B hanno dimensioni da 1,3 a 2 volte quelle indicate.
VRAM o memoria unificata
Minimo pratico: 6 GB per l'E2B, da 8 a 12 GB per il 12B in Q4, 24 GB per il 26B-A4B in Q4. Al di sotto, parte del modello passa alla CPU e la velocità crolla.
Driver GPU aggiornati
CUDA 12.x per NVIDIA, ROCm 6.x per AMD, Metal nativo per Apple Silicon. Ollama rileva automaticamente il backend.

#1. Pull e avvio con un solo comando

Il tag Ollama per Gemma 4 segue la convenzione abituale: gemma4 (latest punta al 12B Q4 per impostazione predefinita), gemma4:e2b-it-qat, gemma4:12b, gemma4:26b. Per esplicitare la quantizzazione, si aggiunge un suffisso: gemma4:12b-instruct-q4_K_M.

Pull e avvio diretto
ollama run gemma4:12b

Alla prima esecuzione, Ollama scarica il modello (~7,6 GB per il 12B Q4) e poi apre direttamente un prompt interattivo. Le volte successive, l'avvio è istantaneo finché il modello rimane nella cache in memoria.

Solo download (senza avviare)
ollama pull gemma4:e2b-it-qat
ollama pull gemma4:12b
ollama pull gemma4:26b
i
Scegliere esplicitamente la quantizzazione
Per impostazione predefinita, Ollama fornisce modelli in Q4_K_M, il miglior compromesso tra qualità e memoria nel 95% dei casi. Per andare oltre: gemma4:12b-instruct-q5_K_M (qualità leggermente migliore, +25% di VRAM), gemma4:12b-instruct-q8_0 (vicino a FP16, +100% di VRAM). L'E2B, invece, è distribuito direttamente in QAT int4 (gemma4:e2b-it-qat) e non ha una variante più pesante utile. Il formato FP16 non quantizzato è utile solo per il fine-tuning.

Per verificare in tempo reale ciò che è caricato in VRAM :

Stato dei modelli caricati
ollama ps

La colonna PROCESSOR deve mostrare 100% GPU. Se vedi 70%/30% GPU/CPU, significa che il modello non entra interamente nella VRAM: passa a una quantizzazione più aggressiva o a un modello più piccolo.

#2. VRAM per dimensione e quantizzazione

I valori qui sotto includono i pesi del modello più una cache KV per una finestra di contesto di 8k token (il valore predefinito di Ollama). Per arrivare a 32k o 128k, prevedi da 2 a 8 GB aggiuntivi a seconda della dimensione.

Gemma 4 E2B — QAT int4
≈ 4,5 GB VRAM. Version compatta (QAT, ~2B attivi come MatFormer). Funziona su qualsiasi GTX 1660 (6 GB), RTX 3050 (8 GB) o Mac con 8 GB unificati.
Gemma 4 12B — Q4_K_M
≈ 8 GB di VRAM. Hardware di riferimento: RTX 3060 12 GB, 4070 12 GB, 5070 12 GB, Mac con almeno 16 GB.
Gemma 4 12B — Q5_K_M
≈ 9,5 GB di VRAM. Rientra in 12 GB con un contesto modesto, con più margine su 16 GB (4070 Ti Super, 5080).
Gemma 4 12B — Q8_0
≈ 13 GB di VRAM. Riservato alle schede da almeno 16 GB o a macchine Apple Silicon con abbondante memoria.
Gemma 4 26B-A4B — Q4_K_M
≈ 19 GB di VRAM. Configurazioni ideali: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio. MoE: carica solo 4B di parametri attivi, quindi è veloce nonostante l'occupazione di memoria.
Gemma 4 26B-A4B — Q5_K_M
≈ 23 GB di VRAM. Vicino al limite dei 24 GB; altrimenti puntare su un Mac con almeno 48 GB di memoria unificata o su una configurazione multi-GPU.
Gemma 4 26B-A4B — Q8_0
≈ 30 GB di VRAM. Per le schede da 32 GB+ (RTX 5090) o i Mac con memoria unificata da 48 GB in su.
!
La trappola del contesto 128k
Attivare la finestra massima (num_ctx=131072) sul modello da 12B può aggiungere da 4 a 6 GB alla cache KV. Se il modello entra a malapena in memoria in Q4 a 8k, a 32k supererai la capacità disponibile. Aumenta il contesto gradualmente e controlla ollama ps.

#3. Token/sec: RTX e Apple Silicon

Ordini di grandezza osservati con una versione recente di Ollama, contesto 8k, prompt breve e generazione di 200 token. I valori variano di ±15 % in base al contenuto generato e alla versione di Ollama. Essendo un MoE (4B attivi), il 26B-A4B gira molto più velocemente di un modello denso 26B, una volta caricato in memoria.

RTX 3060 12 GB
Gemma 4 E2B: ~90 tok/s. Gemma 4 12B Q4: ~28 tok/s. 26B-A4B: non entra interamente in VRAM (19 GB), da evitare.
RTX 4070 12 GB
E2B: ~130 tok/s. 12B Q4: ~46 tok/s. 26B-A4B: supera la capacità della VRAM.
RTX 4080 Super 16 GB
12B Q4: ~66 tok/s. 12B Q8: ~40 tok/s. 26B-A4B: non entra in 16 GB.
RTX 4090 24 GB
12B Q4: ~100 tok/s. 26B-A4B Q4: ~58 tok/s. 26B-A4B Q5: ~50 tok/s.
RTX 5090 32 GB
12B Q4: ~150 tok/s. 26B-A4B Q4: ~88 tok/s. 26B-A4B Q8: ~48 tok/s.
Mac M3 Max 64 GB
12B Q4: ~38 tok/s. 26B-A4B Q4: ~30 tok/s. Buona costanza delle prestazioni grazie alla memoria unificata.
Mac M4 Pro 48 GB
12B Q4: ~34 tok/s. 26B-A4B Q4: ~24 tok/s. Il MoE ci sta senza problemi e resta reattivo per le sue dimensioni.
Mac M4 Max 128 GB
26B-A4B Q4: ~36 tok/s. 26B-A4B Q8: ~20 tok/s. Il Mac più a proprio agio con il 26B nel quotidiano.
→
Riferimento pratico
Sopra i 30 tok/s, l'uso interattivo è fluido. Tra 15 e 30 tok/s, è ancora accettabile per la chat, ma si fa sentire la lentezza sui testi lunghi. Sotto i 10 tok/s, riserva l'uso all'elaborazione batch o ad attività in cui aspetti comunque il completamento.

#4. Primo prompt e impostazioni utili

Gemma 4 risponde bene in francese senza un particolare prompt di sistema, ma alcuni parametri meritano di essere regolati in base al caso d'uso.

Test rapido
ollama run gemma4:12b
>>> Explique la différence entre un index B-tree et un index hash en SQL, en 5 lignes.

Per regolare i parametri al volo dal prompt interattivo:

Parametri in sessione
/set parameter temperature 0.3
/set parameter num_ctx 16384
/set parameter num_predict 800
temperature
0,7 di default. Abbassala a 0,2-0,4 per contenuti fattuali, codice e RAG. Aumentala a 0,9-1,1 per il brainstorming.
num_ctx
Finestra di contesto. 4096 o 8192 di default a seconda delle build. Aumenta in base al tuo utilizzo e alla VRAM disponibile.
num_predict
Numero massimo di token generati. -1 per nessun limite (fino allo stop). Utile per limitare la lunghezza delle risposte.
repeat_penalty
1.1 per impostazione predefinita. Se Gemma 4 entra in un ciclo di ripetizioni, aumenta a 1.15-1.2. Se le risposte sembrano troppo costruite, riduci a 1.05.
i
Salvare le impostazioni in modo permanente
Per fissare un prompt di sistema e dei parametri, crea un Modelfile: FROM gemma4:12b, poi SYSTEM "...", PARAMETER temperature 0.3, ecc. Esegui ollama create monassistant -f Modelfile e poi richiama monassistant come un modello normale.

#5. API e integrazione dal tuo codice

Ollama espone un endpoint compatibile con OpenAI su http://localhost:11434/v1. Qualsiasi SDK che comunica con OpenAI funziona semplicemente impostando base_url in modo che punti al tuo server locale.

Python — SDK openai
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # valeur ignorée, mais le SDK l'exige
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[
        {"role": "system", "content": "Tu réponds en français, de manière concise."},
        {"role": "user", "content": "Résume la photosynthèse en 3 lignes."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

Per la versione multimodale (12B e 26B-A4B), si passa l'immagine in base64 o tramite URL locale nel messaggio — stesso protocollo di GPT-4o.

Visione con curl
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:12b",
  "prompt": "Décris cette image en français.",
  "images": ["'"$(base64 -w0 photo.jpg)"'"],
  "stream": false
}'

#Risoluzione dei problemi

"Error: model gemma4 not found"
Il tag non esiste ancora nella tua versione di Ollama, oppure c'è un errore di battitura. Controlla i modelli installati con ollama list e consulta la documentazione della libreria Ollama per i tag ufficiali.
Modello eseguito in parte sulla CPU
ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
Velocità divisa per 3 dopo qualche ora
Il KV-cache si frammenta con alcuni driver. Riavvia il servizio Ollama (sudo systemctl restart ollama su Linux, riavviare l'app su Mac/Windows).
Risposte troncate dopo ~400 parole
num_predict troppo basso. Imposta 2048 o -1 per non avere limiti e aumenta num_ctx di conseguenza.
Francese approssimativo su E2B
È normale: l'E2B è potente per le sue dimensioni, ma rimane una variante compatta. Se hai esigenze elevate per il francese, scegli il 12B.
OOM su RTX 4060 da 8 GB con il modello 12B
Il 12B in Q4 entra appena in 8 GB, senza margine per il contesto. Scegli gemma4:e2b-it-qat, oppure accetta l'offload sulla CPU (~3-5 tok/s), oppure cambia scheda.

#Per approfondire

Gemma 4 è in esecuzione. Ecco alcuni spunti per andare oltre, a seconda di ciò che vuoi farne:

Cos'è Ollama e come funziona
Se stai scoprendo Ollama, questa guida per principianti riprende i comandi essenziali e il modello mentale completo.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per capire esattamente cosa si perde passando dal Q8 al Q4, e in quali casi conta davvero.
Open WebUI con Ollama
Per un'interfaccia simile a ChatGPT basata su Gemma 4: cronologia delle conversazioni, RAG integrato, condivisione multiutente.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.