Gemma 3 (Google) localmente: guida completa 2026
Gemma 3 è la famiglia di modelli open-weight di Google rilasciata a marzo 2025. Quattro dimensioni (1B, 4B, 12B, 27B), visione integrata a partire da 4B, contesto 128k e un solido supporto multilingue che include un francese corretto. Questa guida illustra passo dopo passo l'installazione di Gemma 3 in locale con Ollama, la licenza Google da conoscere e gli ambiti in cui il modello eccelle davvero.
#Perché Gemma 3?
Gemma 3 è la terza iterazione dei modelli open-weight di Google DeepMind, derivati dalla stessa ricerca alla base di Gemini. La famiglia comprende quattro dimensioni molto diverse — da 1B a 27B — che permettono di scegliere esattamente in funzione dell'hardware che hai a disposizione, dal laptop senza GPU alla workstation da 24 GB.
Tre caratteristiche distinguono Gemma 3 dagli altri modelli di questa categoria: un contesto da 128k di serie (solo 32k per la versione 1B), una capacità di visione multimodale integrata già dalla versione 4B senza dover caricare un modello separato e un lavoro esplicito sul multilinguismo (la documentazione di Google dichiara una copertura di oltre 140 lingue per le versioni da 4B in su).
#Le 4 dimensioni di Gemma 3
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Scegliere la dimensione giusta è la decisione più importante. Ecco il mapping tra uso e hardware:
- gemma3:1b
- Solo testo, contesto 32k. Per l'esecuzione solo su CPU, Raspberry Pi 5 o un Mac M1 con 8 GB. Qualità limitata ma risposte istantanee. Adatto alla classificazione e a brevi riformulazioni.
- gemma3:4b
- Multimodale (testo + immagine), contesto 128k. Il livello "laptop": trova comodamente spazio in 6 GB di VRAM o su un Mac M2/M3 da 16 GB. Qualità ragionevole per compiti generali.
- gemma3:12b
- Multimodale, contesto 128k. La fascia "PC mid-range": RTX 3060 12 GB, 4070, M3 Pro 18 GB. Qualità davvero adeguata all'uso quotidiano.
- gemma3:27b
- Multimodale, contesto 128k. Il livello "workstation": RTX 3090/4090, M3 Max. Il migliore Gemma 3, comparabile a modelli di categoria superiore su molte attività.
#Requisiti VRAM (quantizzazione Q4_K_M)
- gemma3:1b
- ≈ 1 GB di VRAM o RAM. Funziona su qualsiasi macchina, anche su un Raspberry Pi 5.
- gemma3:4b
- ≈ 3 GB di VRAM. RTX 3050 6 GB, GTX 1660 6 GB, MacBook Air M2 8 GB sono sufficienti.
- gemma3:12b
- ≈ 8 GB di VRAM. RTX 3060 12 GB, RTX 4070 12 GB, Mac M3 Pro 18 GB unificati.
- gemma3:27b
- ≈ 17 GB di VRAM in Q4. RTX 3090/4090 da 24 GB o Mac M3/M4 Max da 36 GB o più. In Q3 (qualità ridotta) entra in 16 GB.
Aggiungi circa da 1 a 4 GB per la cache KV in base alla lunghezza del contesto che utilizzi realmente. Caricare l'intero contesto da 128k di un modello da 27B richiede più VRAM di quella necessaria per il solo modello.
#1. Installazione di Gemma 3 in locale con Ollama
Se Ollama non è ancora installato, segui prima la guida all'installazione di Ollama per il tuo OS. Una volta avviato Ollama, basta un solo comando per scaricare Gemma 3.
Ollama scarica il modello (circa 3,3 GB per la versione 4B in Q4), poi lo avvia direttamente in modalità interattiva. Quando appare il prompt >>>, puoi fare una prova.
Il daemon Ollama ascolta su http://localhost:11434 — puoi collegarti con Open WebUI, LM Studio come client, Continue.dev, o qualsiasi client compatibile con OpenAI.
#2. Supporto multilingue e qualità in francese
Il lavoro di Google sul multilinguismo rimane un vero punto forte di Gemma 3 rispetto ai piccoli modelli incentrati sull'inglese. Il francese è ben rappresentato nel corpus di addestramento: non vedrai quasi mai il modello passare all'inglese durante la risposta, un difetto che rimane ricorrente nei modelli più piccoli. Le generazioni del 2026 (Qwen 3.5, Granite 4.2) hanno recuperato molto terreno sul francese, ma Gemma 3 regge ancora il confronto in questo ambito.
- Gemma 3 4B
- Francese corretto per compiti semplici (riassunto, riformulazione, classificazione). Nella scrittura di testi lunghi, le formulazioni restano a volte poco naturali.
- Gemma 3 12B
- Livello "assistente FR utilizzabile". Buona padronanza della grammatica, vocabolario vario, pochi anglicismi fastidiosi. Paragonabile a Qwen 3.5 9B su questo criterio.
- Gemma 3 27B
- Francese molto buono. Al livello di Mistral Small 24B per la scrittura, leggermente inferiore nel ragionamento formale ma spesso migliore nelle sfumature e nello stile.
#3. Visione multimodale integrata
A partire dalla versione 4B, Gemma 3 accetta immagini in ingresso — non è necessario caricare un modello di visione separato. Lo stesso binario gestisce testo e visione, con un encoder SigLIP integrato. Pratico per l'OCR, la descrizione di immagini o l'analisi di schermate.
Con l'API Python, si passa l'immagine in formato base64 o tramite un percorso locale:
#4. Contesto 128k in pratica
Il contesto da 128k di Gemma 3 (tranne la variante 1B, limitata a 32k) è sufficiente per elaborare un libro breve, un dossier di documentazione completo o trascrizioni di diverse ore. Per impostazione predefinita, Ollama carica un contesto molto più breve (tipicamente 4k o 8k) per risparmiare VRAM — devi estenderlo esplicitamente.
O tramite API, passando l'opzione num_ctx al momento della richiesta :
#Licenza Gemma: cosa bisogna sapere
Gemma 3 NON è sotto licenza Apache 2.0 o MIT come Mistral, Qwen o DeepSeek. Google utilizza la propria licenza: le "Gemma Terms of Use". Permette l'uso commerciale, inclusa la distribuzione di modelli derivati, ma impone due restrizioni che le licenze veramente libere non hanno.
- Politica sugli usi vietati
- Devi rispettare la Gemma Prohibited Use Policy (nessuna generazione di CSAM, nessuna violazione flagrante dei diritti, ecc.). L'elenco può essere modificato unilateralmente da Google.
- Trasmissione delle condizioni
- Se redistribuisci il modello (o un derivato), devi fornire la licenza Gemma ai tuoi utenti e far accettare loro le stesse restrizioni.
- Nessun "copyleft"
- Le tue applicazioni che chiamano Gemma 3 non sono soggette alla licenza. Solo i pesi redistribuiti lo sono.
#Gemma 3 27B vs Llama 4 Scout
I due modelli si posizionano nel segmento "fascia alta accessibile in locale". Per scegliere, bisogna confrontare ciò che li distingue davvero:
- Architettura
- Gemma 3 27B è un modello denso (27 miliardi di parametri tutti attivi). Llama 4 Scout è un MoE (17 miliardi attivi, 109 miliardi totali) — molto più performante a parità di VRAM quando ci sta, ma richiede di poter caricare tutti gli esperti.
- VRAM minima
- Gemma 3 27B Q4: ≈ 17 GB. Llama 4 Scout Q4: ≈ 60 GB (tutti gli esperti caricati). Su una sola RTX 4090, solo Gemma 3 27B entra comodamente in memoria.
- Contesto
- Gemma 3: 128k. Llama 4 Scout: 10M (teorico, più limitato nella pratica). Se elabori davvero più di 128k token, Scout è in vantaggio.
- Visione
- Entrambi sono nativamente multimodali. Qualità comparabile nei compiti di carattere generale.
- FR
- Gemma 3 è leggermente migliore nel francese di uso comune. Llama 4 Scout è più forte nel ragionamento formale e nel codice.
- Licenza
- Gemma Terms of Use vs Llama 4 Community License. Entrambe non conformi ai criteri OSI, entrambe ammissibili per uso commerciale con vincoli specifici.
#Risoluzione dei problemi
- "Out of memory" al caricamento
- VRAM insufficiente per la dimensione scelta. Diminuisci di un livello (gemma3:12b → gemma3:4b) o passa a una quantizzazione più aggressiva (Q4 → Q3). Non forzare l'offload CPU su un modello di 27B: diventa inutilizzabile.
- Immagini rifiutate
- Probabilmente stai usando gemma3:1b, che supporta solo il testo. Passa almeno a gemma3:4b per avere il supporto delle immagini.
- Contesto ignorato oltre i 4k
- Ollama carica un num_ctx predefinito molto breve. Estendilo esplicitamente con /set parameter num_ctx 32768 o tramite l'opzione API options={'num_ctx': 32768}.
- Generazione lenta su 12B/27B con GPU
- Verifica con ollama ps che la colonna PROCESSOR indichi effettivamente 100% GPU. Se vedi una percentuale CPU, significa che la memoria richiesta dal modello e dal contesto supera la VRAM disponibile: riduci num_ctx.
- Risposte troncate
- Aumenta num_predict (il valore predefinito è 128 in alcuni client). Per la CLI di Ollama: /set parameter num_predict 2048.
#Per approfondire
Gemma 3 è un ottimo punto di partenza versatile. Ecco alcune possibilità che si prestano bene a ciò che vuoi farne:
- Confrontare con Gemma 4
- La guida "Gemma 4 in locale con Ollama" mostra l'evoluzione della famiglia e in quali casi vale la pena effettuare l'aggiornamento.
- Scegliere bene la quantizzazione
- La guida "Scegliere la quantizzazione (Q4, Q5, Q8, FP16)" descrive in dettaglio i compromessi che si applicano particolarmente bene alle 4 taglie di Gemma 3.
- Sfruttare la visione in pipeline
- La guida "LLM multimodale con visione in locale" fornisce esempi pratici in Python (OCR, descrizione, analisi) direttamente applicabili a Gemma 3 4B/12B/27B.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.