Principiante 9 minOllama

Gemma 3 (Google) localmente: guida completa 2026

Gemma 3 è la famiglia di modelli open-weight di Google rilasciata a marzo 2025. Quattro dimensioni (1B, 4B, 12B, 27B), visione integrata a partire da 4B, contesto 128k e un solido supporto multilingue che include un francese corretto. Questa guida illustra passo dopo passo l'installazione di Gemma 3 in locale con Ollama, la licenza Google da conoscere e gli ambiti in cui il modello eccelle davvero.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché Gemma 3?

Gemma 3 è la terza iterazione dei modelli open-weight di Google DeepMind, derivati dalla stessa ricerca alla base di Gemini. La famiglia comprende quattro dimensioni molto diverse — da 1B a 27B — che permettono di scegliere esattamente in funzione dell'hardware che hai a disposizione, dal laptop senza GPU alla workstation da 24 GB.

Tre caratteristiche distinguono Gemma 3 dagli altri modelli di questa categoria: un contesto da 128k di serie (solo 32k per la versione 1B), una capacità di visione multimodale integrata già dalla versione 4B senza dover caricare un modello separato e un lavoro esplicito sul multilinguismo (la documentazione di Google dichiara una copertura di oltre 140 lingue per le versioni da 4B in su).

i
In due parole
Gemma 3 = la famiglia "versatile" di Google. Non la più forte in un benchmark specifico, ma una delle più complete: 4 dimensioni, visione, contesto lungo, supporto multilingue. Ideale come modello predefinito su una determinata macchina.

#Le 4 dimensioni di Gemma 3

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Scegliere la dimensione giusta è la decisione più importante. Ecco il mapping tra uso e hardware:

gemma3:1b
Solo testo, contesto 32k. Per l'esecuzione solo su CPU, Raspberry Pi 5 o un Mac M1 con 8 GB. Qualità limitata ma risposte istantanee. Adatto alla classificazione e a brevi riformulazioni.
gemma3:4b
Multimodale (testo + immagine), contesto 128k. Il livello "laptop": trova comodamente spazio in 6 GB di VRAM o su un Mac M2/M3 da 16 GB. Qualità ragionevole per compiti generali.
gemma3:12b
Multimodale, contesto 128k. La fascia "PC mid-range": RTX 3060 12 GB, 4070, M3 Pro 18 GB. Qualità davvero adeguata all'uso quotidiano.
gemma3:27b
Multimodale, contesto 128k. Il livello "workstation": RTX 3090/4090, M3 Max. Il migliore Gemma 3, comparabile a modelli di categoria superiore su molte attività.
→
Se hai dubbi
Inizia con la versione 4B. È il modello più piccolo che include la visione e un contesto da 128k, e funziona praticamente ovunque. Passerai alla versione 12B o 27B una volta che avrai capito se la qualità ti basta.

#Requisiti VRAM (quantizzazione Q4_K_M)

gemma3:1b
≈ 1 GB di VRAM o RAM. Funziona su qualsiasi macchina, anche su un Raspberry Pi 5.
gemma3:4b
≈ 3 GB di VRAM. RTX 3050 6 GB, GTX 1660 6 GB, MacBook Air M2 8 GB sono sufficienti.
gemma3:12b
≈ 8 GB di VRAM. RTX 3060 12 GB, RTX 4070 12 GB, Mac M3 Pro 18 GB unificati.
gemma3:27b
≈ 17 GB di VRAM in Q4. RTX 3090/4090 da 24 GB o Mac M3/M4 Max da 36 GB o più. In Q3 (qualità ridotta) entra in 16 GB.

Aggiungi circa da 1 a 4 GB per la cache KV in base alla lunghezza del contesto che utilizzi realmente. Caricare l'intero contesto da 128k di un modello da 27B richiede più VRAM di quella necessaria per il solo modello.

#1. Installazione di Gemma 3 in locale con Ollama

Se Ollama non è ancora installato, segui prima la guida all'installazione di Ollama per il tuo OS. Una volta avviato Ollama, basta un solo comando per scaricare Gemma 3.

Terminale
ollama run gemma3:4b

Ollama scarica il modello (circa 3,3 GB per la versione 4B in Q4), poi lo avvia direttamente in modalità interattiva. Quando appare il prompt >>>, puoi fare una prova.

Pull senza avvio
ollama pull gemma3:1b
ollama pull gemma3:4b
ollama pull gemma3:12b
ollama pull gemma3:27b

Il daemon Ollama ascolta su http://localhost:11434 — puoi collegarti con Open WebUI, LM Studio come client, Continue.dev, o qualsiasi client compatibile con OpenAI.

→
Scegliere la quantizzazione giusta
L'etichetta predefinita (es: gemma3:12b) punta su Q4_K_M, il migliore compromesso qualità/memoria per la maggior parte degli usi. Per una qualità maggiore a costo di più VRAM, usa gemma3:12b-it-q5_K_M o q8_0.

#2. Supporto multilingue e qualità in francese

Il lavoro di Google sul multilinguismo rimane un vero punto forte di Gemma 3 rispetto ai piccoli modelli incentrati sull'inglese. Il francese è ben rappresentato nel corpus di addestramento: non vedrai quasi mai il modello passare all'inglese durante la risposta, un difetto che rimane ricorrente nei modelli più piccoli. Le generazioni del 2026 (Qwen 3.5, Granite 4.2) hanno recuperato molto terreno sul francese, ma Gemma 3 regge ancora il confronto in questo ambito.

Gemma 3 4B
Francese corretto per compiti semplici (riassunto, riformulazione, classificazione). Nella scrittura di testi lunghi, le formulazioni restano a volte poco naturali.
Gemma 3 12B
Livello "assistente FR utilizzabile". Buona padronanza della grammatica, vocabolario vario, pochi anglicismi fastidiosi. Paragonabile a Qwen 3.5 9B su questo criterio.
Gemma 3 27B
Francese molto buono. Al livello di Mistral Small 24B per la scrittura, leggermente inferiore nel ragionamento formale ma spesso migliore nelle sfumature e nello stile.
Test rapido in FR
>>> Résume en 3 points clés les enjeux de la souveraineté numérique européenne.

1. **Dépendance technologique** : 80% du cloud européen repose sur trois acteurs américains...
2. **Conformité réglementaire** : le RGPD et l'AI Act créent un cadre que les fournisseurs hors-UE...
3. **Capacité industrielle** : la course aux semi-conducteurs et aux modèles d'IA...

#3. Visione multimodale integrata

A partire dalla versione 4B, Gemma 3 accetta immagini in ingresso — non è necessario caricare un modello di visione separato. Lo stesso binario gestisce testo e visione, con un encoder SigLIP integrato. Pratico per l'OCR, la descrizione di immagini o l'analisi di schermate.

CLI Ollama con immagine
ollama run gemma3:12b
>>> Décris cette capture d'écran et identifie les éléments d'interface : /chemin/vers/screenshot.png

Con l'API Python, si passa l'immagine in formato base64 o tramite un percorso locale:

API Python Ollama
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{
        'role': 'user',
        'content': 'Extrais le texte visible sur cette facture.',
        'images': ['/chemin/vers/facture.jpg'],
    }]
)
print(response['message']['content'])
i
Qualità delle capacità visive: aspettative realistiche
Gemma 3 vision offre risultati discreti nella descrizione generale, nell'OCR di documenti puliti e nella lettura di interfacce. Per l'OCR su foto sfocate o testi manoscritti, un modello di visione più recente e più grande come Qwen 3.8 27B (visione) resta migliore. Per il ragionamento spaziale complesso (contare oggetti, comprendere uno schema tecnico), tutto resta migliorabile — questo vale per tutti gli LLM open-weight.

#4. Contesto 128k in pratica

Il contesto da 128k di Gemma 3 (tranne la variante 1B, limitata a 32k) è sufficiente per elaborare un libro breve, un dossier di documentazione completo o trascrizioni di diverse ore. Per impostazione predefinita, Ollama carica un contesto molto più breve (tipicamente 4k o 8k) per risparmiare VRAM — devi estenderlo esplicitamente.

Estendere il contesto in CLI
ollama run gemma3:12b
>>> /set parameter num_ctx 32768

O tramite API, passando l'opzione num_ctx al momento della richiesta :

Contesto esteso tramite API
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{'role': 'user', 'content': 'Résume ce document : ...'}],
    options={'num_ctx': 32768},
)
!
Il contesto consuma VRAM
Ogni token di contesto occupa memoria per la cache KV. Passare da 8k a 128k su un 12B può aumentare di 4–6 GB il consumo di VRAM. Se saturi la VRAM, il modello passa all'offload sulla CPU e la velocità crolla. Aumenta progressivamente il contesto: 16k → 32k → 64k secondo le tue effettive esigenze.

#Licenza Gemma: cosa bisogna sapere

Gemma 3 NON è sotto licenza Apache 2.0 o MIT come Mistral, Qwen o DeepSeek. Google utilizza la propria licenza: le "Gemma Terms of Use". Permette l'uso commerciale, inclusa la distribuzione di modelli derivati, ma impone due restrizioni che le licenze veramente libere non hanno.

Politica sugli usi vietati
Devi rispettare la Gemma Prohibited Use Policy (nessuna generazione di CSAM, nessuna violazione flagrante dei diritti, ecc.). L'elenco può essere modificato unilateralmente da Google.
Trasmissione delle condizioni
Se redistribuisci il modello (o un derivato), devi fornire la licenza Gemma ai tuoi utenti e far accettare loro le stesse restrizioni.
Nessun "copyleft"
Le tue applicazioni che chiamano Gemma 3 non sono soggette alla licenza. Solo i pesi redistribuiti lo sono.
!
Per un uso professionale
Per un semplice utilizzo in un SaaS interno o in un prodotto (l'utente finale non vede mai i pesi), Gemma 3 è utilizzabile senza problemi. Per pubblicare un fine-tune o integrare Gemma 3 in un prodotto open-source distribuito con i pesi, leggi prima la licenza: la differenza rispetto a una vera licenza permissiva diventa significativa. Da notare: Google ha reso disponibile la generazione successiva, Gemma 4, con licenza Apache 2.0 (aprile 2026); se la redistribuzione dei pesi è importante per te, questa licenza elimina proprio tale vincolo.

#Gemma 3 27B vs Llama 4 Scout

I due modelli si posizionano nel segmento "fascia alta accessibile in locale". Per scegliere, bisogna confrontare ciò che li distingue davvero:

Architettura
Gemma 3 27B è un modello denso (27 miliardi di parametri tutti attivi). Llama 4 Scout è un MoE (17 miliardi attivi, 109 miliardi totali) — molto più performante a parità di VRAM quando ci sta, ma richiede di poter caricare tutti gli esperti.
VRAM minima
Gemma 3 27B Q4: ≈ 17 GB. Llama 4 Scout Q4: ≈ 60 GB (tutti gli esperti caricati). Su una sola RTX 4090, solo Gemma 3 27B entra comodamente in memoria.
Contesto
Gemma 3: 128k. Llama 4 Scout: 10M (teorico, più limitato nella pratica). Se elabori davvero più di 128k token, Scout è in vantaggio.
Visione
Entrambi sono nativamente multimodali. Qualità comparabile nei compiti di carattere generale.
FR
Gemma 3 è leggermente migliore nel francese di uso comune. Llama 4 Scout è più forte nel ragionamento formale e nel codice.
Licenza
Gemma Terms of Use vs Llama 4 Community License. Entrambe non conformi ai criteri OSI, entrambe ammissibili per uso commerciale con vincoli specifici.
→
Verdetto
Su una sola GPU da 24 GB: Gemma 3 27B. Su un Mac Studio Ultra o una configurazione multi-GPU: Llama 4 Scout diventa una scelta pertinente per i vantaggi del MoE. Molti utenti tengono entrambi installati e passano dall'uno all'altro in base all'attività.

#Risoluzione dei problemi

"Out of memory" al caricamento
VRAM insufficiente per la dimensione scelta. Diminuisci di un livello (gemma3:12b → gemma3:4b) o passa a una quantizzazione più aggressiva (Q4 → Q3). Non forzare l'offload CPU su un modello di 27B: diventa inutilizzabile.
Immagini rifiutate
Probabilmente stai usando gemma3:1b, che supporta solo il testo. Passa almeno a gemma3:4b per avere il supporto delle immagini.
Contesto ignorato oltre i 4k
Ollama carica un num_ctx predefinito molto breve. Estendilo esplicitamente con /set parameter num_ctx 32768 o tramite l'opzione API options={'num_ctx': 32768}.
Generazione lenta su 12B/27B con GPU
Verifica con ollama ps che la colonna PROCESSOR indichi effettivamente 100% GPU. Se vedi una percentuale CPU, significa che la memoria richiesta dal modello e dal contesto supera la VRAM disponibile: riduci num_ctx.
Risposte troncate
Aumenta num_predict (il valore predefinito è 128 in alcuni client). Per la CLI di Ollama: /set parameter num_predict 2048.

#Per approfondire

Gemma 3 è un ottimo punto di partenza versatile. Ecco alcune possibilità che si prestano bene a ciò che vuoi farne:

Confrontare con Gemma 4
La guida "Gemma 4 in locale con Ollama" mostra l'evoluzione della famiglia e in quali casi vale la pena effettuare l'aggiornamento.
Scegliere bene la quantizzazione
La guida "Scegliere la quantizzazione (Q4, Q5, Q8, FP16)" descrive in dettaglio i compromessi che si applicano particolarmente bene alle 4 taglie di Gemma 3.
Sfruttare la visione in pipeline
La guida "LLM multimodale con visione in locale" fornisce esempi pratici in Python (OCR, descrizione, analisi) direttamente applicabili a Gemma 3 4B/12B/27B.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.