Intermedio 10 minOpenAI

gpt-oss in locale: i modelli open-weights di OpenAI con Ollama

OpenAI ha finalmente pubblicato pesi aperti: gpt-oss-20b e gpt-oss-120b, due modelli con architettura mixture of experts sotto licenza Apache 2.0. Questa guida mostra come eseguire gpt-oss con Ollama, quanta VRAM richiede ogni versione, come funziona la quantizzazione MXFP4 nativa e come regolare lo sforzo di ragionamento. Concludiamo valutando quanto valgono davvero questi modelli a pesi aperti rispetto a Qwen e DeepSeek.

Di Clara M.·Agg. 2026-07-24·Testato su Windows, macOS e Linux

#Perché gpt-oss cambia le cose

Per anni OpenAI ha mantenuto i suoi modelli chiusi. Con gpt-oss l'azienda torna per la prima volta dai tempi di GPT-2 a rendere i pesi realmente scaricabili, questa volta con licenza Apache 2.0: uso commerciale consentito, nessuna clausola di condivisione obbligatoria, nessun limite al numero di utenti. Scarichi i pesi, questi vengono eseguiti sulla tua macchina e nulla esce dalla tua rete.

Tecnicamente, gpt-oss si basa su un'architettura MoE (Mixture of Experts): il modello contiene molti parametri in totale, ma ne attiva solo una piccola frazione per ogni token. Risultato: una qualità vicina a quella di un grande modello denso, con il consumo di memoria e la velocità di un modello molto più piccolo. Le due versioni puntano sul ragionamento, sulla chiamata di strumenti e sulla capacità di seguire le istruzioni, con un contesto di 128k token.

gpt-oss-20b
≈ 21 miliardi di parametri in totale, ≈ 3,6 miliardi attivi per token. Progettato per una sola scheda consumer da 16 GB.
gpt-oss-120b
≈ 117 miliardi di parametri in totale, ≈ 5,1 miliardi attivi per token. È pensato per una scheda da data center con 80 GB o una macchina con una grande quantità di memoria unificata.
Licenza
Apache 2.0 — utilizzabile a fini commerciali, redistribuibile e sottoponibile a fine-tuning senza restrizioni d'uso.
Quantizzazione
MXFP4 nativo sui pesi degli esperti: il formato a 4 bit fa parte della pubblicazione, non di una conversione approssimativa effettuata da terzi.

#gpt-oss ollama : 20b o 120b ?

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La scelta dipende quasi esclusivamente dal tuo hardware. I due modelli appartengono alla stessa famiglia e usano lo stesso formato per le risposte; la differenza di qualità esiste, ma resta secondaria rispetto alla domanda «ci sta nella mia VRAM?». Ecco un semplice criterio di riferimento.

20b — la scelta predefinita ragionevole
Intorno a 14-16 GB una volta caricato in MXFP4. Funziona su una RTX 4080 16 GB o su una RTX 4090, e su un Mac Apple Silicon a partire da 24 GB di memoria unificata. È la versione da installare per prima.
120b — quando hai abbastanza memoria
Circa 60-65 GB in MXFP4. È pensato per una GPU da 80 GB (classe H100/A100), una workstation multi-GPU o un Mac con molta memoria unificata (M3/M5 Ultra da 96 GB in su). Non ha senso provarlo con meno di 64 GB di memoria disponibile per il modello.
Qualità relativa
Il 120b aumenta il divario nel ragionamento in più passaggi, nel codice lungo e nei compiti ambigui. Per le domande e risposte di uso comune e per il francese, il 20b se la cava già molto bene.
i
MoE: pochi parametri attivi, ma tutta la memoria
L'architettura MoE riduce il calcolo per token, non l'impronta di memoria: tutti gli esperti devono essere caricati in VRAM anche se solo un gruppo lavora in ogni passaggio. È per questo che il 120b richiede circa 65 GB anche se attiva solo circa 5 B di parametri.

#Prerequisiti

Niente di esotico: un'installazione di Ollama aggiornata e abbastanza memoria per la versione desiderata. Ollama gestisce autonomamente il download, la quantizzazione MXFP4 e l'offload tra GPU e CPU.

Ollama recente
Una versione che supporta gpt-oss e MXFP4. Aggiorna prima di iniziare: le versioni troppo vecchie non riconoscono il formato.
VRAM / memoria unificata
≥ 16 GB per il 20b, ≥ 64 GB per il 120b. Al di sotto di queste soglie, Ollama trasferirà parte del modello nella RAM della CPU e la velocità crollerà.
Spazio su disco
≈ 12-14 GB per il 20b, ≈ 60-65 GB per il 120b. I pesi sono memorizzati nella cartella dei modelli Ollama.
Demone in ascolto
Ollama espone la sua API su http://localhost:11434 per impostazione predefinita — utile per collegarvi Open WebUI o il tuo codice.
→
Non hai ancora Ollama?
Segui prima la guida all'installazione di Ollama per il tuo sistema operativo (Windows, macOS o Linux), poi torna qui. Il resto di questa guida presuppone che il comando ollama risponda nel tuo terminale.

#Installare gpt-oss-20b con un solo comando

La versione 20b si installa e si avvia in una sola riga. Ollama scarica i pesi MXFP4, li carica sulla GPU e apre una sessione di chat.

Terminale
# Télécharge et lance gpt-oss-20b
ollama run gpt-oss:20b

Al primo avvio, metti in conto il tempo necessario per scaricare circa 13 GB. Successivamente il modello rimane in cache. Per scaricare solo i pesi senza aprire una sessione interattiva, usa pull.

Terminale
# Récupérer sans lancer le chat
ollama pull gpt-oss:20b

# Vérifier que le modèle est présent
ollama list

# Voir s'il tourne bien sur le GPU
ollama ps

Nell'output di ollama ps, dovresti vedere una percentuale GPU elevata. Se la colonna mostra « 100% CPU », significa che il modello non è entrato interamente in VRAM e parte è stata trasferita nella RAM di sistema: la generazione sarà lenta. Su una RTX 4090, aspettati una velocità adeguata all'uso interattivo; su una 4080 da 16 GB, il 20b entra in VRAM, ma senza margine per un contesto ampio.

Per controllare il modello tramite API anziché in chat, l'endpoint è già disponibile. Ecco una chiamata minima.

API — generazione
curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Explique la quantification MXFP4 en trois phrases.",
  "stream": false
}'

#Il 120b, per quali macchine

Il comando è identico, cambia solo il tag. Ma eseguilo solo se disponi davvero della memoria necessaria: sotto i 64 GB, Ollama sposterà parte degli esperti sulla CPU e otterrai al massimo qualche token al secondo.

Terminale
# ~60-65 Go de mémoire nécessaires
ollama pull gpt-oss:120b
ollama run gpt-oss:120b
  1. 01
    Verificare la memoria disponibile
    Con una GPU NVIDIA, nvidia-smi deve mostrare una scheda da 80 GB (o più schede con una quantità complessiva di VRAM sufficiente). Su Mac, una memoria unificata di almeno 96 GB lascia margine per il modello e il sistema.
  2. 02
    Eseguire il pull
    Il download è considerevole (~60 GB): assicurati di avere una connessione con una larghezza di banda adeguata e spazio su disco sufficiente. Il formato MXFP4 evita di dover riquantizzare da soli.
  3. 03
    Controllare il posizionamento
    Dopo ollama run, eseguire ollama ps in un altro terminale conferma la percentuale del modello caricata sulla GPU. Un offload massiccio sulla CPU = memoria insufficiente: torna al 20b.
  4. 04
    Regolare il contesto
    Il 120b accetta 128k token, ma un contesto pieno consuma molta memoria aggiuntiva. Riduci num_ctx se hai poca VRAM a disposizione.
!
Multi-GPU con schede consumer: attenzione alle aspettative
Combinare due RTX 4090 (48 GB) non basta per il 120b, e la condivisione tra GPU tramite PCIe aggiunge latenza. Per questo modello, una sola scheda da 80 GB o una memoria unificata capiente offre un funzionamento molto più fluido di una configurazione multi-scheda improvvisata.

#Regolare lo sforzo di ragionamento

Una particolarità di gpt-oss: i modelli producono una catena di ragionamento prima della risposta, e puoi regolare questo sforzo. Tre livelli — low, medium, high — bilanciano velocità e profondità. Con uno sforzo basso, il modello risponde rapidamente ai compiti semplici; con uno sforzo alto, ragiona più a lungo su matematica, codice o logica in più passaggi.

L'impostazione si definisce nel messaggio di sistema. Indica il livello desiderato e il modello regola la lunghezza della sua riflessione interna.

API — sforzo elevato
curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [
    { "role": "system", "content": "Reasoning: high" },
    { "role": "user", "content": "Résous : un train part à 14h à 120 km/h, un autre à 15h à 150 km/h. Quand se rejoignent-ils ?" }
  ],
  "stream": false
}'
Reasoning: low
Risposte rapide, poco ragionamento visibile. Ideale per riformulazioni, brevi riassunti e domande fattuali.
Reasoning: medium
Buon compromesso predefinito: un po' di ragionamento senza far aumentare eccessivamente la latenza.
Reasoning: high
Pensiero approfondito, migliore sui problemi complessi — a costo di una generazione più lunga e di più token consumati.
→
Il ragionamento ha un costo in token
Un livello di ragionamento « high » moltiplica i token di riflessione prima della risposta finale. Nei compiti semplici, mantenere « low » o « medium » riduce nettamente il tempo di risposta senza perdita di qualità percepita.

#Punti forti e debolezze rispetto a Qwen e DeepSeek

gpt-oss arriva su un terreno già occupato da modelli open-weights molto validi. Ecco dove si distingue e dove resta indietro, senza indulgenza.

Punti di forza
Ragionamento e chiamate agli strumenti ben curati, livello di impegno regolabile, licenza Apache 2.0 senza ambiguità e un consumo di memoria contenuto grazie a MoE + MXFP4. Il 20b offre un eccellente rapporto qualità/VRAM su una sola scheda da 16 GB.
A confronto con Qwen3
Qwen resta spesso in vantaggio nelle prestazioni multilingue e in francese, con una gamma di dimensioni più ampia (dal 4B ai grandi MoE). gpt-oss compensa con la qualità della sua catena di ragionamento e la precisione con cui segue le istruzioni.
Confronto con DeepSeek
I modelli di ragionamento DeepSeek (R1 e V3.2) si spingono oltre sui problemi molto difficili, ma richiedono molto più hardware per le loro versioni più grandi. Il 20b di gpt-oss punta a un'esecuzione locale accessibile, mentre DeepSeek V3.2 punta alla fascia alta.
Debolezza da conoscere
Il francese non è la priorità di gpt-oss: la qualità in francese è buona, ma leggermente inferiore a quella in inglese e talvolta a quella di Qwen. Provalo con i tuoi prompt prima di decidere.

#Risoluzione dei problemi

« unknown model » o formato non riconosciuto
La tua versione di Ollama è troppo vecchia per MXFP4. Aggiornala a una versione recente, poi esegui nuovamente il pull.
Generazione molto lenta sul 20b
ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
Il 120b va in crash o è terribilmente lento
Memoria insufficiente. Sotto i 64 GB realmente disponibili per il modello, resta sul 20b — il 120b non è fatto per la tua macchina.
Risposte troppo lente nell'uso quotidiano
Riduci lo sforzo di ragionamento a low o medium nel messaggio di sistema: high consuma enormi quantità di token di riflessione.
Contesto che fa esplodere il consumo di VRAM
128k token richiedono molta memoria. Imposta num_ctx a un valore ragionevole (ad es. 8192) per i tuoi utilizzi quotidiani.

#Per approfondire

Una volta installato gpt-oss, queste guide del sito ti aiutano a perfezionare il tuo stack locale e a confrontare i modelli:

Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per capire dove si colloca MXFP4 rispetto ai formati GGUF classici e valutare il compromesso tra qualità e memoria per gli altri tuoi modelli.
Scegliere la GPU per l'IA locale
La guida all'acquisto 2026 per scegliere una scheda adeguata a seconda che tu punti al 20b su 16 GB o a modelli più esigenti in termini di risorse.
Installare DeepSeek R1 con Ollama
Il confronto diretto sul piano del ragionamento: installa R1 e valutalo fianco a fianco con gpt-oss.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.