gpt-oss in locale: i modelli open-weights di OpenAI con Ollama
OpenAI ha finalmente pubblicato pesi aperti: gpt-oss-20b e gpt-oss-120b, due modelli con architettura mixture of experts sotto licenza Apache 2.0. Questa guida mostra come eseguire gpt-oss con Ollama, quanta VRAM richiede ogni versione, come funziona la quantizzazione MXFP4 nativa e come regolare lo sforzo di ragionamento. Concludiamo valutando quanto valgono davvero questi modelli a pesi aperti rispetto a Qwen e DeepSeek.
#Perché gpt-oss cambia le cose
Per anni OpenAI ha mantenuto i suoi modelli chiusi. Con gpt-oss l'azienda torna per la prima volta dai tempi di GPT-2 a rendere i pesi realmente scaricabili, questa volta con licenza Apache 2.0: uso commerciale consentito, nessuna clausola di condivisione obbligatoria, nessun limite al numero di utenti. Scarichi i pesi, questi vengono eseguiti sulla tua macchina e nulla esce dalla tua rete.
Tecnicamente, gpt-oss si basa su un'architettura MoE (Mixture of Experts): il modello contiene molti parametri in totale, ma ne attiva solo una piccola frazione per ogni token. Risultato: una qualità vicina a quella di un grande modello denso, con il consumo di memoria e la velocità di un modello molto più piccolo. Le due versioni puntano sul ragionamento, sulla chiamata di strumenti e sulla capacità di seguire le istruzioni, con un contesto di 128k token.
- gpt-oss-20b
- ≈ 21 miliardi di parametri in totale, ≈ 3,6 miliardi attivi per token. Progettato per una sola scheda consumer da 16 GB.
- gpt-oss-120b
- ≈ 117 miliardi di parametri in totale, ≈ 5,1 miliardi attivi per token. È pensato per una scheda da data center con 80 GB o una macchina con una grande quantità di memoria unificata.
- Licenza
- Apache 2.0 — utilizzabile a fini commerciali, redistribuibile e sottoponibile a fine-tuning senza restrizioni d'uso.
- Quantizzazione
- MXFP4 nativo sui pesi degli esperti: il formato a 4 bit fa parte della pubblicazione, non di una conversione approssimativa effettuata da terzi.
#gpt-oss ollama : 20b o 120b ?
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La scelta dipende quasi esclusivamente dal tuo hardware. I due modelli appartengono alla stessa famiglia e usano lo stesso formato per le risposte; la differenza di qualità esiste, ma resta secondaria rispetto alla domanda «ci sta nella mia VRAM?». Ecco un semplice criterio di riferimento.
- 20b — la scelta predefinita ragionevole
- Intorno a 14-16 GB una volta caricato in MXFP4. Funziona su una RTX 4080 16 GB o su una RTX 4090, e su un Mac Apple Silicon a partire da 24 GB di memoria unificata. È la versione da installare per prima.
- 120b — quando hai abbastanza memoria
- Circa 60-65 GB in MXFP4. È pensato per una GPU da 80 GB (classe H100/A100), una workstation multi-GPU o un Mac con molta memoria unificata (M3/M5 Ultra da 96 GB in su). Non ha senso provarlo con meno di 64 GB di memoria disponibile per il modello.
- Qualità relativa
- Il 120b aumenta il divario nel ragionamento in più passaggi, nel codice lungo e nei compiti ambigui. Per le domande e risposte di uso comune e per il francese, il 20b se la cava già molto bene.
#Prerequisiti
Niente di esotico: un'installazione di Ollama aggiornata e abbastanza memoria per la versione desiderata. Ollama gestisce autonomamente il download, la quantizzazione MXFP4 e l'offload tra GPU e CPU.
- Ollama recente
- Una versione che supporta gpt-oss e MXFP4. Aggiorna prima di iniziare: le versioni troppo vecchie non riconoscono il formato.
- VRAM / memoria unificata
- ≥ 16 GB per il 20b, ≥ 64 GB per il 120b. Al di sotto di queste soglie, Ollama trasferirà parte del modello nella RAM della CPU e la velocità crollerà.
- Spazio su disco
- ≈ 12-14 GB per il 20b, ≈ 60-65 GB per il 120b. I pesi sono memorizzati nella cartella dei modelli Ollama.
- Demone in ascolto
- Ollama espone la sua API su http://localhost:11434 per impostazione predefinita — utile per collegarvi Open WebUI o il tuo codice.
#Installare gpt-oss-20b con un solo comando
La versione 20b si installa e si avvia in una sola riga. Ollama scarica i pesi MXFP4, li carica sulla GPU e apre una sessione di chat.
Al primo avvio, metti in conto il tempo necessario per scaricare circa 13 GB. Successivamente il modello rimane in cache. Per scaricare solo i pesi senza aprire una sessione interattiva, usa pull.
Nell'output di ollama ps, dovresti vedere una percentuale GPU elevata. Se la colonna mostra « 100% CPU », significa che il modello non è entrato interamente in VRAM e parte è stata trasferita nella RAM di sistema: la generazione sarà lenta. Su una RTX 4090, aspettati una velocità adeguata all'uso interattivo; su una 4080 da 16 GB, il 20b entra in VRAM, ma senza margine per un contesto ampio.
Per controllare il modello tramite API anziché in chat, l'endpoint è già disponibile. Ecco una chiamata minima.
#Il 120b, per quali macchine
Il comando è identico, cambia solo il tag. Ma eseguilo solo se disponi davvero della memoria necessaria: sotto i 64 GB, Ollama sposterà parte degli esperti sulla CPU e otterrai al massimo qualche token al secondo.
- 01Verificare la memoria disponibileCon una GPU NVIDIA, nvidia-smi deve mostrare una scheda da 80 GB (o più schede con una quantità complessiva di VRAM sufficiente). Su Mac, una memoria unificata di almeno 96 GB lascia margine per il modello e il sistema.
- 02Eseguire il pullIl download è considerevole (~60 GB): assicurati di avere una connessione con una larghezza di banda adeguata e spazio su disco sufficiente. Il formato MXFP4 evita di dover riquantizzare da soli.
- 03Controllare il posizionamentoDopo ollama run, eseguire ollama ps in un altro terminale conferma la percentuale del modello caricata sulla GPU. Un offload massiccio sulla CPU = memoria insufficiente: torna al 20b.
- 04Regolare il contestoIl 120b accetta 128k token, ma un contesto pieno consuma molta memoria aggiuntiva. Riduci num_ctx se hai poca VRAM a disposizione.
#Regolare lo sforzo di ragionamento
Una particolarità di gpt-oss: i modelli producono una catena di ragionamento prima della risposta, e puoi regolare questo sforzo. Tre livelli — low, medium, high — bilanciano velocità e profondità. Con uno sforzo basso, il modello risponde rapidamente ai compiti semplici; con uno sforzo alto, ragiona più a lungo su matematica, codice o logica in più passaggi.
L'impostazione si definisce nel messaggio di sistema. Indica il livello desiderato e il modello regola la lunghezza della sua riflessione interna.
- Reasoning: low
- Risposte rapide, poco ragionamento visibile. Ideale per riformulazioni, brevi riassunti e domande fattuali.
- Reasoning: medium
- Buon compromesso predefinito: un po' di ragionamento senza far aumentare eccessivamente la latenza.
- Reasoning: high
- Pensiero approfondito, migliore sui problemi complessi — a costo di una generazione più lunga e di più token consumati.
#Punti forti e debolezze rispetto a Qwen e DeepSeek
gpt-oss arriva su un terreno già occupato da modelli open-weights molto validi. Ecco dove si distingue e dove resta indietro, senza indulgenza.
- Punti di forza
- Ragionamento e chiamate agli strumenti ben curati, livello di impegno regolabile, licenza Apache 2.0 senza ambiguità e un consumo di memoria contenuto grazie a MoE + MXFP4. Il 20b offre un eccellente rapporto qualità/VRAM su una sola scheda da 16 GB.
- A confronto con Qwen3
- Qwen resta spesso in vantaggio nelle prestazioni multilingue e in francese, con una gamma di dimensioni più ampia (dal 4B ai grandi MoE). gpt-oss compensa con la qualità della sua catena di ragionamento e la precisione con cui segue le istruzioni.
- Confronto con DeepSeek
- I modelli di ragionamento DeepSeek (R1 e V3.2) si spingono oltre sui problemi molto difficili, ma richiedono molto più hardware per le loro versioni più grandi. Il 20b di gpt-oss punta a un'esecuzione locale accessibile, mentre DeepSeek V3.2 punta alla fascia alta.
- Debolezza da conoscere
- Il francese non è la priorità di gpt-oss: la qualità in francese è buona, ma leggermente inferiore a quella in inglese e talvolta a quella di Qwen. Provalo con i tuoi prompt prima di decidere.
#Risoluzione dei problemi
- « unknown model » o formato non riconosciuto
- La tua versione di Ollama è troppo vecchia per MXFP4. Aggiornala a una versione recente, poi esegui nuovamente il pull.
- Generazione molto lenta sul 20b
- ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
- Il 120b va in crash o è terribilmente lento
- Memoria insufficiente. Sotto i 64 GB realmente disponibili per il modello, resta sul 20b — il 120b non è fatto per la tua macchina.
- Risposte troppo lente nell'uso quotidiano
- Riduci lo sforzo di ragionamento a low o medium nel messaggio di sistema: high consuma enormi quantità di token di riflessione.
- Contesto che fa esplodere il consumo di VRAM
- 128k token richiedono molta memoria. Imposta num_ctx a un valore ragionevole (ad es. 8192) per i tuoi utilizzi quotidiani.
#Per approfondire
Una volta installato gpt-oss, queste guide del sito ti aiutano a perfezionare il tuo stack locale e a confrontare i modelli:
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per capire dove si colloca MXFP4 rispetto ai formati GGUF classici e valutare il compromesso tra qualità e memoria per gli altri tuoi modelli.
- Scegliere la GPU per l'IA locale
- La guida all'acquisto 2026 per scegliere una scheda adeguata a seconda che tu punti al 20b su 16 GB o a modelli più esigenti in termini di risorse.
- Installare DeepSeek R1 con Ollama
- Il confronto diretto sul piano del ragionamento: installa R1 e valutalo fianco a fianco con gpt-oss.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.