Intermedio 10 minNVIDIA

Nemotron 3 in locale: i modelli NVIDIA con Ollama

NVIDIA non produce soltanto GPU: l'azienda esegue anche il post-addestramento dei propri LLM, la famiglia Nemotron. Questa guida mostra come installare Nemotron 3 in locale con Ollama, quali varianti (Nano, Super) scegliere in base alla tua VRAM, cosa NVIDIA ottimizza diversamente dagli altri — ragionamento controllabile e uso agentico — e quando conviene usare questi modelli rispetto ai Qwen3 equivalenti.

Di Clara M.·Agg. 2026-07-28·Testato su Windows, macOS e Linux

#Perché Nemotron piuttosto che un altro modello

Nemotron non è un modello addestrato da zero. NVIDIA parte da solide basi open-weight (Llama o Qwen, a seconda delle versioni), poi applica la propria ricetta di post-addestramento: potatura (pruning) per ridurre le dimensioni, distillazione per recuperare la qualità persa e un fine-tuning massiccio orientato al ragionamento, alla matematica, al codice e alle chiamate a strumenti. Il risultato mira a un obiettivo preciso: il miglior rapporto qualità/costo di calcolo per i compiti degli agenti, non per la conversazione generalista.

L'altra particolarità è che NVIDIA ottimizza questi modelli per il proprio hardware e le proprie pipeline di inferenza. In pratica, questo si traduce in buone velocità di elaborazione sulle GPU NVIDIA e in una famiglia progettata come una gamma coerente: una versione piccola per le schede destinate al grande pubblico, una versione media per le workstation, una versione gigante per i server. Scegli in base alla VRAM disponibile senza cambiare la logica dei prompt.

i
Nemotron è un Llama/Qwen migliorato
Se conosci già Llama o Qwen in locale, Nemotron si comporta in modo familiare: stesso formato di chat, stesse quantizzazioni GGUF. La differenza sta nel post-addestramento NVIDIA, non in un'architettura esotica.

#Nano, Super e Ultra: quale variante

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

La serie Nemotron 3 si presenta in tre dimensioni, ciascuna adatta a una categoria di macchina. Il nome indica la destinazione più che il numero esatto di parametri.

Nano (~8-9B)
La versione per schede video consumer. Entra comodamente in memoria su una RTX 3060 da 12 GB o su qualsiasi GPU con almeno 8 GB di VRAM in Q4. È il punto di partenza ideale per provare Nemotron e per gli agenti leggeri.
Super (~49B)
La versione per workstation e GPU di grandi dimensioni. Punta alla qualità di un modello 70B con un costo computazionale inferiore, grazie al pruning di NVIDIA. Richiede una RTX 4090 da 24 GB (in Q4, con poco margine) o, meglio, una scheda da 32-48 GB.
Ultra (~253B)
La versione server, fuori dalla portata di un computer di fascia consumer. Riservata alle workstation multi-GPU o ai data center. Menzionata qui per illustrare la gamma, non per un normale uso locale.

Per un uso locale, la scelta reale si fa tra Nano e Super. Nano se hai una scheda da 8 a 16 GB o se la velocità è prioritaria. Super se hai 24 GB o più e cerchi la qualità massima nel ragionamento o nel codice complesso.

#Requisiti e VRAM per variante

Come per ogni modello eseguito in locale, la VRAM è il fattore limitante. Ecco i valori di riferimento con la quantizzazione Q4_K_M, quella consigliata come scelta predefinita perché offre il miglior compromesso tra qualità e memoria. Prevedi sempre un margine per la finestra di contesto, che consuma memoria oltre a quella occupata dai pesi.

Nemotron Nano (~9B) — Q4
≈ 6-7 GB di VRAM. Comodo su RTX 3060 12 GB, RTX 4070 12 GB, o un Mac Apple Silicon a partire da 16 GB di memoria unificata.
Nemotron Super (~49B) — Q4
≈ 28-30 GB. Non entra in una sola RTX 4090 da 24 GB senza offload: prevedi una scheda da 32 GB o più, due GPU oppure un Mac M4 Pro/Max con 48 GB di memoria unificata.
Nemotron Super — Q5/Q8
Q5_K_M arriva a circa 35 GB, Q8_0 supera i 50 GB. Riservato alle configurazioni con molta VRAM o più GPU.
Margine per il contesto
Aggiungi da 1 a 4 GB in base alla lunghezza del contesto desiderata. Un contesto lungo durante il ragionamento genera molti token intermedi, quindi aumenta l'occupazione di memoria.
→
Verificare cosa entra davvero in memoria
Dopo un «ollama run», esegui «ollama ps» in un altro terminale. La colonna PROCESSOR indica «100% GPU» se tutto è in VRAM, oppure una ripartizione «GPU/CPU» se Ollama ha dovuto caricare parte del modello nella RAM di sistema — in tal caso la velocità cala drasticamente. È il segnale che bisogna passare a un modello di taglia inferiore o scendere di un livello di quantizzazione.

Sul piano software, il requisito è minimo: il daemon Ollama installato, che per impostazione predefinita è in ascolto su http://localhost:11434. Se usi una GPU NVIDIA, assicurati che i driver CUDA siano aggiornati; Ollama rileva automaticamente la GPU. Un'interfaccia aggiuntiva come Open WebUI o LM Studio è una comodità, non un obbligo.

#Installare Nemotron tramite Ollama

L'installazione segue esattamente il flusso abituale di Ollama. Se il daemon è già in esecuzione, un solo comando scarica e avvia il modello.

  1. 01
    Verificare che Ollama sia in esecuzione
    Apri un terminale ed esegui « ollama --version ». Se il comando risponde, il daemon è pronto. Altrimenti, installa prima Ollama (vedi la guida all'installazione alla fine dell'articolo).
  2. 02
    Scaricare la variante Nano
    Per fare una prova senza problemi di VRAM, inizia con Nano. Il comando scarica i pesi e poi apre una sessione di chat direttamente nel terminale.
  3. 03
    Passare a Super se la tua GPU è all'altezza
    Una volta acquisita dimestichezza, e se hai abbastanza VRAM, scarica la variante Super per migliorare la qualità del ragionamento e del codice.
  4. 04
    Elencare e gestire i modelli
    « ollama list » mostra i modelli installati e le loro dimensioni su disco. « ollama rm <modello> » libera lo spazio di una variante che non utilizzi più.
Terminale — installazione Nemotron
# Vérifier qu'Ollama répond
ollama --version

# Variante Nano (~9B) — cartes grand public
ollama run nemotron-nano

# Variante Super (~49B) — grosse VRAM / multi-GPU
ollama run nemotron-super

# Voir ce qui est installé et vérifier le placement GPU
ollama list
ollama ps
!
I tag evolvono
La libreria Ollama aggiorna regolarmente i nomi e le versioni dei modelli Nemotron. Prima di eseguire un comando, verifica il tag esatto su ollama.com/library — il nome del modello e il suo numero di versione possono differire dall'esempio precedente a seconda della generazione pubblicata.

Per chiamare Nemotron dai tuoi script, l'API REST di Ollama è disponibile sulla stessa porta. Il campo «model» riporta il tag esatto del modello che hai scaricato.

Terminale — chiamata API
curl http://localhost:11434/api/generate -d '{
  "model": "nemotron-nano",
  "prompt": "Explique la différence entre RAG et fine-tuning en trois phrases.",
  "stream": false
}'

#Modalità di ragionamento controllabile

Il tratto distintivo dei modelli Nemotron è un ragionamento che puoi attivare o disattivare su richiesta. NVIDIA ha addestrato questi modelli a produrre una catena di pensiero dettagliata quando glielo chiedi tramite il system prompt, e a rispondere direttamente altrimenti. In pratica, si passa da una modalità all'altra con una semplice istruzione di sistema: « detailed thinking on » per forzare il ragionamento passo dopo passo, « detailed thinking off » per una risposta concisa e veloce.

Questo interruttore è utile perché il ragionamento ha un costo. Una catena di pensiero genera molti token intermedi: questo è prezioso per un problema di matematica, di logica o per un'attività di debugging delicata, ma è uno spreco per riformulare un'email. Con Nemotron decidi, prompt per prompt, se pagare questo costo aggiuntivo.

Terminale — attivare il ragionamento
# Dans une session ollama run, définir le system prompt :
/set system detailed thinking on

# Puis poser une question de raisonnement
Un train part de A à 60 km/h, un autre de B à 90 km/h... résous étape par étape.
→
Disattivare il ragionamento per andare più veloce
Per testi semplici, riformulazione o classificazione, metti 'detailed thinking off'. Ottieni una latenza e un consumo di token più bassi senza perdita di qualità su queste attività in cui riflettere a voce alta non aggiunge nulla.

Questo funzionamento avvicina Nemotron a modelli come DeepSeek R1 o Qwen3 nella loro modalità «thinking», ma con un controllo più esplicito: il ragionamento non è una modalità globale del modello, è un'impostazione che gestisci nel corso della conversazione.

#Codice, agenti e tool-calling

NVIDIA ottimizza Nemotron soprattutto per due utilizzi: il ragionamento e le attività agentiche. Per il codice, le varianti Super tengono testa ai validi modelli da 32-70B nella generazione, spiegazione e correzione. Nano resta discreto per un'assistenza occasionale, ma mostra i suoi limiti nei compiti lunghi o nei refactoring estesi: è prevedibile per un modello delle sue dimensioni.

Il vero elemento distintivo è il function calling. Nemotron è addestrato a produrre chiamate a strumenti affidabili e ben formate, il che lo rende un buon candidato per costruire agenti locali: un modello che decide di chiamare una funzione, legge il risultato e prosegue. In combinazione con la modalità di ragionamento, questo permette di ottenere agenti capaci di pianificare prima di agire anziché procedere alla cieca.

Ragionamento / matematica
Un chiaro punto di forza, soprattutto in Super con « detailed thinking on ». La catena di pensiero riduce gli errori di calcolo e di logica.
Codice
Super rivaleggia con i modelli 70B nella generazione di codice e nel debugging; Nano è adatto all'assistenza leggera e all'autocompletamento.
Agenti e strumenti
Uso affidabile delle chiamate agli strumenti, formato JSON rispettato — uno dei migliori utilizzi della famiglia per l'automazione locale.
Francese / conversazione generale
Discreto senza essere il migliore della sua categoria. Nemotron è pensato per ragionare e agire, meno per le chiacchiere multilingue.

#Rispetto a Qwen3: quando preferire Nemotron

Qwen3 è il modello open-weight di riferimento per il confronto, perché le due famiglie competono sullo stesso terreno: ragionamento, codice, varie dimensioni, modalità thinking. In molti compiti generalisti e nella qualità del francese, Qwen3 resta superiore a parità di dimensioni: è un modello più versatile e meglio addestrato per il multilinguismo.

Nemotron torna in vantaggio quando il tuo utilizzo è orientato agli agenti IA e all'integrazione con un ecosistema NVIDIA. Se costruisci un agente con molte chiamate a strumenti, se vuoi un controllo esplicito del ragionamento prompt per prompt, o se utilizzi un parco di GPU NVIDIA in cui conta il throughput di inferenza, Nemotron merita una prova. Al contrario, per un assistente conversazionale generalista in francese, Qwen3 è la scelta predefinita più affidabile.

Scegliere Nemotron se
Agenti che fanno un uso intensivo delle chiamate agli strumenti, necessità di controllare con precisione l'attivazione e la disattivazione del ragionamento, infrastruttura al 100% NVIDIA o ricerca del miglior rapporto qualità/calcolo nel ragionamento puro.
Scegliere Qwen3 se
Assistente generalista, priorità al francese e al multilinguismo, versatilità nella conversazione, o semplicemente il modello più collaudato per un'ampia gamma di utilizzi.
Verdetto pratico
Prova i due con dimensioni simili (Nano vs Qwen3-8B, Super vs Qwen3-32B) sui tuoi prompt reali. La differenza dipende fortemente dall'attività, non da un ranking astratto.

#Risoluzione dei problemi

« model not found » durante il pull
Il tag non esiste con questo nome. Controlla la grafia esatta su ollama.com/library — i nomi Nemotron cambiano da generazione a generazione.
Crollo della velocità con Super
Per mancanza di VRAM, parte del modello viene trasferita nella RAM di sistema. « ollama ps » mostra una ripartizione tra GPU e CPU. Passa a Nano, a una quantizzazione più bassa (Q4) oppure aggiungi risorse GPU.
Il ragionamento non si attiva
Il prompt di sistema non viene considerato. In una sessione interattiva, usa « /set system detailed thinking on »; in API, inserisci l'istruzione nel campo system, non nel prompt utente.
Risposte troppo prolisse
La modalità di ragionamento è attiva per impostazione predefinita o ereditata. Passa a « detailed thinking off » per i compiti semplici.
« Connection refused »
Il daemon Ollama non è in esecuzione. Verifica con « ollama ps » e assicurati che il servizio sia effettivamente in ascolto su http://localhost:11434.

#Per approfondire

Nemotron si basa su componenti già trattati sul sito. Queste guide approfondiscono quella che stai leggendo:

Qwen 3 in locale: test completo e benchmark reali
Il comparativo indispensabile per posizionare Nemotron rispetto alla sua principale alternativa open-weight, con i dati in tokens/sec.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Per trovare un equilibrio tra qualità e VRAM su Nemotron Super, dove ogni livello di quantizzazione cambia ciò che riesce a stare nella memoria della tua scheda.
Installare Ollama su Linux
Il prerequisito se il daemon non è ancora configurato: script di installazione, servizio systemd e configurazione della GPU NVIDIA.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.