Nemotron 3 in locale: i modelli NVIDIA con Ollama
NVIDIA non produce soltanto GPU: l'azienda esegue anche il post-addestramento dei propri LLM, la famiglia Nemotron. Questa guida mostra come installare Nemotron 3 in locale con Ollama, quali varianti (Nano, Super) scegliere in base alla tua VRAM, cosa NVIDIA ottimizza diversamente dagli altri — ragionamento controllabile e uso agentico — e quando conviene usare questi modelli rispetto ai Qwen3 equivalenti.
#Perché Nemotron piuttosto che un altro modello
Nemotron non è un modello addestrato da zero. NVIDIA parte da solide basi open-weight (Llama o Qwen, a seconda delle versioni), poi applica la propria ricetta di post-addestramento: potatura (pruning) per ridurre le dimensioni, distillazione per recuperare la qualità persa e un fine-tuning massiccio orientato al ragionamento, alla matematica, al codice e alle chiamate a strumenti. Il risultato mira a un obiettivo preciso: il miglior rapporto qualità/costo di calcolo per i compiti degli agenti, non per la conversazione generalista.
L'altra particolarità è che NVIDIA ottimizza questi modelli per il proprio hardware e le proprie pipeline di inferenza. In pratica, questo si traduce in buone velocità di elaborazione sulle GPU NVIDIA e in una famiglia progettata come una gamma coerente: una versione piccola per le schede destinate al grande pubblico, una versione media per le workstation, una versione gigante per i server. Scegli in base alla VRAM disponibile senza cambiare la logica dei prompt.
#Nano, Super e Ultra: quale variante
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
La serie Nemotron 3 si presenta in tre dimensioni, ciascuna adatta a una categoria di macchina. Il nome indica la destinazione più che il numero esatto di parametri.
- Nano (~8-9B)
- La versione per schede video consumer. Entra comodamente in memoria su una RTX 3060 da 12 GB o su qualsiasi GPU con almeno 8 GB di VRAM in Q4. È il punto di partenza ideale per provare Nemotron e per gli agenti leggeri.
- Super (~49B)
- La versione per workstation e GPU di grandi dimensioni. Punta alla qualità di un modello 70B con un costo computazionale inferiore, grazie al pruning di NVIDIA. Richiede una RTX 4090 da 24 GB (in Q4, con poco margine) o, meglio, una scheda da 32-48 GB.
- Ultra (~253B)
- La versione server, fuori dalla portata di un computer di fascia consumer. Riservata alle workstation multi-GPU o ai data center. Menzionata qui per illustrare la gamma, non per un normale uso locale.
Per un uso locale, la scelta reale si fa tra Nano e Super. Nano se hai una scheda da 8 a 16 GB o se la velocità è prioritaria. Super se hai 24 GB o più e cerchi la qualità massima nel ragionamento o nel codice complesso.
#Requisiti e VRAM per variante
Come per ogni modello eseguito in locale, la VRAM è il fattore limitante. Ecco i valori di riferimento con la quantizzazione Q4_K_M, quella consigliata come scelta predefinita perché offre il miglior compromesso tra qualità e memoria. Prevedi sempre un margine per la finestra di contesto, che consuma memoria oltre a quella occupata dai pesi.
- Nemotron Nano (~9B) — Q4
- ≈ 6-7 GB di VRAM. Comodo su RTX 3060 12 GB, RTX 4070 12 GB, o un Mac Apple Silicon a partire da 16 GB di memoria unificata.
- Nemotron Super (~49B) — Q4
- ≈ 28-30 GB. Non entra in una sola RTX 4090 da 24 GB senza offload: prevedi una scheda da 32 GB o più, due GPU oppure un Mac M4 Pro/Max con 48 GB di memoria unificata.
- Nemotron Super — Q5/Q8
- Q5_K_M arriva a circa 35 GB, Q8_0 supera i 50 GB. Riservato alle configurazioni con molta VRAM o più GPU.
- Margine per il contesto
- Aggiungi da 1 a 4 GB in base alla lunghezza del contesto desiderata. Un contesto lungo durante il ragionamento genera molti token intermedi, quindi aumenta l'occupazione di memoria.
Sul piano software, il requisito è minimo: il daemon Ollama installato, che per impostazione predefinita è in ascolto su http://localhost:11434. Se usi una GPU NVIDIA, assicurati che i driver CUDA siano aggiornati; Ollama rileva automaticamente la GPU. Un'interfaccia aggiuntiva come Open WebUI o LM Studio è una comodità, non un obbligo.
#Installare Nemotron tramite Ollama
L'installazione segue esattamente il flusso abituale di Ollama. Se il daemon è già in esecuzione, un solo comando scarica e avvia il modello.
- 01Verificare che Ollama sia in esecuzioneApri un terminale ed esegui « ollama --version ». Se il comando risponde, il daemon è pronto. Altrimenti, installa prima Ollama (vedi la guida all'installazione alla fine dell'articolo).
- 02Scaricare la variante NanoPer fare una prova senza problemi di VRAM, inizia con Nano. Il comando scarica i pesi e poi apre una sessione di chat direttamente nel terminale.
- 03Passare a Super se la tua GPU è all'altezzaUna volta acquisita dimestichezza, e se hai abbastanza VRAM, scarica la variante Super per migliorare la qualità del ragionamento e del codice.
- 04Elencare e gestire i modelli« ollama list » mostra i modelli installati e le loro dimensioni su disco. « ollama rm <modello> » libera lo spazio di una variante che non utilizzi più.
Per chiamare Nemotron dai tuoi script, l'API REST di Ollama è disponibile sulla stessa porta. Il campo «model» riporta il tag esatto del modello che hai scaricato.
#Modalità di ragionamento controllabile
Il tratto distintivo dei modelli Nemotron è un ragionamento che puoi attivare o disattivare su richiesta. NVIDIA ha addestrato questi modelli a produrre una catena di pensiero dettagliata quando glielo chiedi tramite il system prompt, e a rispondere direttamente altrimenti. In pratica, si passa da una modalità all'altra con una semplice istruzione di sistema: « detailed thinking on » per forzare il ragionamento passo dopo passo, « detailed thinking off » per una risposta concisa e veloce.
Questo interruttore è utile perché il ragionamento ha un costo. Una catena di pensiero genera molti token intermedi: questo è prezioso per un problema di matematica, di logica o per un'attività di debugging delicata, ma è uno spreco per riformulare un'email. Con Nemotron decidi, prompt per prompt, se pagare questo costo aggiuntivo.
Questo funzionamento avvicina Nemotron a modelli come DeepSeek R1 o Qwen3 nella loro modalità «thinking», ma con un controllo più esplicito: il ragionamento non è una modalità globale del modello, è un'impostazione che gestisci nel corso della conversazione.
#Codice, agenti e tool-calling
NVIDIA ottimizza Nemotron soprattutto per due utilizzi: il ragionamento e le attività agentiche. Per il codice, le varianti Super tengono testa ai validi modelli da 32-70B nella generazione, spiegazione e correzione. Nano resta discreto per un'assistenza occasionale, ma mostra i suoi limiti nei compiti lunghi o nei refactoring estesi: è prevedibile per un modello delle sue dimensioni.
Il vero elemento distintivo è il function calling. Nemotron è addestrato a produrre chiamate a strumenti affidabili e ben formate, il che lo rende un buon candidato per costruire agenti locali: un modello che decide di chiamare una funzione, legge il risultato e prosegue. In combinazione con la modalità di ragionamento, questo permette di ottenere agenti capaci di pianificare prima di agire anziché procedere alla cieca.
- Ragionamento / matematica
- Un chiaro punto di forza, soprattutto in Super con « detailed thinking on ». La catena di pensiero riduce gli errori di calcolo e di logica.
- Codice
- Super rivaleggia con i modelli 70B nella generazione di codice e nel debugging; Nano è adatto all'assistenza leggera e all'autocompletamento.
- Agenti e strumenti
- Uso affidabile delle chiamate agli strumenti, formato JSON rispettato — uno dei migliori utilizzi della famiglia per l'automazione locale.
- Francese / conversazione generale
- Discreto senza essere il migliore della sua categoria. Nemotron è pensato per ragionare e agire, meno per le chiacchiere multilingue.
#Rispetto a Qwen3: quando preferire Nemotron
Qwen3 è il modello open-weight di riferimento per il confronto, perché le due famiglie competono sullo stesso terreno: ragionamento, codice, varie dimensioni, modalità thinking. In molti compiti generalisti e nella qualità del francese, Qwen3 resta superiore a parità di dimensioni: è un modello più versatile e meglio addestrato per il multilinguismo.
Nemotron torna in vantaggio quando il tuo utilizzo è orientato agli agenti IA e all'integrazione con un ecosistema NVIDIA. Se costruisci un agente con molte chiamate a strumenti, se vuoi un controllo esplicito del ragionamento prompt per prompt, o se utilizzi un parco di GPU NVIDIA in cui conta il throughput di inferenza, Nemotron merita una prova. Al contrario, per un assistente conversazionale generalista in francese, Qwen3 è la scelta predefinita più affidabile.
- Scegliere Nemotron se
- Agenti che fanno un uso intensivo delle chiamate agli strumenti, necessità di controllare con precisione l'attivazione e la disattivazione del ragionamento, infrastruttura al 100% NVIDIA o ricerca del miglior rapporto qualità/calcolo nel ragionamento puro.
- Scegliere Qwen3 se
- Assistente generalista, priorità al francese e al multilinguismo, versatilità nella conversazione, o semplicemente il modello più collaudato per un'ampia gamma di utilizzi.
- Verdetto pratico
- Prova i due con dimensioni simili (Nano vs Qwen3-8B, Super vs Qwen3-32B) sui tuoi prompt reali. La differenza dipende fortemente dall'attività, non da un ranking astratto.
#Risoluzione dei problemi
- « model not found » durante il pull
- Il tag non esiste con questo nome. Controlla la grafia esatta su ollama.com/library — i nomi Nemotron cambiano da generazione a generazione.
- Crollo della velocità con Super
- Per mancanza di VRAM, parte del modello viene trasferita nella RAM di sistema. « ollama ps » mostra una ripartizione tra GPU e CPU. Passa a Nano, a una quantizzazione più bassa (Q4) oppure aggiungi risorse GPU.
- Il ragionamento non si attiva
- Il prompt di sistema non viene considerato. In una sessione interattiva, usa « /set system detailed thinking on »; in API, inserisci l'istruzione nel campo system, non nel prompt utente.
- Risposte troppo prolisse
- La modalità di ragionamento è attiva per impostazione predefinita o ereditata. Passa a « detailed thinking off » per i compiti semplici.
- « Connection refused »
- Il daemon Ollama non è in esecuzione. Verifica con « ollama ps » e assicurati che il servizio sia effettivamente in ascolto su http://localhost:11434.
#Per approfondire
Nemotron si basa su componenti già trattati sul sito. Queste guide approfondiscono quella che stai leggendo:
- Qwen 3 in locale: test completo e benchmark reali
- Il comparativo indispensabile per posizionare Nemotron rispetto alla sua principale alternativa open-weight, con i dati in tokens/sec.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per trovare un equilibrio tra qualità e VRAM su Nemotron Super, dove ogni livello di quantizzazione cambia ciò che riesce a stare nella memoria della tua scheda.
- Installare Ollama su Linux
- Il prerequisito se il daemon non è ancora configurato: script di installazione, servizio systemd e configurazione della GPU NVIDIA.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.