La tua prima conversazione locale
Per interrogare un LLM locale, avvia un modello con ollama run, scrivi una richiesta completa in una o due frasi con il testo da elaborare, leggi la risposta, poi correggila con un'istruzione precisa invece di ricominciare. Niente di ciò che scrivi lascia il tuo computer. In una quindicina di minuti, avrai prodotto un riassunto, un'email, un po' di codice e capito come correggere una risposta sbagliata.
Ollama è installato e davanti a te lampeggia un cursore. Questo tutorial del primo giorno ti guida in una vera conversazione: avviare un modello adatto alla memoria disponibile, formulare richieste che funzionano, usare i comandi di sessione, riconoscere quando il modello va fuori strada ed evitare le insidie del contesto e della memoria.
#Cosa imparerai in questo tutorial
Chiederai un riassunto, farai scrivere un'email, otterrai un piccolo script, proverai una domanda al di fuori dell'ambito del modello, poi correggerai una risposta che prende la direzione sbagliata. Sono queste le azioni che ti rendono autonomo. La guida presuppone che Ollama sia già installato: altrimenti, inizia dalla guida di installazione per il tuo sistema. Per approfondire come formulare un'istruzione, prosegui con la guida alle basi del prompting.
#Scegliere un modello che rientri nella memoria disponibile sulla tua macchina
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Il modello è un file di diversi gigabyte: deve stare nella memoria video della tua scheda oppure nella RAM di un Mac o di un PC senza scheda dedicata. La pagina di Gemma 4 nella libreria di Ollama elenca le varianti e le relative dimensioni di download. Una variante troppo grande per la tua macchina funzionerà, ma lentamente, trasferendo parte del lavoro al processore.
| Etichetta | Dimensione del download | Memoria da prevedere |
|---|---|---|
| gemma4:e2b | Da 4,6 a 7,5 GB | Macchine da 8 GB |
| gemma4 (e4b, predefinito) | Da 6,6 a 9,5 GB | Macchine da 12 a 16 GB |
| gemma4:12b | Da 7,7 a 8,0 GB | Macchine da 16 GB o più |
| gemma4:26b | Da 16 a 19 GB | Schede da 24 GB o più |
| gemma4:31b | Da 19 a 20 GB | Schede da 24 a 32 GB, contesto ridotto |
La colonna a destra è la nostra stima prudente: aggiungi alle dimensioni sopra indicate la memoria del contesto e un margine per il sistema. In caso di dubbio, scegli la versione più piccola: una risposta rapida di un modello piccolo insegna di più di una risposta molto lenta di un modello grande. Puoi cambiare modello in qualsiasi momento.
#La tua prima sessione, passo dopo passo
Prevedi circa quindici minuti per seguire gli otto passaggi che seguono. Vanno dall'avvio alla verifica di una risposta. Ogni passaggio è indipendente: puoi fermarti dopo il secondo e tornare più tardi. L'unica cosa che perdi chiudendo la sessione è la cronologia della conversazione, che il terminale non conserva.
#1. Avviare il modello
Il comando ollama run gemma4 figura nella documentazione di Ollama come esempio di esecuzione di un modello. Al primo avvio, il modello viene scaricato: il tempo dipende dalla sua dimensione e dalla tua connessione. Successivamente appare un prompt e il modello aspetta il tuo messaggio. Niente accade finché non scrivi.
#2. Parlagli con frasi complete
Primo errore comune: scrivere parole chiave come in un motore di ricerca. Un modello linguistico non cerca documenti, continua un testo. Descrivi quindi ciò che vuoi, con il contesto e il risultato atteso.
Uno schema che funziona quasi sempre: il compito, i dati da elaborare, il formato atteso. Quattro esercizi per allenarti: chiedere un riassunto di appunti personali, scrivere un'email di annullamento in tre righe, chiedere una funzione Python che conti le parole di un file, porre una domanda a cui il modello non può rispondere, come il contenuto di un documento che non gli hai fornito.
#3. Testare ciò che il modello non sa
L'ultimo esercizio è il più istruttivo. Un modello non consulta né internet né i tuoi file, a meno che non vi sia uno strumento collegato: conosce soltanto ciò che ha appreso durante l'addestramento e il testo della conversazione. Chiedigli il contenuto di un documento immaginario o informazioni su un evento recente e osserva: un buon modello risponde che non lo sa, un modello meno affidabile inventa una risposta plausibile. Questo comportamento si chiama allucinazione. La regola che ne deriva: più l'informazione è precisa, recente o specifica per te, più devi fornirla nel prompt o verificarla. La nostra guida sulle allucinazioni descrive in dettaglio le contromisure.
#4. Correggere senza ripartire da zero
Il modello risponde fuori tema? Non digitare semplicemente « no, ricomincia »: non ha capito nulla di più. Aggiungi un vincolo preciso che indichi cosa non va e cosa ti aspetti.
- Lunghezza
- Numero di punti elenco, di righe o di parole.
- Ton
- Formale, informale, giornalistico, pedagogico.
- Forma
- Elenco, tabella, JSON, e-mail, codice.
- Proibizioni espresse in modo positivo
- Preferisci «inizia direttamente con la risposta» a «non dire “ecco”».
#5. I comandi di sessione
Nella sessione, le righe che iniziano con una barra obliqua non vengono inviate al modello: controllano Ollama. Il comando /? mostra l'elenco completo.
- /set parameter num_ctx 8192
- Imposta la dimensione del contesto per la sessione: nella FAQ di Ollama questa istruzione è citata per modificare la finestra.
- /set system
- Definisce un messaggio di sistema, un ruolo permanente per la sessione.
- /show info
- Mostra le informazioni del modello caricato: architettura, dimensione, lunghezza del contesto, quantizzazione.
- /clear
- Elimina il contesto della conversazione in corso senza rimuovere il modello dalla memoria.
- /bye
- Chiude la sessione; in alternativa, Ctrl+D.
Una volta chiusa la sessione, il modello rimane in memoria per cinque minuti per impostazione predefinita, secondo la FAQ di Ollama, accelerando così un nuovo avvio. Per rimuoverlo immediatamente dalla memoria, esegui ollama stop seguito dal nome del modello; ollama ps elenca ciò che è caricato e mostra la quota eseguita sulla GPU e sulla CPU.
#6. Tenere una conversazione su più turni
Il modello ricorda solo ciò che si trova nella finestra di contesto: a ogni turno, l'applicazione gli invia nuovamente l'intera cronologia. Puoi quindi concatenare richieste che si basano le une sulle altre.
Il limite è la dimensione del contesto. Secondo la documentazione di Ollama, il valore predefinito è di circa 4.000 token sotto i 24 GiB di VRAM, 32k tra 24 e 48 GiB e 256k oltre. Quando la cronologia supera la finestra, gli scambi più vecchi vengono persi. Se il modello «dimentica» l'inizio di una lunga sessione, aumenta la finestra con il comando num_ctx, ricordando che ogni token di contesto consuma memoria.
#7. Chiedere il codice e verificarlo
Il codice è un buon terreno di prova, perché il risultato si può testare. Indica il linguaggio, l'input, l'output atteso e un vincolo: «Scrivi una funzione Python che prende il percorso di un file di testo e restituisce il numero di parole. Rispondi solo con il codice, poi con una frase di spiegazione.» Copia il codice in un file, eseguilo su un caso di cui conosci la risposta e, se si verifica un errore, incolla il messaggio di errore completo nella conversazione chiedendo di correggerlo. Questo ciclo di richiesta, esecuzione e correzione funziona meglio che pretendere codice perfetto al primo tentativo.
#8. Leggere una risposta con un occhio critico
Una risposta fluida non è una risposta esatta. Il modello genera testo plausibile; non lo verifica. Abituati a controllare ciò che conta prima di usarlo.
- Numeri e date
- Verificali confrontandoli con una fonte: sono gli elementi che i modelli inventano più facilmente.
- Nomi, riferimenti e citazioni
- Verifica che esistano. Un modello può inventare il titolo di un'opera o un articolo di legge che sembri plausibile.
- Codice
- Eseguilo prima di fidartene e rileggi ciò che fa sui tuoi file.
- Coerenza
- Poni la stessa domanda in due modi: se le risposte divergono, diffida di entrambe.
Una buona abitudine è fornire tu stesso il testo di riferimento e chiedere al modello di citare il passaggio che giustifica ogni affermazione. In questo modo, verifichi in pochi secondi, invece di cercare tutto.
#Restare nel terminale o passare a un'interfaccia?
| Via | Vantaggio | Limite |
|---|---|---|
| Terminale (ollama run) | Nessuna installazione aggiuntiva, ideale per un primo test | Nessuna cronologia organizzata, poca comodità per i testi lunghi |
| Interfaccia di chat (Open WebUI, LM Studio, Jan) | Storico, file allegati, layout leggibile | Un'installazione aggiuntiva |
| API (script) | Automazione, integrazione con i tuoi strumenti | Richiede un po’ di codice |
Comincia con il terminale per capire il principio, poi passa a un'interfaccia non appena incolli testi lunghi o vuoi ritrovare le tue conversazioni. I due si possono combinare: il modello scaricato una volta con Ollama serve anche alle interfacce, senza un secondo download, purché utilizzino lo stesso server locale.
#Quando qualcosa va storto
| Sintomo | Causa probabile | Soluzione |
|---|---|---|
| Risposte molto lente | Il modello viene eseguito in parte sulla CPU | Avvia ollama ps, poi scegli una versione più piccola o riduci il contesto |
| Il modello dimentica l'inizio | Finestra di contesto piena | Aumenta num_ctx o ricomincia con un riassunto |
| Risposta in inglese | Istruzione o modello orientato all'inglese | Scrivi « rispondi in francese » nella richiesta o in /set system |
| Testo inventato | Informazione mancante nel prompt | Fornisci il testo originale e chiedi di citare il passaggio |
| Errore: modello non trovato | Nome errato o etichetta errata | Controlla l'ortografia sulla pagina del modello nella libreria Ollama |
Per una regolazione più precisa della creatività, la documentazione del Modelfile di Ollama riassume l'effetto della temperatura: più è alta, più il modello è creativo; più è bassa, più è coerente. La guida sulla temperatura e sul top-p illustra nel dettaglio i valori da provare.
#E dopo questa prima conversazione?
- Un ruolo permanente
- La guida ai system prompt mostra come dare regole stabili al modello.
- Un'interfaccia più comoda
- Open WebUI o LM Studio aggiungono la cronologia, i file allegati e un'impaginazione leggibile.
- I tuoi documenti
- Il RAG permette di interrogare i tuoi file senza doverli incollare ogni volta.
Come interrogare un LLM per la prima volta?+
Serve una connessione internet per parlare con un modello locale?+
Come uscire da una conversazione Ollama?+
Perché il modello dimentica l'inizio della conversazione?+
Quale modello scegliere per iniziare?+
Il modello può leggere i miei file o i contenuti su Internet?+
#Per approfondire
- Installare Ollama in 5 minuti
- Le basi del prompting
- Padroneggiare i system prompt
- Comprendere la finestra di contesto
- Allucinazioni: come limitarle
- Open WebUI con Ollama: guida completa
- Fonte: FAQ Ollama
- Fonte: Ollama, lunghezza del contesto
- Fonte: libreria Ollama, Gemma 4
- Fonte: Ollama, documentazione di riferimento del Modelfile
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.