Principiante 10 minPrompting

La tua prima conversazione locale

Risposta diretta

Per interrogare un LLM locale, avvia un modello con ollama run, scrivi una richiesta completa in una o due frasi con il testo da elaborare, leggi la risposta, poi correggila con un'istruzione precisa invece di ricominciare. Niente di ciò che scrivi lascia il tuo computer. In una quindicina di minuti, avrai prodotto un riassunto, un'email, un po' di codice e capito come correggere una risposta sbagliata.

Ollama è installato e davanti a te lampeggia un cursore. Questo tutorial del primo giorno ti guida in una vera conversazione: avviare un modello adatto alla memoria disponibile, formulare richieste che funzionano, usare i comandi di sessione, riconoscere quando il modello va fuori strada ed evitare le insidie del contesto e della memoria.

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux

#Cosa imparerai in questo tutorial

Chiederai un riassunto, farai scrivere un'email, otterrai un piccolo script, proverai una domanda al di fuori dell'ambito del modello, poi correggerai una risposta che prende la direzione sbagliata. Sono queste le azioni che ti rendono autonomo. La guida presuppone che Ollama sia già installato: altrimenti, inizia dalla guida di installazione per il tuo sistema. Per approfondire come formulare un'istruzione, prosegui con la guida alle basi del prompting.

#Scegliere un modello che rientri nella memoria disponibile sulla tua macchina

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Il modello è un file di diversi gigabyte: deve stare nella memoria video della tua scheda oppure nella RAM di un Mac o di un PC senza scheda dedicata. La pagina di Gemma 4 nella libreria di Ollama elenca le varianti e le relative dimensioni di download. Una variante troppo grande per la tua macchina funzionerà, ma lentamente, trasferendo parte del lavoro al processore.

Varianti di Gemma 4 nella libreria Ollama (dimensione indicata da Ollama)
EtichettaDimensione del downloadMemoria da prevedere
gemma4:e2bDa 4,6 a 7,5 GBMacchine da 8 GB
gemma4 (e4b, predefinito)Da 6,6 a 9,5 GBMacchine da 12 a 16 GB
gemma4:12bDa 7,7 a 8,0 GBMacchine da 16 GB o più
gemma4:26bDa 16 a 19 GBSchede da 24 GB o più
gemma4:31bDa 19 a 20 GBSchede da 24 a 32 GB, contesto ridotto

La colonna a destra è la nostra stima prudente: aggiungi alle dimensioni sopra indicate la memoria del contesto e un margine per il sistema. In caso di dubbio, scegli la versione più piccola: una risposta rapida di un modello piccolo insegna di più di una risposta molto lenta di un modello grande. Puoi cambiare modello in qualsiasi momento.

#La tua prima sessione, passo dopo passo

Prevedi circa quindici minuti per seguire gli otto passaggi che seguono. Vanno dall'avvio alla verifica di una risposta. Ogni passaggio è indipendente: puoi fermarti dopo il secondo e tornare più tardi. L'unica cosa che perdi chiudendo la sessione è la cronologia della conversazione, che il terminale non conserva.

#1. Avviare il modello

Primo avvio
ollama run gemma4:e2b

Il comando ollama run gemma4 figura nella documentazione di Ollama come esempio di esecuzione di un modello. Al primo avvio, il modello viene scaricato: il tempo dipende dalla sua dimensione e dalla tua connessione. Successivamente appare un prompt e il modello aspetta il tuo messaggio. Niente accade finché non scrivi.

i
I tuoi messaggi restano sul tuo dispositivo
La FAQ di Ollama indica che quando esegui un modello in locale, Ollama non vede i tuoi prompt né i tuoi dati. Questo non è vero per i modelli cloud, che inviano i tuoi messaggi ai server del fornitore: verifica che il nome del modello non finisca con cloud.

#2. Parlagli con frasi complete

Primo errore comune: scrivere parole chiave come in un motore di ricerca. Un modello linguistico non cerca documenti, continua un testo. Descrivi quindi ciò che vuoi, con il contesto e il risultato atteso.

Una richiesta vaga, poi una richiesta completa
# Trop vague
résumer réunion points importants

# Précis
Voici des notes de réunion. Résume-les en 5 puces : d'abord les décisions
prises, puis les actions à faire avec leur responsable.

Notes :
- Alice propose de migrer vers Postgres d'ici juin
- Bob rappelle qu'il faut finir l'audit sécurité avant
- Décision : on migre, mais l'audit passe avant (fin mai)
- Charles s'occupe de l'audit
- Alice s'occupe de la migration

Uno schema che funziona quasi sempre: il compito, i dati da elaborare, il formato atteso. Quattro esercizi per allenarti: chiedere un riassunto di appunti personali, scrivere un'email di annullamento in tre righe, chiedere una funzione Python che conti le parole di un file, porre una domanda a cui il modello non può rispondere, come il contenuto di un documento che non gli hai fornito.

#3. Testare ciò che il modello non sa

L'ultimo esercizio è il più istruttivo. Un modello non consulta né internet né i tuoi file, a meno che non vi sia uno strumento collegato: conosce soltanto ciò che ha appreso durante l'addestramento e il testo della conversazione. Chiedigli il contenuto di un documento immaginario o informazioni su un evento recente e osserva: un buon modello risponde che non lo sa, un modello meno affidabile inventa una risposta plausibile. Questo comportamento si chiama allucinazione. La regola che ne deriva: più l'informazione è precisa, recente o specifica per te, più devi fornirla nel prompt o verificarla. La nostra guida sulle allucinazioni descrive in dettaglio le contromisure.

#4. Correggere senza ripartire da zero

Il modello risponde fuori tema? Non digitare semplicemente « no, ricomincia »: non ha capito nulla di più. Aggiungi un vincolo preciso che indichi cosa non va e cosa ti aspetti.

Una richiesta di approfondimento mirata
Refais, mais en 3 puces maximum et sans jargon technique.
Chaque puce doit tenir sur une ligne.
Lunghezza
Numero di punti elenco, di righe o di parole.
Ton
Formale, informale, giornalistico, pedagogico.
Forma
Elenco, tabella, JSON, e-mail, codice.
Proibizioni espresse in modo positivo
Preferisci «inizia direttamente con la risposta» a «non dire “ecco”».

#5. I comandi di sessione

Nella sessione, le righe che iniziano con una barra obliqua non vengono inviate al modello: controllano Ollama. Il comando /? mostra l'elenco completo.

/set parameter num_ctx 8192
Imposta la dimensione del contesto per la sessione: nella FAQ di Ollama questa istruzione è citata per modificare la finestra.
/set system
Definisce un messaggio di sistema, un ruolo permanente per la sessione.
/show info
Mostra le informazioni del modello caricato: architettura, dimensione, lunghezza del contesto, quantizzazione.
/clear
Elimina il contesto della conversazione in corso senza rimuovere il modello dalla memoria.
/bye
Chiude la sessione; in alternativa, Ctrl+D.

Una volta chiusa la sessione, il modello rimane in memoria per cinque minuti per impostazione predefinita, secondo la FAQ di Ollama, accelerando così un nuovo avvio. Per rimuoverlo immediatamente dalla memoria, esegui ollama stop seguito dal nome del modello; ollama ps elenca ciò che è caricato e mostra la quota eseguita sulla GPU e sulla CPU.

#6. Tenere una conversazione su più turni

Il modello ricorda solo ciò che si trova nella finestra di contesto: a ogni turno, l'applicazione gli invia nuovamente l'intera cronologia. Puoi quindi concatenare richieste che si basano le une sulle altre.

Eseguire tre turni di conversazione consecutivi
Je dois écrire un courriel pour annuler une réservation au restaurant.
Fais-le en 3 lignes, poli mais pas guindé.

[réponse du modèle]

Bien. Refais la même, mais plus chaleureuse, et précise que je
reprogrammerai dans 15 jours.

[réponse du modèle]

Parfait. Traduis-la en anglais.

Il limite è la dimensione del contesto. Secondo la documentazione di Ollama, il valore predefinito è di circa 4.000 token sotto i 24 GiB di VRAM, 32k tra 24 e 48 GiB e 256k oltre. Quando la cronologia supera la finestra, gli scambi più vecchi vengono persi. Se il modello «dimentica» l'inizio di una lunga sessione, aumenta la finestra con il comando num_ctx, ricordando che ogni token di contesto consuma memoria.

#7. Chiedere il codice e verificarlo

Il codice è un buon terreno di prova, perché il risultato si può testare. Indica il linguaggio, l'input, l'output atteso e un vincolo: «Scrivi una funzione Python che prende il percorso di un file di testo e restituisce il numero di parole. Rispondi solo con il codice, poi con una frase di spiegazione.» Copia il codice in un file, eseguilo su un caso di cui conosci la risposta e, se si verifica un errore, incolla il messaggio di errore completo nella conversazione chiedendo di correggerlo. Questo ciclo di richiesta, esecuzione e correzione funziona meglio che pretendere codice perfetto al primo tentativo.

#8. Leggere una risposta con un occhio critico

Una risposta fluida non è una risposta esatta. Il modello genera testo plausibile; non lo verifica. Abituati a controllare ciò che conta prima di usarlo.

Numeri e date
Verificali confrontandoli con una fonte: sono gli elementi che i modelli inventano più facilmente.
Nomi, riferimenti e citazioni
Verifica che esistano. Un modello può inventare il titolo di un'opera o un articolo di legge che sembri plausibile.
Codice
Eseguilo prima di fidartene e rileggi ciò che fa sui tuoi file.
Coerenza
Poni la stessa domanda in due modi: se le risposte divergono, diffida di entrambe.

Una buona abitudine è fornire tu stesso il testo di riferimento e chiedere al modello di citare il passaggio che giustifica ogni affermazione. In questo modo, verifichi in pochi secondi, invece di cercare tutto.

#Restare nel terminale o passare a un'interfaccia?

Tre modi per dialogare con un modello locale
ViaVantaggioLimite
Terminale (ollama run)Nessuna installazione aggiuntiva, ideale per un primo testNessuna cronologia organizzata, poca comodità per i testi lunghi
Interfaccia di chat (Open WebUI, LM Studio, Jan)Storico, file allegati, layout leggibileUn'installazione aggiuntiva
API (script)Automazione, integrazione con i tuoi strumentiRichiede un po’ di codice

Comincia con il terminale per capire il principio, poi passa a un'interfaccia non appena incolli testi lunghi o vuoi ritrovare le tue conversazioni. I due si possono combinare: il modello scaricato una volta con Ollama serve anche alle interfacce, senza un secondo download, purché utilizzino lo stesso server locale.

#Quando qualcosa va storto

Simptomi comuni e soluzioni
SintomoCausa probabileSoluzione
Risposte molto lenteIl modello viene eseguito in parte sulla CPUAvvia ollama ps, poi scegli una versione più piccola o riduci il contesto
Il modello dimentica l'inizioFinestra di contesto pienaAumenta num_ctx o ricomincia con un riassunto
Risposta in ingleseIstruzione o modello orientato all'ingleseScrivi « rispondi in francese » nella richiesta o in /set system
Testo inventatoInformazione mancante nel promptFornisci il testo originale e chiedi di citare il passaggio
Errore: modello non trovatoNome errato o etichetta errataControlla l'ortografia sulla pagina del modello nella libreria Ollama

Per una regolazione più precisa della creatività, la documentazione del Modelfile di Ollama riassume l'effetto della temperatura: più è alta, più il modello è creativo; più è bassa, più è coerente. La guida sulla temperatura e sul top-p illustra nel dettaglio i valori da provare.

#E dopo questa prima conversazione?

Un ruolo permanente
La guida ai system prompt mostra come dare regole stabili al modello.
Un'interfaccia più comoda
Open WebUI o LM Studio aggiungono la cronologia, i file allegati e un'impaginazione leggibile.
I tuoi documenti
Il RAG permette di interrogare i tuoi file senza doverli incollare ogni volta.
FAQ
Come interrogare un LLM per la prima volta?+
Avvia un modello con ollama run seguito dal suo nome, attendi il prompt, poi scrivi una richiesta completa: il compito, il testo da elaborare e il formato atteso. Leggi la risposta, poi correggila con un'istruzione precisa anziché ricominciare da capo. Bastano pochi scambi per capire cosa sa fare il modello.
Serve una connessione internet per parlare con un modello locale?+
Solo per scaricare il modello. Successivamente, la conversazione avviene sul tuo dispositivo, senza connessione. La FAQ di Ollama specifica che, quando esegui un modello localmente, Ollama non vede i tuoi prompt né i tuoi dati. I modelli con suffisso cloud funzionano al contrario su server remoti e richiedono una connessione.
Come uscire da una conversazione Ollama?+
Digita /bye o usa Ctrl+D per chiudere la sessione. Il modello rimane poi caricato in memoria per cinque minuti per impostazione predefinita, accelerando così l'avvio successivo. Per rimuoverlo subito dalla memoria, esegui ollama stop seguito dal nome del modello, e ollama ps per verificare cosa è ancora caricato.
Perché il modello dimentica l'inizio della conversazione?+
Perché la cronologia supera la finestra di contesto. Ollama utilizza per impostazione predefinita circa 4.000 token con meno di 24 GiB di VRAM. Aumenta il valore con /set parameter num_ctx nella sessione, verificando che il modello continui a rientrare nella memoria della GPU, oppure riassumi la conversazione prima di continuare.
Quale modello scegliere per iniziare?+
Scegli il modello più piccolo che offra una qualità accettabile nella famiglia che vuoi provare, compatibile con la memoria a tua disposizione: un modello che risponde velocemente ti insegna più di un modello grande ma molto lento. Con 8 GB, la variante e2b di Gemma 4 pesa circa da 4,6 a 7,5 GB. Passa poi a un modello più grande se la qualità ti delude.
Il modello può leggere i miei file o i contenuti su Internet?+
Non per impostazione predefinita. Conosce solo ciò che ha appreso durante l'addestramento e il testo della conversazione. Per consentirgli di leggere i tuoi documenti o cercare sul web, devi collegargli uno strumento, ad esempio un'interfaccia come Open WebUI con un RAG o una funzione di ricerca web. Altrimenti, incolla il testo nel prompt.

#Per approfondire

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.