Principiante 11 minAltri strumenti

GPT4All: primi passi

Risposta diretta

GPT4All è un'applicazione desktop gratuita (licenza MIT, pubblicata da Nomic) che esegue un modello linguistico sul tuo computer, senza necessità di una GPU e senza account. La installi, scarichi un modello GGUF e inizi a chattare. La sua ultima versione, la 3.10.0, risale a febbraio 2025: funziona, ma il catalogo è datato e LocalDocs rimane limitato. Un buon punto di partenza su un computer modesto; altrimenti, confrontala con Jan o LM Studio.

GPT4All (spesso scritto « GPT for All ») è una delle applicazioni di chat locale per il grande pubblico nate per prime. Questa guida spiega cosa fa oggi, come installarla e caricare un primo modello, quanto valgono realmente LocalDocs e il server locale e in quali casi è meglio scegliere altro.

Di Mohamed Meguedmi·Agg. 2026-09-30·Testato su Windows, macOS e Linux

#Che cos'è GPT4All e qual è il suo stato nel 2026

GPT4All è sviluppato da Nomic AI. Il repository ufficiale lo descrive come uno strumento che esegue modelli linguistici in modo privato su computer desktop e portatili, senza chiamate API né necessità di una GPU. Il repository conta circa 77.000 stelle e la licenza è MIT. L'applicazione si basa su llama.cpp e può caricare modelli in formato GGUF.

Lo stato del progetto è la prima cosa da sapere. L'ultima versione pubblicata è la 3.10.0, del 25 febbraio 2025, cioè più di un anno e mezzo prima di questo articolo. Il sito storico gpt4all.io reindirizza ora verso una pagina di Nomic focalizzata sulla sua piattaforma per le aziende. L'applicazione rimane utilizzabile, e nulla indica che smetta di funzionare, ma non devi aspettarti nuove funzioni né un motore di inferenza aggiornato.

!
Conseguenza pratica: il funzionamento dei modelli recenti non è garantito
GPT4All si basa su un motore llama.cpp fermo alla sua ultima versione. I modelli pubblicati da febbraio 2025 possono utilizzare architetture che questo motore non conosce. La ricerca Hugging Face dell'applicazione ti mostrerà modelli recenti senza garantire che possano essere caricati: prova sempre un modello prima di farci affidamento e resta sulle famiglie collaudate (Llama 3, Mistral, Phi-3) se vuoi evitare sorprese.

#1. Installazione

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

I programmi di installazione si trovano nella pagina del repository ufficiale nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Scaricali soltanto da questa fonte: la pagina che si apre all'indirizzo storico gpt4all.io non è più quella del software. I prerequisiti indicati dal repository: per Windows e Linux, un processore Intel Core i3 di seconda generazione, AMD Bulldozer o superiore; la build Linux è esclusivamente x86-64; per macOS, Monterey 12.6 o successivo, con risultati migliori sui chip Apple Silicon della serie M.

Requisiti di installazione in base al sistema
SistemaInstallatorePrerequisiti indicati dal repository
WindowsProgramma di installazione per Windows (e versione ARM)Intel Core i3 2a generazione, AMD Bulldozer o meglio; ARM: Snapdragon, SQ1, SQ2
macOSProgramma di installazione per macOSMonterey 12.6 o successivo; Apple Silicon consigliato
LinuxProgramma di installazione per UbuntuSolo processori x86-64, niente ARM

#2. Primo modello

Al primo avvio, l'applicazione propone un modello predefinito. La documentazione consiglia di iniziare con Llama 3, che si scarica dal pulsante di aggiunta del modello. Specifica che GPT4All si connette a modelli di Hugging Face con un motore llama.cpp, e che la maggior parte ha l'estensione .gguf.

  1. 01
    Aprire Models
    Nel menu di sinistra, fai clic su Models, poi su + Add Model per accedere alla pagina Explore Models.
  2. 02
    Cercare un modello
    Cerca tra i modelli disponibili online, oppure ordina i risultati per popolarità, download o data tramite l'icona dell'ingranaggio.
  3. 03
    Scaricare
    Fai clic su Download. Il file viene salvato sul tuo disco; non è richiesta alcuna iscrizione.
  4. 04
    Caricare e chattare
    Vai nella sezione Chats, fai clic su Load Default Model (Llama 3 o il modello che hai appena scaricato) e poni la tua prima domanda.

La tabella qui sotto riporta gli esempi della documentazione ufficiale, con la memoria RAM indicata dall'editore. La colonna «Licenza» è importante: GPT4All elenca modelli con condizioni molto diverse, tra cui uno con licenza non commerciale.

Modelli di esempio della documentazione GPT4All
ModelloFileRAM richiestaDimensioneLicenza
Llama 3 Instruct4,66 GB8 GB8 miliardi, q4_0Meta Llama 3 License
Nous Hermes 2 Mistral DPO4,11 GB8 GB7 miliardi, q4_0Apache 2.0
Phi-3 Mini Instruct2,18 GB4 GB4 miliardi, q4_0MIT
Mini Orca (Small)1,98 GB4 GB3 miliardi, q4_0CC-BY-NC-SA-4.0 (uso non commerciale)

Dove sono conservati i modelli? La cartella di download si imposta nelle impostazioni e, per impostazione predefinita, si trova in AppData\Local\nomic.ai\GPT4All su Windows, in Library/Application Support/nomic.ai/GPT4All su macOS e in .local/share/nomic.ai/GPT4All su Linux. Un modello da 4 a 5 GB occupa lo stesso spazio sul disco: se il tuo disco di sistema è piccolo, imposta questa cartella su un disco secondario prima di scaricare diversi modelli.

#GPT4All in francese

L'applicazione offre impostazioni per la lingua e le preferenze regionali dell'interfaccia. Per le risposte, tutto dipende dal modello: Llama 3 e i modelli derivati da Mistral comprendono e scrivono in francese, con una qualità variabile. Non affidarti a una classifica in lingua inglese: poni tre domande nel tuo settore, in francese, e valuta la risposta. Se usi principalmente il francese, i modelli Mistral e Qwen del catalogo QuelLLM sono candidati migliori, a condizione che possano essere caricati nel motore la cui versione rimane fissa.

#Molta RAM con una CPU: cosa cambia

Una macchina con 256 GB di RAM senza scheda grafica può caricare modelli molto grandi, ma la velocità di generazione dipende dalla banda passante della memoria, non dalla capacità. Ordine di grandezza teorico: il limite massimo dei token al secondo è dato dalla banda passante in GB/s divisa per il peso del modello in GB. A titolo di esempio aritmetico, 80 GB/s divisi per 40 GB di peso danno al massimo 2 token al secondo. Non è una misurazione, ma soltanto un limite massimo.

L'unico parametro che può aiutare è il numero di thread del processore. Nelle impostazioni avanzate, GPT4All lo ha impostato per default a 4; la documentazione indica che più thread possono accelerare le risposte. Aumentalo progressivamente, lasciando alcuni core liberi per il sistema. Se hai una scheda grafica, puoi impostare il dispositivo su Auto, Metal, CPU o GPU.

#3. La chat e le impostazioni che contano

L'interfaccia è quella di un'app di messaggistica: conversazione al centro, messaggio in basso, regolazioni del modello nelle impostazioni. Tre valori predefiniti meritano attenzione. La lunghezza del contesto è di 2.048 token, molto breve per un documento lungo. La temperatura è di 0,7. E il numero di livelli caricati nella memoria video è fissato a 32, da regolare in base alla tua scheda.

→
Aumenta la lunghezza del contesto prima di incollare un testo lungo
A 2.048 token, una pagina di testo basta a saturare la finestra. Aumenta il valore nelle impostazioni del modello, monitorando la memoria: un contesto più lungo consuma più RAM e rallenta la generazione.

#4. LocalDocs: il RAG integrato, con le sue limitazioni

LocalDocs ti permette di dialogare con i tuoi file senza scrivere una riga di codice. Crei una raccolta indicando una cartella; l'applicazione suddivide i tuoi file in estratti e li indicizza con i modelli di embedding di Nomic, eseguiti sul tuo computer. In una chat, attivi la raccolta e il modello riceve nel prompt gli estratti semanticamente vicini alla tua domanda, con le fonti visualizzate sotto la risposta.

  1. 01
    Creare la collezione
    Apri LocalDocs, assegna un nome alla collezione e scegli la cartella, poi clicca su Create Collection.
  2. 02
    Attendere l'indicizzazione
    Viene mostrato l'avanzamento; un indicatore verde Ready segnala il completamento. Puoi già interrogare i file pronti.
  3. 03
    Attivarlo in una chat
    Apri LocalDocs con il pulsante in alto a destra della chat, poi spunta la casella della collezione.
  4. 04
    Verificare le fonti
    Fai clic su Sources sotto la risposta per vedere quali file sono stati utilizzati.

#Cosa non fa LocalDocs

Tre limiti documentati spiegano le delusioni. Innanzitutto, i tipi di file indicizzati per impostazione predefinita sono .txt, .pdf, .md e .rst: un file Word deve prima essere convertito. Inoltre, ogni estratto contiene per impostazione predefinita 512 caratteri e l'applicazione ne inserisce al massimo tre per richiesta: il modello vede quindi solo circa 1.500 caratteri dei tuoi documenti a ogni domanda. Infine, questo approccio risponde bene a una domanda mirata («cosa dice la clausola 4?») e male a una richiesta di sintesi di un intero dossier.

Le impostazioni avanzate permettono di aumentare le dimensioni degli estratti e il loro numero, con questa avvertenza riportata dalla documentazione: ciò può migliorare l'affidabilità delle risposte, ma rallenta la generazione e consuma spazio di contesto, già limitato a 2.048 token per impostazione predefinita. Se hai bisogno di conversare con una vera base documentale, uno strumento come AnythingLLM o Open WebUI è più adatto.

#5. Server locale compatibile con OpenAI

GPT4All include un server API compatibile con OpenAI, disattivato per impostazione predefinita. Per attivarlo: Impostazioni, Applicazione, sezione Avanzate, poi spunta la casella «Enable Local API Server». Ascolta sulla porta 4891, solo su localhost (127.0.0.1), e accetta solo HTTP, non HTTPS. L'indirizzo base è http://localhost:4891/v1.

Esempio di chiamata tratto dalla documentazione ufficiale
curl -X POST http://localhost:4891/v1/chat/completions -d '{
  "model": "Phi-3 Mini Instruct",
  "messages": [{"role":"user","content":"Who is Lionel Messi?"}],
  "max_tokens": 50,
  "temperature": 0.28
}'

Gli endpoint disponibili sono /v1/models, /v1/models/nom-du-modèle, /v1/completions e /v1/chat/completions. Il nome del modello nella richiesta deve corrispondere a quello visualizzato nell’applicazione. Un accorgimento documentato: LocalDocs può essere attivato per la chat del server dall’interfaccia (non tramite API), e i riferimenti utilizzati vengono restituiti nella risposta, in choices[0].references.

#Confidenzialità: tre impostazioni da conoscere

Per impostazione predefinita, tutto rimane sul tuo computer. Tre opzioni cambiano questa situazione, ed è necessario sapere dove si trovano. L'opzione Datalake, che condivide anonimamente le tue interazioni con la comunità GPT4All, è disattivata per impostazione predefinita. L'opzione «Use Nomic Embed API», che crea le raccolte LocalDocs al di fuori del dispositivo tramite l'API di Nomic, è disattivata per impostazione predefinita e richiede una chiave. Infine, l'aggiunta di un «Model API» (una chiave di un fornitore remoto) invia i tuoi prompt a quel fornitore, come la documentazione precisa senza ambiguità.

#Punti di forza, limiti e alternative

GPT4All o un'alternativa a seconda della tua situazione
La tua situazioneGPT4All va bene?Alternativa da considerare
Macchina modesta, primo tentativo, senza riga di comandoSì, è il suo caso d'usoJan se vuoi un progetto più attivo
Parlare con alcuni file di testo o PDFSì per domande specificheAnythingLLM per una vera base documentale
Modelli molto recenti (dal 2025 in poi)Non garantito, motore non più aggiornatoLM Studio o Ollama, aggiornati regolarmente
Server condiviso per un teamNo: solo localhost, HTTPOllama e Open WebUI
Punti di forza
Ciclo breve «scaricare e poi chattare», senza account, LocalDocs senza codice, server compatibile con OpenAI, funziona anche senza GPU.
Punti deboli
Motore fermo da febbraio 2025, contesto predefinito di 2.048 token, LocalDocs limitato a tre estratti di 512 caratteri, catalogo che sta invecchiando.
Domande frequenti
GPT4All è gratuito e funziona offline?+
Sì: il codice è distribuito sotto licenza MIT e l'applicazione non richiede né un account né un abbonamento. Una volta scaricato un modello, funziona senza connessione. Fai attenzione solo alle opzioni che inviano dati: Datalake, l'API di embedding di Nomic e le connessioni a fornitori di modelli remoti, tutte disattivate per impostazione predefinita o attivabili solo su scelta dell'utente.
GPT4All è ancora mantenuto nel 2026?+
L'ultima versione pubblicata, la 3.10.0, risale a febbraio 2025, e il sito storico reindirizza verso una piattaforma aziendale di Nomic. L'applicazione funziona, ma senza nuove funzioni annunciate. Per un uso duraturo con modelli recenti, preferisci un'applicazione regolarmente aggiornata come LM Studio o Jan.
Quali modelli usare con GPT4All?+
Inizia con quelli citati nella documentazione: Llama 3 Instruct (4,66 GB, 8 GB di RAM), Nous Hermes 2 Mistral DPO o Phi-3 Mini per una macchina di piccole dimensioni. La compatibilità dei modelli GGUF recenti non è garantita, poiché il motore non viene più aggiornato. Controlla la licenza: alcuni modelli elencati sono riservati all'uso non commerciale.
GPT4All funziona in francese?+
L'interfaccia offre un'impostazione per la lingua, e i modelli Llama 3 o derivati da Mistral scrivono in francese con una qualità variabile. Prova tre domande relative al tuo settore prima di scegliere un modello. Se il francese è prioritario, confrontali con i modelli Mistral e Qwen di un catalogo aggiornato.
Una macchina con 256 GB di RAM cambia qualcosa?+
Permette di caricare modelli molto grandi, ma su processore la velocità dipende dalla banda passante della memoria, non dalla capacità. Il limite teorico è questa banda passante divisa per il peso del modello. Aumenta il numero di thread nei parametri avanzati, impostato a 4 per default, e prova con un modello di dimensioni medie.
Come interrogare i miei documenti con GPT4All?+
Crea una raccolta LocalDocs indicando una cartella di file .txt, .pdf, .md o .rst, attendi l'indicatore Ready, poi attivala in una chat. Il modello riceve al massimo tre estratti di 512 caratteri per domanda: è adatto a domande precise, non alla sintesi di un intero insieme di documenti.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.