GPT4All: primi passi
GPT4All è un'applicazione desktop gratuita (licenza MIT, pubblicata da Nomic) che esegue un modello linguistico sul tuo computer, senza necessità di una GPU e senza account. La installi, scarichi un modello GGUF e inizi a chattare. La sua ultima versione, la 3.10.0, risale a febbraio 2025: funziona, ma il catalogo è datato e LocalDocs rimane limitato. Un buon punto di partenza su un computer modesto; altrimenti, confrontala con Jan o LM Studio.
GPT4All (spesso scritto « GPT for All ») è una delle applicazioni di chat locale per il grande pubblico nate per prime. Questa guida spiega cosa fa oggi, come installarla e caricare un primo modello, quanto valgono realmente LocalDocs e il server locale e in quali casi è meglio scegliere altro.
#Che cos'è GPT4All e qual è il suo stato nel 2026
GPT4All è sviluppato da Nomic AI. Il repository ufficiale lo descrive come uno strumento che esegue modelli linguistici in modo privato su computer desktop e portatili, senza chiamate API né necessità di una GPU. Il repository conta circa 77.000 stelle e la licenza è MIT. L'applicazione si basa su llama.cpp e può caricare modelli in formato GGUF.
Lo stato del progetto è la prima cosa da sapere. L'ultima versione pubblicata è la 3.10.0, del 25 febbraio 2025, cioè più di un anno e mezzo prima di questo articolo. Il sito storico gpt4all.io reindirizza ora verso una pagina di Nomic focalizzata sulla sua piattaforma per le aziende. L'applicazione rimane utilizzabile, e nulla indica che smetta di funzionare, ma non devi aspettarti nuove funzioni né un motore di inferenza aggiornato.
#1. Installazione
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
I programmi di installazione si trovano nella pagina del repository ufficiale nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Scaricali soltanto da questa fonte: la pagina che si apre all'indirizzo storico gpt4all.io non è più quella del software. I prerequisiti indicati dal repository: per Windows e Linux, un processore Intel Core i3 di seconda generazione, AMD Bulldozer o superiore; la build Linux è esclusivamente x86-64; per macOS, Monterey 12.6 o successivo, con risultati migliori sui chip Apple Silicon della serie M.
| Sistema | Installatore | Prerequisiti indicati dal repository |
|---|---|---|
| Windows | Programma di installazione per Windows (e versione ARM) | Intel Core i3 2a generazione, AMD Bulldozer o meglio; ARM: Snapdragon, SQ1, SQ2 |
| macOS | Programma di installazione per macOS | Monterey 12.6 o successivo; Apple Silicon consigliato |
| Linux | Programma di installazione per Ubuntu | Solo processori x86-64, niente ARM |
#2. Primo modello
Al primo avvio, l'applicazione propone un modello predefinito. La documentazione consiglia di iniziare con Llama 3, che si scarica dal pulsante di aggiunta del modello. Specifica che GPT4All si connette a modelli di Hugging Face con un motore llama.cpp, e che la maggior parte ha l'estensione .gguf.
- 01Aprire ModelsNel menu di sinistra, fai clic su Models, poi su + Add Model per accedere alla pagina Explore Models.
- 02Cercare un modelloCerca tra i modelli disponibili online, oppure ordina i risultati per popolarità, download o data tramite l'icona dell'ingranaggio.
- 03ScaricareFai clic su Download. Il file viene salvato sul tuo disco; non è richiesta alcuna iscrizione.
- 04Caricare e chattareVai nella sezione Chats, fai clic su Load Default Model (Llama 3 o il modello che hai appena scaricato) e poni la tua prima domanda.
La tabella qui sotto riporta gli esempi della documentazione ufficiale, con la memoria RAM indicata dall'editore. La colonna «Licenza» è importante: GPT4All elenca modelli con condizioni molto diverse, tra cui uno con licenza non commerciale.
| Modello | File | RAM richiesta | Dimensione | Licenza |
|---|---|---|---|---|
| Llama 3 Instruct | 4,66 GB | 8 GB | 8 miliardi, q4_0 | Meta Llama 3 License |
| Nous Hermes 2 Mistral DPO | 4,11 GB | 8 GB | 7 miliardi, q4_0 | Apache 2.0 |
| Phi-3 Mini Instruct | 2,18 GB | 4 GB | 4 miliardi, q4_0 | MIT |
| Mini Orca (Small) | 1,98 GB | 4 GB | 3 miliardi, q4_0 | CC-BY-NC-SA-4.0 (uso non commerciale) |
Dove sono conservati i modelli? La cartella di download si imposta nelle impostazioni e, per impostazione predefinita, si trova in AppData\Local\nomic.ai\GPT4All su Windows, in Library/Application Support/nomic.ai/GPT4All su macOS e in .local/share/nomic.ai/GPT4All su Linux. Un modello da 4 a 5 GB occupa lo stesso spazio sul disco: se il tuo disco di sistema è piccolo, imposta questa cartella su un disco secondario prima di scaricare diversi modelli.
#GPT4All in francese
L'applicazione offre impostazioni per la lingua e le preferenze regionali dell'interfaccia. Per le risposte, tutto dipende dal modello: Llama 3 e i modelli derivati da Mistral comprendono e scrivono in francese, con una qualità variabile. Non affidarti a una classifica in lingua inglese: poni tre domande nel tuo settore, in francese, e valuta la risposta. Se usi principalmente il francese, i modelli Mistral e Qwen del catalogo QuelLLM sono candidati migliori, a condizione che possano essere caricati nel motore la cui versione rimane fissa.
#Molta RAM con una CPU: cosa cambia
Una macchina con 256 GB di RAM senza scheda grafica può caricare modelli molto grandi, ma la velocità di generazione dipende dalla banda passante della memoria, non dalla capacità. Ordine di grandezza teorico: il limite massimo dei token al secondo è dato dalla banda passante in GB/s divisa per il peso del modello in GB. A titolo di esempio aritmetico, 80 GB/s divisi per 40 GB di peso danno al massimo 2 token al secondo. Non è una misurazione, ma soltanto un limite massimo.
L'unico parametro che può aiutare è il numero di thread del processore. Nelle impostazioni avanzate, GPT4All lo ha impostato per default a 4; la documentazione indica che più thread possono accelerare le risposte. Aumentalo progressivamente, lasciando alcuni core liberi per il sistema. Se hai una scheda grafica, puoi impostare il dispositivo su Auto, Metal, CPU o GPU.
#3. La chat e le impostazioni che contano
L'interfaccia è quella di un'app di messaggistica: conversazione al centro, messaggio in basso, regolazioni del modello nelle impostazioni. Tre valori predefiniti meritano attenzione. La lunghezza del contesto è di 2.048 token, molto breve per un documento lungo. La temperatura è di 0,7. E il numero di livelli caricati nella memoria video è fissato a 32, da regolare in base alla tua scheda.
#4. LocalDocs: il RAG integrato, con le sue limitazioni
LocalDocs ti permette di dialogare con i tuoi file senza scrivere una riga di codice. Crei una raccolta indicando una cartella; l'applicazione suddivide i tuoi file in estratti e li indicizza con i modelli di embedding di Nomic, eseguiti sul tuo computer. In una chat, attivi la raccolta e il modello riceve nel prompt gli estratti semanticamente vicini alla tua domanda, con le fonti visualizzate sotto la risposta.
- 01Creare la collezioneApri LocalDocs, assegna un nome alla collezione e scegli la cartella, poi clicca su Create Collection.
- 02Attendere l'indicizzazioneViene mostrato l'avanzamento; un indicatore verde Ready segnala il completamento. Puoi già interrogare i file pronti.
- 03Attivarlo in una chatApri LocalDocs con il pulsante in alto a destra della chat, poi spunta la casella della collezione.
- 04Verificare le fontiFai clic su Sources sotto la risposta per vedere quali file sono stati utilizzati.
#Cosa non fa LocalDocs
Tre limiti documentati spiegano le delusioni. Innanzitutto, i tipi di file indicizzati per impostazione predefinita sono .txt, .pdf, .md e .rst: un file Word deve prima essere convertito. Inoltre, ogni estratto contiene per impostazione predefinita 512 caratteri e l'applicazione ne inserisce al massimo tre per richiesta: il modello vede quindi solo circa 1.500 caratteri dei tuoi documenti a ogni domanda. Infine, questo approccio risponde bene a una domanda mirata («cosa dice la clausola 4?») e male a una richiesta di sintesi di un intero dossier.
Le impostazioni avanzate permettono di aumentare le dimensioni degli estratti e il loro numero, con questa avvertenza riportata dalla documentazione: ciò può migliorare l'affidabilità delle risposte, ma rallenta la generazione e consuma spazio di contesto, già limitato a 2.048 token per impostazione predefinita. Se hai bisogno di conversare con una vera base documentale, uno strumento come AnythingLLM o Open WebUI è più adatto.
#5. Server locale compatibile con OpenAI
GPT4All include un server API compatibile con OpenAI, disattivato per impostazione predefinita. Per attivarlo: Impostazioni, Applicazione, sezione Avanzate, poi spunta la casella «Enable Local API Server». Ascolta sulla porta 4891, solo su localhost (127.0.0.1), e accetta solo HTTP, non HTTPS. L'indirizzo base è http://localhost:4891/v1.
Gli endpoint disponibili sono /v1/models, /v1/models/nom-du-modèle, /v1/completions e /v1/chat/completions. Il nome del modello nella richiesta deve corrispondere a quello visualizzato nell’applicazione. Un accorgimento documentato: LocalDocs può essere attivato per la chat del server dall’interfaccia (non tramite API), e i riferimenti utilizzati vengono restituiti nella risposta, in choices[0].references.
#Confidenzialità: tre impostazioni da conoscere
Per impostazione predefinita, tutto rimane sul tuo computer. Tre opzioni cambiano questa situazione, ed è necessario sapere dove si trovano. L'opzione Datalake, che condivide anonimamente le tue interazioni con la comunità GPT4All, è disattivata per impostazione predefinita. L'opzione «Use Nomic Embed API», che crea le raccolte LocalDocs al di fuori del dispositivo tramite l'API di Nomic, è disattivata per impostazione predefinita e richiede una chiave. Infine, l'aggiunta di un «Model API» (una chiave di un fornitore remoto) invia i tuoi prompt a quel fornitore, come la documentazione precisa senza ambiguità.
#Punti di forza, limiti e alternative
| La tua situazione | GPT4All va bene? | Alternativa da considerare |
|---|---|---|
| Macchina modesta, primo tentativo, senza riga di comando | Sì, è il suo caso d'uso | Jan se vuoi un progetto più attivo |
| Parlare con alcuni file di testo o PDF | Sì per domande specifiche | AnythingLLM per una vera base documentale |
| Modelli molto recenti (dal 2025 in poi) | Non garantito, motore non più aggiornato | LM Studio o Ollama, aggiornati regolarmente |
| Server condiviso per un team | No: solo localhost, HTTP | Ollama e Open WebUI |
- Punti di forza
- Ciclo breve «scaricare e poi chattare», senza account, LocalDocs senza codice, server compatibile con OpenAI, funziona anche senza GPU.
- Punti deboli
- Motore fermo da febbraio 2025, contesto predefinito di 2.048 token, LocalDocs limitato a tre estratti di 512 caratteri, catalogo che sta invecchiando.
- Ollama vs LM Studio vs Jan vs GPT4All
- Jan: l'alternativa open source a ChatGPT
- Iniziare con LM Studio
- AnythingLLM: RAG pronto per la produzione in locale
- Open WebUI con Ollama: guida completa
- Fonte: repository GPT4All
- Fonte: documentazione GPT4All, modelli
- Fonte: documentazione GPT4All, impostazioni
GPT4All è gratuito e funziona offline?+
GPT4All è ancora mantenuto nel 2026?+
Quali modelli usare con GPT4All?+
GPT4All funziona in francese?+
Una macchina con 256 GB di RAM cambia qualcosa?+
Come interrogare i miei documenti con GPT4All?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.