LM Studio per principianti: prima chat locale in 10 minuti
LM Studio è la soluzione più vicina a ChatGPT per l'IA locale: un'applicazione grafica, uno store integrato per cercare e scaricare modelli, una chat che ricorda ciò che conosci. Zero righe di comando. Perfetto per iniziare senza terminale.
#Che cos'è LM Studio?
Un'applicazione desktop (Windows, macOS, Linux) che integra quattro componenti in un'unica interfaccia: un browser di modelli collegato a Hugging Face, un gestore dei download, un motore di inferenza (llama.cpp al suo interno) e una chat.
Lo strumento è gratuito per uso personale. Per un uso commerciale in azienda, è richiesta una licenza a partire dalla versione 0.3.
#1. Installazione
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- 01Scegli la tua piattaformaWindows .exe, macOS .dmg (Apple Silicon o Intel), Linux .AppImage. I binari occupano tra 400 e 600 MB: è normale, perché includono llama.cpp e le sue dipendenze.
- 02Avvia il programma di installazioneSu Windows, l'installazione avviene in %LOCALAPPDATA% (non sono necessari diritti di amministratore). Su Mac, trascina nella Cartella Applicazioni. Su Linux, rendi eseguibile l'AppImage: chmod +x LM_Studio_*.AppImage.
- 03Primo avvioLM Studio ti chiede quale livello di interfaccia mostrare (Power user o Developer). Power user è più che sufficiente per iniziare — potrai cambiare livello più tardi.
#2. Panoramica dell'interfaccia
La barra laterale a sinistra contiene le 5 viste essenziali:
- 💬 Chat
- L'interfaccia principale di conversazione. Sembra ChatGPT.
- 🔍 Discover
- Il 'store' dei modelli. Ricerca diretta su Hugging Face, download con un clic.
- 📁 My Models
- Tutti i modelli che hai scaricato, con le loro dimensioni e le loro quantizzazioni.
- 💻 Developer
- Modalità server locale compatibile con OpenAI (vedi sotto).
- ⚙️ Settings
- Parametri globali: cartella dei modelli, tema, integrazioni.
#3. Scaricare il tuo primo modello
Clicca su 🔍 Discover. La barra di ricerca cerca direttamente su Hugging Face. Per un primo tentativo nel 2026, inserisci Qwen 3.5 9B — la scelta migliore per 8 GB di VRAM (256k di contesto, visione, licenza Apache 2.0).
- 01Guarda i tag di compatibilitàA destra di ogni risultato, LM Studio indica Full GPU Offload possible, Partial GPU Offload o Likely too large. Queste indicazioni si basano sull'hardware rilevato sul tuo computer — basta scegliere un risultato contrassegnato in verde.
- 02Scegli la giusta quantizzazionePer un 9B come Qwen 3.5 9B su 8 GB di VRAM: Q4_K_M è il punto ottimale. Per 12 GB+: Q5_K_M o Q6_K (o addirittura Q8_0 sul 9B). Per 16 GB+: Q8_0 per la massima qualità.
- 03Clicca su DownloadTra 4 e 8 GB in base alla quantizzazione. LM Studio mostra in tempo reale il progresso.
#4. Prima conversazione
- 01Torna alla scheda ChatIn alto, fai clic sul selettore "Select a model to load" e scegli il modello che hai appena scaricato.
- 02Regola l'offload sulla GPULM Studio offre un cursore: 0 = tutto sulla CPU (lento ma funziona sempre), massimo = tutto sulla GPU (veloce ma va in crash se la VRAM è insufficiente). Imposta il cursore al massimo proposto per impostazione predefinita.
- 03Clicca su Load modelIl caricamento dura da 5 a 30 secondi a seconda della dimensione del modello e della velocità del tuo disco.
- 04Inserisci la tua domandaNel campo in basso. Premi Invio per inviare. Il modello risponde in streaming, token per token.
#5. Regolare la qualità delle risposte
Pannello a destra durante una conversazione. Tre impostazioni sono sufficienti per modificare il 90% del comportamento:
- Temperature
- 0.2 = fattuale, deterministico. 0.7 = equilibrato (valore predefinito). 1.2 = creativo, talvolta imprevedibile. Aumenta il valore se il modello è troppo ripetitivo.
- Context Length
- Quanti token precedenti il modello "vede". 4096 per impostazione predefinita. Aumenta il valore a 8192 o 16384 per documenti lunghi — attenzione, questo consuma VRAM.
- System Prompt
- Il messaggio invisibile che definisce il ruolo e le regole. Esempio: "Sei un assistente giuridico francese. Rispondi citando sempre l'articolo di legge applicabile."
#6. Modalità server locale (API)
LM Studio espone un server HTTP compatibile con l'API OpenAI. Qualsiasi strumento in grado di comunicare con ChatGPT può quindi funzionare in locale.
- 01Scheda DeveloperSeleziona un modello e clicca su Start Server (per impostazione predefinita sulla porta 1234).
- 02Prova con curlDa un terminale, un semplice GET verifica che il server risponda.
Nei tuoi script Python, basta impostare base_url su http://localhost:1234/v1 e usare una qualsiasi chiave API fittizia. Tutto ciò che funziona con OpenAI funziona.
#Limiti da conoscere
- Non completamente open source
- L'app stessa è proprietaria; solo il motore llama.cpp su cui si basa è open source. Per una soluzione al 100% libera, preferisci Jan o Ollama.
- Aggiornamenti automatici
- LM Studio si aggiorna da solo. Pratico ma inaspettato in ambiente professionale controllato.
- Licenza commerciale a pagamento
- Per un uso aziendale, leggere le condizioni. L'uso personale e educativo rimane gratuito.
- Nessun scripting nativo
- A differenza di Ollama, non c'è una CLI. Le automazioni passano esclusivamente attraverso il server API.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.