LM Studio : tutorial completo 2026 (installazione, API)
LM Studio è una app desktop che trasforma il tuo computer in un server LLM locale senza toccare il terminale. La versione 0.3+ aggiunge il supporto MCP, un motore GGUF migliore e un'esperienza di download dei modelli direttamente da Hugging Face. Ecco un tutorial LM Studio 2026 completo: installazione sui tre OS, primo modello, server compatibile con OpenAI sulla porta 1234, e confronto onesto con Ollama e Jan.
#Primo risultato: download, caricamento, verifica
La documentazione ufficiale descrive il percorso Discover → download → Chat → caricamento del modello. Scegli il file per il tuo motore: GGUF per llama.cpp, o una distribuzione MLX compatibile su Apple Silicon. Un modello scaricato non è ancora caricato. Inizia con un contesto breve, poi poni una domanda semplice prima di aggiungere documenti o un server API.
In caso di memoria insufficiente, riduci il contesto e scegli un file più piccolo; controlla l'offload GPU. Il modello e il contesto condividono il budget con il sistema su Apple Silicon. I passaggi per Windows/macOS sono stati revisionati nella documentazione; il cartella del 12 settembre è stato eseguito sotto Linux con Ollama, non con LM Studio.
- Percorso ufficiale per iniziare
- Parametri ufficiali di caricamento
- Verifica il budget di memoria
- Scheda Qwen3 8B
- Scegli un primo percorso gratuito
#Perché LM Studio nel 2026
LM Studio è installato e il tuo primo modello risponde. Il seguito è nel kit IA Locale: scegliere il modello adatto alla tua macchina (cap. 3), sfruttare più a fondo LM Studio (cap. 5), poi fargli leggere i tuoi documenti (cap. 8).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
LM Studio occupa una nicchia precisa: l'utente che vuole una vera app grafica, non un daemon CLI. Apri l'app, cerchi un modello nella barra di ricerca integrata (che punta a Hugging Face), fai clic su Download e chatti. Zero file di configurazione, zero righe di comando.
Sotto il cofano, LM Studio integra llama.cpp con supporto per CUDA, Metal, Vulkan e ROCm, nonché un motore MLX dedicato ai Mac Apple Silicon. La versione 0.3 ha introdotto la schermata «Power User» per rendere accessibili tutti i parametri (tipo di KV cache, flash attention, offload sulla GPU strato per strato), e la 0.3.x ha aggiunto il supporto nativo ai server MCP — puoi collegare il tuo modello locale a strumenti come un file system o un database, senza scrivere codice.
#Prerequisiti
- Windows
- Windows 10/11 a 64 bit. AVX2 richiesto (tutte le CPU dal 2014). Supporto CUDA con una GPU NVIDIA, Vulkan altrimenti.
- macOS
- macOS 13.4+ su Apple Silicon (M1/M2/M3/M4). I Mac Intel non sono più supportati dalla versione 0.3.
- Linux
- AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch recente). Build ARM64 disponibile per gli SBC.
- RAM
- 16 GB sono il minimo per un uso confortevole; 8 GB sono al limite. Per un modello 14B in Q4, prevedi 12 GB liberi; per un modello 32B, 24 GB.
- Disco
- Prevedi da 30 a 50 GB: un modello 14B in Q4 pesa circa 9 GB e ne scaricherai diversi.
#1. Installazione su Windows, Mac e Linux
Scarica l'installatore corrispondente al tuo sistema operativo dal sito ufficiale. Nessun pacchetto npm, nessun Homebrew — è un'app desktop classica.
- 01WindowsEsegui LM-Studio-Setup.exe. SmartScreen può bloccare il file all'atto del primo avvio — clicca su «Informazioni aggiuntive» poi su «Esegui comunque». L'app viene installata in %LOCALAPPDATA%\Programs\lm-studio.
- 02macOSApri il .dmg e trascina LM Studio.app in /Applications. Al primo avvio, Gatekeeper potrebbe chiederti di autorizzare l'app in Impostazioni → Privacy e sicurezza. Su Apple Silicon, il motore MLX è attivato per impostazione predefinita.
- 03LinuxScarica l'AppImage, rendila eseguibile con chmod +x LM_Studio-0.3.x.AppImage, poi avviala. Per integrarla nel menu, usa AppImageLauncher o crea un .desktop manualmente.
#2. Scaricare Qwen3-Coder in GGUF
La scheda Discover (lente d'ingrandimento) è la tua interfaccia verso Hugging Face. Digita il nome di un modello, scegli una quantizzazione e clicca su Download. Per questo tutorial scegliamo Qwen3-Coder-30B-A3B, il modello open-weight di riferimento per la programmazione per chi ha 16 GB di VRAM o più.
- 01Cercare il modelloIn Discover, digita "qwen3-coder". LM Studio mostra i repository GGUF compatibili (generalmente bartowski, unsloth, lmstudio-community). Preferisci i repository lmstudio-community o bartowski: i loro GGUF sono validati sulla versione attuale del motore.
- 02Scegliere la quantizzazionePer 24 GB di VRAM, Q4_K_M è il punto ideale (qualità ~99% del FP16, dimensione ~17 GB). Per 16 GB, scendi a Q3_K_M. Per 32 GB o Mac Studio, Q5_K_M o Q8_0 se vuoi la massima precisione.
- 03Avviare il downloadFai clic su Download. L'avanzamento viene visualizzato nella scheda Downloads. Con una connessione in fibra, considera circa 5 minuti per un file da 17 GB.
- 04Caricare il modelloVai alla scheda Chat, apri il selettore in alto e scegli Qwen3-Coder. Se sei in modalità Power User, regola GPU Offload (per impostazione predefinita LM Studio sceglie il valore massimo sicuro), Context Length (32k sono un valore confortevole per lavorare sul codice) e attiva Flash Attention.
#3. Prima chat e verifica della GPU
Con il modello caricato, poni una domanda in Chat. LM Studio mostra in fondo a ogni risposta i token/sec, il tempo al primo token e l'uso effettivo della VRAM. È più indicativo che eseguire nvidia-smi in parallelo.
Su una RTX 4090, Qwen3-Coder-30B-A3B in Q4 raggiunge circa 90-120 tok/s grazie alla sua architettura MoE (3B attivi su 30B). Su un M4 Pro da 48 GB, aspettati 35-50 tok/s con il motore MLX. Su una RTX 3060 da 12 GB, il modello 30B non entra in memoria: passa a Qwen 3.5 9B (~6,6 GB in Q4), che ci sta comodamente e lascia margine per il contesto.
#4. Server compatibile con OpenAI sulla porta 1234
È il vantaggio che molti non conoscono: LM Studio espone un server HTTP compatibile con l'API OpenAI, per impostazione predefinita su http://localhost:1234. Puoi quindi collegare qualsiasi client OpenAI (SDK Python, LangChain, Continue.dev, Cursor, la tua app sviluppata in proprio) a LM Studio senza modificare una riga di logica applicativa, cambiando solo l'URL di base e la chiave.
- 01Attivare Developer ModeIn basso a sinistra, cambia il ruolo utente in "Developer". La scheda Local Server (icona del terminale) appare nella barra di sinistra.
- 02Avviare il serverScheda Local Server → scegli il modello da esporre nel menu in alto → fai clic su Start Server. Per impostazione predefinita, il server ascolta su localhost:1234. Spunta "Serve on Local Network" se vuoi esporlo alle altre macchine della tua LAN.
- 03Verificare l'endpointIl server espone le route /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (se è caricato un modello di embedding). Verifica prima l'elenco dei modelli.
#5. Supporto nativo MCP
Dalla versione 0.3.17, LM Studio supporta il Model Context Protocol (MCP) — lo standard introdotto da Anthropic nel 2024 per collegare strumenti esterni a un LLM. In pratica: il tuo modello locale può accedere al tuo file system, eseguire SQL e chiamare un'API, a condizione che sia configurato un server MCP.
La configurazione si fa nel file mcp.json, accessibile dal menu Program → Edit mcp.json. Ecco un esempio che aggiunge il server filesystem ufficiale di Anthropic e un server SQLite.
Dopo la registrazione, gli strumenti MCP compaiono nell'icona della spina (plug) della chat. Puoi attivarli all'occorrenza. Il modello decide poi quando chiamarli: utile per creare un piccolo agente locale senza scrivere codice, per esempio « riassumi tutti i PDF della cartella Ricerca » oppure « quante righe ci sono nella tabella users ».
#LM Studio vs Ollama vs Jan
I tre strumenti mirano allo stesso obiettivo (LLM locale senza cloud) con filosofie diverse.
- LM Studio
- App desktop ricca di funzionalità, ricerca HF integrata, server API :1234, supporto MCP, MLX su Mac. A codice chiuso ma gratuita. Ideale se vuoi tutto in un'unica soluzione con un'interfaccia grafica ben fatta.
- Ollama
- Daemon leggero + CLI, ascolta su :11434, enorme libreria di modelli preconfigurati (ollama run qwen3.5:9b), API stabile, integrazioni ovunque (Cline, Open WebUI, n8n). Open source. Ideale se sei a tuo agio con il terminale e vuoi usarlo in modalità headless.
- Jan
- App desktop open source (AGPL), filosofia «offline-first» radicale, più giovane e meno ricca di funzionalità di LM Studio. Interessante se per te l'open source conta e vuoi un'app desktop.
#Risoluzione dei problemi
- Il modello non si carica (OOM)
- Riduci manualmente il GPU Offload nei Settings della chat. Se carichi il 100% sulla GPU e si verifica un arresto anomalo, scendi all'80%: alcuni strati passano in RAM, è più lento ma funziona.
- Token/s molto bassi
- Verifica che Flash Attention sia attivato e che KV cache type sia impostato su Q8_0 (non FP16). In modalità Power User, queste impostazioni si trovano nella barra laterale destra della chat.
- Il server API non risponde
- Verifica di essere in Developer Mode e che il pulsante Start Server sia verde. Su Windows, il firewall può bloccare la porta 1234: autorizza LM Studio nel firewall Windows Defender.
- Modello non trovato nella ricerca
- LM Studio elenca solo i repository GGUF compatibili con la propria versione di llama.cpp. Per i modelli molto recenti, aggiorna LM Studio (Help → Check for Updates) oppure scarica manualmente il GGUF e inseriscilo nella cartella models.
- Linux: AppImage non si avvia
- Installa libfuse2 (sudo apt install libfuse2 su Ubuntu 22.04+). Su Wayland, esporta QT_QPA_PLATFORM=xcb se l'app non si mostra correttamente.
#Per approfondire
Tre percorsi naturali a seconda di ciò che vuoi fare dopo:
- Confronta in dettaglio
- La guida « LM Studio vs Ollama: quale scegliere nel 2026 » confronta i due strumenti funzionalità per funzionalità, con una griglia decisionale in base al tuo profilo.
- Collegare LM Studio ai tuoi PDF
- «RAG locale con LM Studio: conversare con i tuoi documenti» spiega la funzione Chat with Documents, i suoi limiti e quando passare ad AnythingLLM.
- Accelerare ancora l'inferenza
- « LM Studio e il MTP (Multi-Token Prediction) » spiega come attivare il MTP sui modelli compatibili per aumentare la velocità di generazione dal 30 all'80%.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.