Principiante 12 minInterfacce

LM Studio : tutorial completo 2026 (installazione, API)

LM Studio è una app desktop che trasforma il tuo computer in un server LLM locale senza toccare il terminale. La versione 0.3+ aggiunge il supporto MCP, un motore GGUF migliore e un'esperienza di download dei modelli direttamente da Hugging Face. Ecco un tutorial LM Studio 2026 completo: installazione sui tre OS, primo modello, server compatibile con OpenAI sulla porta 1234, e confronto onesto con Ollama e Jan.

Di Mohamed Meguedmi·Agg. 2026-09-12·Testato su Windows 11

#Primo risultato: download, caricamento, verifica

La documentazione ufficiale descrive il percorso Discover → download → Chat → caricamento del modello. Scegli il file per il tuo motore: GGUF per llama.cpp, o una distribuzione MLX compatibile su Apple Silicon. Un modello scaricato non è ancora caricato. Inizia con un contesto breve, poi poni una domanda semplice prima di aggiungere documenti o un server API.

In caso di memoria insufficiente, riduci il contesto e scegli un file più piccolo; controlla l'offload GPU. Il modello e il contesto condividono il budget con il sistema su Apple Silicon. I passaggi per Windows/macOS sono stati revisionati nella documentazione; il cartella del 12 settembre è stato eseguito sotto Linux con Ollama, non con LM Studio.

Verificare i modelli installati e stimare il caricamento
lms ls
# Remplacer MODEL_KEY par une clé réellement affichée :
lms load MODEL_KEY --context-length 4096 --estimate-only

#Perché LM Studio nel 2026

Il kit IA Locale

LM Studio è installato e il tuo primo modello risponde. Il seguito è nel kit IA Locale: scegliere il modello adatto alla tua macchina (cap. 3), sfruttare più a fondo LM Studio (cap. 5), poi fargli leggere i tuoi documenti (cap. 8).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

LM Studio occupa una nicchia precisa: l'utente che vuole una vera app grafica, non un daemon CLI. Apri l'app, cerchi un modello nella barra di ricerca integrata (che punta a Hugging Face), fai clic su Download e chatti. Zero file di configurazione, zero righe di comando.

Sotto il cofano, LM Studio integra llama.cpp con supporto per CUDA, Metal, Vulkan e ROCm, nonché un motore MLX dedicato ai Mac Apple Silicon. La versione 0.3 ha introdotto la schermata «Power User» per rendere accessibili tutti i parametri (tipo di KV cache, flash attention, offload sulla GPU strato per strato), e la 0.3.x ha aggiunto il supporto nativo ai server MCP — puoi collegare il tuo modello locale a strumenti come un file system o un database, senza scrivere codice.

i
Licenza e uso commerciale
LM Studio è gratuito per uso personale. Per un uso commerciale in azienda, il modulo "LM Studio at Work" è ora disponibile in modalità self-service a partire dalla versione 0.3.5 — gratuito, ma da compilare. Per impostazione predefinita non viene inviata alcuna telemetria relativa ai modelli.

#Prerequisiti

Windows
Windows 10/11 a 64 bit. AVX2 richiesto (tutte le CPU dal 2014). Supporto CUDA con una GPU NVIDIA, Vulkan altrimenti.
macOS
macOS 13.4+ su Apple Silicon (M1/M2/M3/M4). I Mac Intel non sono più supportati dalla versione 0.3.
Linux
AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch recente). Build ARM64 disponibile per gli SBC.
RAM
16 GB sono il minimo per un uso confortevole; 8 GB sono al limite. Per un modello 14B in Q4, prevedi 12 GB liberi; per un modello 32B, 24 GB.
Disco
Prevedi da 30 a 50 GB: un modello 14B in Q4 pesa circa 9 GB e ne scaricherai diversi.

#1. Installazione su Windows, Mac e Linux

Scarica l'installatore corrispondente al tuo sistema operativo dal sito ufficiale. Nessun pacchetto npm, nessun Homebrew — è un'app desktop classica.

Sito ufficiale
https://lmstudio.ai/download
  1. 01
    Windows
    Esegui LM-Studio-Setup.exe. SmartScreen può bloccare il file all'atto del primo avvio — clicca su «Informazioni aggiuntive» poi su «Esegui comunque». L'app viene installata in %LOCALAPPDATA%\Programs\lm-studio.
  2. 02
    macOS
    Apri il .dmg e trascina LM Studio.app in /Applications. Al primo avvio, Gatekeeper potrebbe chiederti di autorizzare l'app in Impostazioni → Privacy e sicurezza. Su Apple Silicon, il motore MLX è attivato per impostazione predefinita.
  3. 03
    Linux
    Scarica l'AppImage, rendila eseguibile con chmod +x LM_Studio-0.3.x.AppImage, poi avviala. Per integrarla nel menu, usa AppImageLauncher o crea un .desktop manualmente.
Linux — primo avvio
chmod +x LM_Studio-0.3.x.AppImage
./LM_Studio-0.3.x.AppImage
→
Onboarding 2026
Al primo avvio, LM Studio 0.3+ ti propone una modalità «User», «Power User» o «Developer». La modalità Power User sblocca il controllo dettagliato (GPU layers, KV cache, flash attention); la modalità Developer aggiunge la scheda Local Server. Inizia con Power User — passerai a Developer quando l'API del server ti sarà utile.

#2. Scaricare Qwen3-Coder in GGUF

La scheda Discover (lente d'ingrandimento) è la tua interfaccia verso Hugging Face. Digita il nome di un modello, scegli una quantizzazione e clicca su Download. Per questo tutorial scegliamo Qwen3-Coder-30B-A3B, il modello open-weight di riferimento per la programmazione per chi ha 16 GB di VRAM o più.

  1. 01
    Cercare il modello
    In Discover, digita "qwen3-coder". LM Studio mostra i repository GGUF compatibili (generalmente bartowski, unsloth, lmstudio-community). Preferisci i repository lmstudio-community o bartowski: i loro GGUF sono validati sulla versione attuale del motore.
  2. 02
    Scegliere la quantizzazione
    Per 24 GB di VRAM, Q4_K_M è il punto ideale (qualità ~99% del FP16, dimensione ~17 GB). Per 16 GB, scendi a Q3_K_M. Per 32 GB o Mac Studio, Q5_K_M o Q8_0 se vuoi la massima precisione.
  3. 03
    Avviare il download
    Fai clic su Download. L'avanzamento viene visualizzato nella scheda Downloads. Con una connessione in fibra, considera circa 5 minuti per un file da 17 GB.
  4. 04
    Caricare il modello
    Vai alla scheda Chat, apri il selettore in alto e scegli Qwen3-Coder. Se sei in modalità Power User, regola GPU Offload (per impostazione predefinita LM Studio sceglie il valore massimo sicuro), Context Length (32k sono un valore confortevole per lavorare sul codice) e attiva Flash Attention.
→
VRAM per dimensione (Q4_K_M)
Riferimenti rapidi: 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Se LM Studio rifiuta di caricare interamente il modello sulla GPU, passa all'offload parziale sulla CPU: è fattibile, ma da 5 a 10 volte più lento.

#3. Prima chat e verifica della GPU

Con il modello caricato, poni una domanda in Chat. LM Studio mostra in fondo a ogni risposta i token/sec, il tempo al primo token e l'uso effettivo della VRAM. È più indicativo che eseguire nvidia-smi in parallelo.

Test rapido
# Dans le chat LM Studio :
Écris une fonction Python qui parse un CSV streaming
sans charger tout le fichier en mémoire.

Su una RTX 4090, Qwen3-Coder-30B-A3B in Q4 raggiunge circa 90-120 tok/s grazie alla sua architettura MoE (3B attivi su 30B). Su un M4 Pro da 48 GB, aspettati 35-50 tok/s con il motore MLX. Su una RTX 3060 da 12 GB, il modello 30B non entra in memoria: passa a Qwen 3.5 9B (~6,6 GB in Q4), che ci sta comodamente e lascia margine per il contesto.

i
Modalità "Just Show Me The Answer"
Per impostazione predefinita, i modelli di ragionamento mostrano la loro catena di pensiero in una sezione richiudibile. Nei Settings di una chat, puoi disattivare la visualizzazione del thinking per vedere solo la risposta finale. Nota: Qwen 3.8 27B tende a ragionare eccessivamente con la sua impostazione di ragionamento predefinita; imposta lo sforzo di ragionamento su «low» se le risposte tardano inutilmente.

#4. Server compatibile con OpenAI sulla porta 1234

È il vantaggio che molti non conoscono: LM Studio espone un server HTTP compatibile con l'API OpenAI, per impostazione predefinita su http://localhost:1234. Puoi quindi collegare qualsiasi client OpenAI (SDK Python, LangChain, Continue.dev, Cursor, la tua app sviluppata in proprio) a LM Studio senza modificare una riga di logica applicativa, cambiando solo l'URL di base e la chiave.

  1. 01
    Attivare Developer Mode
    In basso a sinistra, cambia il ruolo utente in "Developer". La scheda Local Server (icona del terminale) appare nella barra di sinistra.
  2. 02
    Avviare il server
    Scheda Local Server → scegli il modello da esporre nel menu in alto → fai clic su Start Server. Per impostazione predefinita, il server ascolta su localhost:1234. Spunta "Serve on Local Network" se vuoi esporlo alle altre macchine della tua LAN.
  3. 03
    Verificare l'endpoint
    Il server espone le route /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (se è caricato un modello di embedding). Verifica prima l'elenco dei modelli.
Test dell'API
curl http://localhost:1234/v1/models

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-coder-30b-a3b",
    "messages": [{"role": "user", "content": "Bonjour"}],
    "stream": false
  }'
Client Python ufficiale
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # ignorée, n'importe quelle chaîne
)

resp = client.chat.completions.create(
    model="qwen3-coder-30b-a3b",
    messages=[{"role": "user", "content": "Refactore ce code en idiomatic Rust : ..."}],
)
print(resp.choices[0].message.content)
→
Caricamento JIT del modello
Abilita « Just-in-Time Model Loading » nelle impostazioni del server. LM Studio carica quindi automaticamente il modello richiesto dalla chiamata API — utile se passi da un modello all'altro usando client diversi.

#5. Supporto nativo MCP

Dalla versione 0.3.17, LM Studio supporta il Model Context Protocol (MCP) — lo standard introdotto da Anthropic nel 2024 per collegare strumenti esterni a un LLM. In pratica: il tuo modello locale può accedere al tuo file system, eseguire SQL e chiamare un'API, a condizione che sia configurato un server MCP.

La configurazione si fa nel file mcp.json, accessibile dal menu Program → Edit mcp.json. Ecco un esempio che aggiunge il server filesystem ufficiale di Anthropic e un server SQLite.

mcp.json
{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": [
        "-y",
        "@modelcontextprotocol/server-filesystem",
        "/home/user/Documents"
      ]
    },
    "sqlite": {
      "command": "uvx",
      "args": ["mcp-server-sqlite", "--db-path", "/home/user/data.db"]
    }
  }
}

Dopo la registrazione, gli strumenti MCP compaiono nell'icona della spina (plug) della chat. Puoi attivarli all'occorrenza. Il modello decide poi quando chiamarli: utile per creare un piccolo agente locale senza scrivere codice, per esempio « riassumi tutti i PDF della cartella Ricerca » oppure « quante righe ci sono nella tabella users ».

!
Quale modello per l'uso di strumenti
Non tutti i modelli sono validi nel tool calling. Qwen3-Coder 30B-A3B, GLM 4.7 Flash (eccellente nelle attività agentiche), Devstral 24B e Mistral Small 24B funzionano bene, come qualsiasi modello addestrato esplicitamente per il function calling. I modelli piccoli (< 7B) inventano spesso i nomi degli strumenti: provali prima di distribuirli.

#LM Studio vs Ollama vs Jan

I tre strumenti mirano allo stesso obiettivo (LLM locale senza cloud) con filosofie diverse.

LM Studio
App desktop ricca di funzionalità, ricerca HF integrata, server API :1234, supporto MCP, MLX su Mac. A codice chiuso ma gratuita. Ideale se vuoi tutto in un'unica soluzione con un'interfaccia grafica ben fatta.
Ollama
Daemon leggero + CLI, ascolta su :11434, enorme libreria di modelli preconfigurati (ollama run qwen3.5:9b), API stabile, integrazioni ovunque (Cline, Open WebUI, n8n). Open source. Ideale se sei a tuo agio con il terminale e vuoi usarlo in modalità headless.
Jan
App desktop open source (AGPL), filosofia «offline-first» radicale, più giovane e meno ricca di funzionalità di LM Studio. Interessante se per te l'open source conta e vuoi un'app desktop.
→
Combo vincente
Molti utenti avanzati eseguono Ollama come demone server (24/7, senza interfaccia grafica) e usano LM Studio come client/esploratore per testare nuovi modelli prima di importarli in Ollama. I due possono convivere — non sono in ascolto sulla stessa porta.

#Risoluzione dei problemi

Il modello non si carica (OOM)
Riduci manualmente il GPU Offload nei Settings della chat. Se carichi il 100% sulla GPU e si verifica un arresto anomalo, scendi all'80%: alcuni strati passano in RAM, è più lento ma funziona.
Token/s molto bassi
Verifica che Flash Attention sia attivato e che KV cache type sia impostato su Q8_0 (non FP16). In modalità Power User, queste impostazioni si trovano nella barra laterale destra della chat.
Il server API non risponde
Verifica di essere in Developer Mode e che il pulsante Start Server sia verde. Su Windows, il firewall può bloccare la porta 1234: autorizza LM Studio nel firewall Windows Defender.
Modello non trovato nella ricerca
LM Studio elenca solo i repository GGUF compatibili con la propria versione di llama.cpp. Per i modelli molto recenti, aggiorna LM Studio (Help → Check for Updates) oppure scarica manualmente il GGUF e inseriscilo nella cartella models.
Linux: AppImage non si avvia
Installa libfuse2 (sudo apt install libfuse2 su Ubuntu 22.04+). Su Wayland, esporta QT_QPA_PLATFORM=xcb se l'app non si mostra correttamente.

#Per approfondire

Tre percorsi naturali a seconda di ciò che vuoi fare dopo:

Confronta in dettaglio
La guida « LM Studio vs Ollama: quale scegliere nel 2026 » confronta i due strumenti funzionalità per funzionalità, con una griglia decisionale in base al tuo profilo.
Collegare LM Studio ai tuoi PDF
«RAG locale con LM Studio: conversare con i tuoi documenti» spiega la funzione Chat with Documents, i suoi limiti e quando passare ad AnythingLLM.
Accelerare ancora l'inferenza
« LM Studio e il MTP (Multi-Token Prediction) » spiega come attivare il MTP sui modelli compatibili per aumentare la velocità di generazione dal 30 all'80%.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.