LM Studio su Linux: Ubuntu, Debian, Arch, Fedora (2026)
LM Studio su Linux è un’AppImage di circa 600 MB che include un’interfaccia grafica, uno store di modelli collegato a Hugging Face, un motore di inferenza llama.cpp e un server compatibile con OpenAI. Nessuna installazione a livello di sistema, nessun daemon, nessun repository da aggiungere — un file eseguibile, e basta. Questa guida tratta l’installazione, il download di un GGUF, l’avvio del server locale e le insidie specifiche di Linux (permessi, FUSE, GPU).
#Perché LM Studio su Linux
Su Linux, la scelta istintiva per un LLM locale è Ollama: daemon systemd, CLI pulita, ascolto predefinito su localhost:11434. È eccellente per l'uso su server. LM Studio affronta un altro aspetto: quello della postazione di lavoro con interfaccia grafica.
- Un'interfaccia completa senza terminale
- Chat, browser di modelli Hugging Face, gestore dei download, impostazioni di sampling: tutto in interfaccia grafica. Utile se vuoi testare rapidamente diversi modelli prima di passare in produzione.
- Un server compatibile con OpenAI in un clic
- La scheda Developer espone un endpoint http://localhost:1234/v1 che utilizza il protocollo OpenAI. Qualsiasi SDK (openai-python, LangChain, Continue.dev) può inviare richieste a questo endpoint senza modificare una riga di codice.
- Nessuna installazione a livello di sistema
- L'AppImage viene eseguita nello spazio utente. Niente sudo, nessun pacchetto da installare, nessun repository di terze parti. Per le macchine soggette a restrizioni imposte dal reparto IT o per le distribuzioni atipiche, è un vantaggio prezioso.
- Formato GGUF nativo
- LM Studio legge esclusivamente il GGUF (il formato di llama.cpp). È lo stesso formato utilizzato internamente da Ollama, quindi il 100% dei modelli popolari è disponibile.
#Prerequisiti
LM Studio funziona sul tuo sistema Linux. Il kit IA Locale ti accompagna nei passi successivi: le impostazioni avanzate di LM Studio (cap. 5) e, quando qualcosa non funziona, un albero diagnostico organizzato per sintomo — lentezza, scheda grafica ignorata, modello che dimentica tutto (cap. 14).
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Distribuzione Linux recente
- Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch o derivate. LM Studio è testato sulle principali distribuzioni, ma l'AppImage è portabile e funziona anche altrove (openSUSE, Linux Mint, Pop!_OS).
- glibc 2.35+
- L'AppImage include le proprie dipendenze grafiche ma non la glibc. Se usi una distribuzione molto vecchia (CentOS 7, Debian 10), non funzionerà.
- FUSE
- Le AppImage utilizzano FUSE per essere montate in lettura. La maggior parte delle distribuzioni lo installa per impostazione predefinita. Su Ubuntu 22.04+, avrai bisogno specificamente del pacchetto libfuse2.
- Almeno 8 GB di RAM
- Per eseguire un modello 7B in Q4. 16 GB per lavorare comodamente, 32 GB o più per i modelli 14B o per tenere aperto anche il tuo IDE.
- GPU (opzionale ma consigliato)
- NVIDIA con driver recenti (CUDA 12+), AMD con ROCm 6.x, o Intel Arc tramite Vulkan. Senza GPU, gira sulla CPU — utilizzabile per modelli da 3B, lento per modelli da 7B.
#1. Recuperare l'AppImage
Il sito ufficiale rileva automaticamente il tuo sistema operativo e propone la versione corretta. Verifica che tu stia effettivamente scaricando da lmstudio.ai — esistono mirror dubbi.
- 01Scarica il file .AppImageIl file binario occupa tra 500 e 700 MB. Include llama.cpp, l'interfaccia Electron e tutto il runtime. Salvalo in ~/Applications/ o ~/.local/bin/ per convenzione — in realtà puoi metterlo ovunque, perché l'AppImage è autosufficiente.
- 02Rendilo eseguibileCon il comando chmod +x. Senza questo passaggio, il file è solo un archivio inerte.
- 03Lancez-leDoppio clic dal tuo gestore file o dalla riga di comando. Al primo avvio, LM Studio estrae il suo contenuto in ~/.cache/AppImage/ — è normale e si ripete solo a ogni aggiornamento.
#2. Primo avvio
Al primo avvio, LM Studio chiede di scegliere un livello di interfaccia: User (solo chat), Power User (chat + impostazioni), Developer (tutto, incluso il server). Power User basta per esplorare; in seguito potrai passare a Developer per il server locale, da Settings → UI Mode.
La sidebar di sinistra organizza le viste:
- Chat
- L'interfaccia principale, simile a ChatGPT. È quella che userai il 90% del tempo.
- Discover
- Il catalogo dei modelli. Ricerca in tempo reale su Hugging Face, con un indicatore di compatibilità hardware (Full GPU Offload / Partial / Likely too large) basato sulla tua VRAM rilevata.
- My Models
- Tutti i tuoi modelli scaricati, con le loro dimensioni e le loro quantizzazioni. Utile per fare pulizia.
- Developer
- Server locale compatibile con OpenAI. Visibile solo in modalità Power User o Developer.
#3. Scaricare un modello GGUF
LM Studio legge soltanto il formato GGUF (il formato binario di llama.cpp, successore di GGML). Se un modello esiste su Hugging Face ma non in GGUF, non potrai caricarlo direttamente. La stragrande maggioranza dei modelli popolari (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) ha versioni GGUF mantenute dalla comunità.
- 01Apri Discover e cerca un modelloPer un primo tentativo, digita Qwen 3.5 9B o Granite 4.2 8B — le scelte affidabili del 2026 per la fascia 6-8 GB di VRAM. LM Studio elenca le varianti GGUF disponibili, solitamente pubblicate da bartowski, unsloth o lmstudio-community.
- 02Leggi i tag di compatibilitàA destra di ogni variante c’è un indicatore verde/arancione/rosso: “Full GPU Offload” significa che il modello entra interamente nella tua VRAM. “Partial” = una parte verrà caricata nella RAM (l'esecuzione sarà più lenta). “Likely too large” = meglio lasciar perdere.
- 03Scegli la quantizzazioneQ4_K_M è il punto ottimale per la maggior parte dei casi (bassa perdita di qualità, circa il 50% della dimensione di FP16). Q5_K_M se hai il 30-40% di VRAM in più. Q8_0 per la qualità massima se hai spazio in abbondanza. FP16 solo per il fine-tuning o il confronto.
- 04Clicca su DownloadTra 4 e 8 GB per un 7B in base alla quantizzazione. Il download avviene in background, puoi avviarne diversi in parallelo.
Una volta scaricato il modello, torna su Chat, selezionalo dal menu a discesa in alto, imposta il cursore GPU offload al massimo proposto e clicca su Load model. Il caricamento richiede da 5 a 30 secondi, a seconda delle dimensioni del modello e della velocità del disco.
#4. Avviare il server locale sulla porta 1234
È qui che LM Studio va oltre la semplice chat grafica. La scheda Developer espone un server HTTP che usa esattamente lo stesso protocollo dell'API di OpenAI. Qualsiasi client OpenAI (openai-python, LangChain, LlamaIndex, Continue.dev) può collegarsi a questo server senza modifiche, semplicemente cambiando l'URL di base.
- 01Passa alla modalità DeveloperSettings → UI Mode → Developer. La scheda Developer (icona del terminale) compare nella barra laterale.
- 02Seleziona un modelloMenu nella parte superiore della scheda Developer. Il modello deve essere già scaricato. Puoi caricarne diversi in parallelo se la VRAM lo permette.
- 03Imposta Context Length e GPU OffloadMetti l'offload GPU al massimo purché la VRAM lo permetta. Il context length di 4096 per default basta per la maggior parte degli usi; aumentalo a 8192 o 16384 per RAG o documenti lunghi.
- 04Clicca su Start ServerIl server ascolta per impostazione predefinita su 127.0.0.1:1234. La porta è configurabile proprio accanto se la 1234 è già occupata.
Nel linguaggio Python, basta un client ufficiale di OpenAI. La chiave API può essere qualsiasi stringa — LM Studio non la verifica.
Per esporre il server sulla LAN (gli altri computer del team), cambia Host da 127.0.0.1 a 0.0.0.0 nelle impostazioni del server. Attenzione: LM Studio non dispone di alcuna autenticazione nativa. Su una rete condivisa, metti Caddy o Nginx davanti al server con autenticazione basic, oppure limita l'accesso tramite il firewall.
#5. Accelerazione GPU su Linux
È l'aspetto più insidioso di LM Studio su Linux. L'AppImage include diversi backend (CPU, CUDA, ROCm, Vulkan) e ne sceglie uno automaticamente all'avvio — ma il rilevamento automatico a volte sbaglia a seconda dei driver installati.
- NVIDIA (CUDA)
- Driver proprietari 535+ installati (nvidia-smi deve funzionare). CUDA 12.x è incluso nell'AppImage, non è necessario installarlo separatamente. Verifica in Settings → Hardware che la GPU sia elencata e che il backend sia effettivamente CUDA.
- AMD (ROCm)
- Driver ROCm 6.x installati sull'host (Radeon RX 6800 XT e successivi ufficialmente supportati, RX 6700 XT e RX 7600 spesso funzionanti con HSA_OVERRIDE_GFX_VERSION). Il tuo utente deve appartenere ai gruppi render e video.
- Intel Arc / iGPU
- Backend Vulkan, prestazioni discrete su Arc A770/A750 ma inferiori rispetto a NVIDIA/AMD. Installa vulkan-tools per verificare con vulkaninfo che la GPU venga rilevata.
- Nessuna GPU
- Fallback automatico sulla CPU. Per un Granite 4.2 8B Q4 su un Ryzen 7, aspettati 5-8 token/sec. Un modello da 3B come Qwen 3.5 2B o Granite 4.2 3B rimane molto utilizzabile. Al di sopra di 14B, la pazienza diventa un problema.
Il cursore GPU offload in Chat o Developer controlla quanti strati del modello vengono caricati sulla GPU. Impostalo al massimo finché la VRAM lo consente. Verifica il consumo effettivo in un terminale:
- Valori indicativi di VRAM per dimensione del modello (Q4)
- 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Questi valori aumentano un po' se aumenti la lunghezza del contesto oltre 4096.
- GPU di riferimento
- RTX 3060 12GB gestisce comodamente i modelli da 7B a 14B. RTX 4070 12GB: lo stesso, con margine. RTX 4080 16GB: modelli da 14B in Q5 e i primi modelli da 24B. RTX 4090 24GB: modelli da 32B in Q4 e da 70B in Q3. Mac M4 Pro con 24-48GB di memoria unificata: lo stesso su Apple Silicon, ma tramite la versione macOS di LM Studio.
#Insidie comuni
- L'AppImage non si avvia
- Avvialo da un terminale per vedere il messaggio di errore. Il problema più comune: libfuse2 mancante su Ubuntu 22.04+ (sudo apt install libfuse2 risolve il problema). Poi: glibc troppo vecchia (LM Studio richiede 2.35+, quindi niente CentOS 7 né Debian 10).
- La GPU non viene utilizzata
- Controlla nvidia-smi (o rocm-smi). Se la GPU non è elencata: driver mancanti o troppo vecchi. Se è elencata ma LM Studio continua a usare la CPU: Settings → Hardware permette di forzare il backend (CUDA/ROCm/Vulkan). Su AMD, l'utente deve appartenere ai gruppi render e video — disconnettiti e accedi di nuovo dopo il comando usermod.
- Il modello è lento nonostante la GPU
- VRAM saturata e offload parziale silenzioso. Riduci la lunghezza del contesto, abbassa il cursore GPU offload per misurare la soglia oppure scegli una quantizzazione più aggressiva (Q5 → Q4 → Q3).
- Porta 1234 già occupata
- Spesso è occupata da un altro servizio di sviluppo. Cambia la porta in Developer → Settings, oppure termina il processo: ss -tulpn | grep 1234. Non serve modificare il firewall per un utilizzo su localhost.
- Aggiornamenti automatici che causano malfunzionamenti
- LM Studio si aggiorna automaticamente per impostazione predefinita. In un ambiente controllato (azienda, integrazione CI/CD), disattiva gli aggiornamenti automatici tramite Settings → Updates. Annota il numero della versione che funziona per poter tornare indietro se necessario.
- Nessun autocompletamento CLI
- L'AppImage non offre una CLI ricca di funzionalità. Per attività di scripting avanzate, l'API HTTP del server (porta 1234) resta la soluzione più pulita. Se hai bisogno di una vera CLI, llama.cpp o Ollama sono più adatti.
#Per approfondire
Hai LM Studio installato, un GGUF caricato e un server compatibile con OpenAI in esecuzione. Ecco i passi successivi più naturali:
- Sfruttare a fondo il server API
- La guida Trasformare LM Studio in un server API descrive in dettaglio lo streaming, l'esecuzione di più modelli in parallelo, l'esposizione sicura sulla LAN e l'ottimizzazione delle prestazioni.
- Confronta con Ollama su Linux
- La guida Installare Ollama su Linux tratta l'altro stack diffuso, più orientato a daemon/server. Per molti, la combinazione Ollama (daemon) + LM Studio (interfaccia client che si appoggia al daemon) è l'ideale.
- Scegliere la quantizzazione giusta
- La guida Scegliere la quantizzazione (Q4, Q5, Q8, FP16) confronta visivamente le perdite effettive di qualità e aiuta a trovare un compromesso tra qualità e VRAM; è particolarmente utile quando si scaricano i propri GGUF.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.