Principiante 9 minInterfacce

LM Studio su Linux: Ubuntu, Debian, Arch, Fedora (2026)

LM Studio su Linux è un’AppImage di circa 600 MB che include un’interfaccia grafica, uno store di modelli collegato a Hugging Face, un motore di inferenza llama.cpp e un server compatibile con OpenAI. Nessuna installazione a livello di sistema, nessun daemon, nessun repository da aggiungere — un file eseguibile, e basta. Questa guida tratta l’installazione, il download di un GGUF, l’avvio del server locale e le insidie specifiche di Linux (permessi, FUSE, GPU).

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Ubuntu 24.04
i
In breve
LM Studio su Linux è un'AppImage di circa 600 MB: nessuna installazione a livello di sistema, nessun daemon, un solo file eseguibile. · Bastano tre passaggi: scaricare il file, renderlo eseguibile (chmod +x), poi avviarlo. · Prerequisiti: una distribuzione recente con glibc 2.35+ e il pacchetto libfuse2 su Ubuntu 22.04 e versioni successive. · L'AppImage rileva automaticamente la GPU (CUDA, ROCm o Vulkan a seconda della tua scheda) per accelerare l'inferenza.

#Perché LM Studio su Linux

Su Linux, la scelta istintiva per un LLM locale è Ollama: daemon systemd, CLI pulita, ascolto predefinito su localhost:11434. È eccellente per l'uso su server. LM Studio affronta un altro aspetto: quello della postazione di lavoro con interfaccia grafica.

Un'interfaccia completa senza terminale
Chat, browser di modelli Hugging Face, gestore dei download, impostazioni di sampling: tutto in interfaccia grafica. Utile se vuoi testare rapidamente diversi modelli prima di passare in produzione.
Un server compatibile con OpenAI in un clic
La scheda Developer espone un endpoint http://localhost:1234/v1 che utilizza il protocollo OpenAI. Qualsiasi SDK (openai-python, LangChain, Continue.dev) può inviare richieste a questo endpoint senza modificare una riga di codice.
Nessuna installazione a livello di sistema
L'AppImage viene eseguita nello spazio utente. Niente sudo, nessun pacchetto da installare, nessun repository di terze parti. Per le macchine soggette a restrizioni imposte dal reparto IT o per le distribuzioni atipiche, è un vantaggio prezioso.
Formato GGUF nativo
LM Studio legge esclusivamente il GGUF (il formato di llama.cpp). È lo stesso formato utilizzato internamente da Ollama, quindi il 100% dei modelli popolari è disponibile.
i
LM Studio e Ollama coesistono molto bene
Nulla impedisce di usarli entrambi. Ollama come daemon per i tuoi script e le tue integrazioni, LM Studio per la chat interattiva e la scoperta di nuovi modelli. Non usano le stesse porte (11434 vs 1234) e non interferiscono tra loro.

#Prerequisiti

Il kit IA Locale

LM Studio funziona sul tuo sistema Linux. Il kit IA Locale ti accompagna nei passi successivi: le impostazioni avanzate di LM Studio (cap. 5) e, quando qualcosa non funziona, un albero diagnostico organizzato per sintomo — lentezza, scheda grafica ignorata, modello che dimentica tutto (cap. 14).

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Distribuzione Linux recente
Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch o derivate. LM Studio è testato sulle principali distribuzioni, ma l'AppImage è portabile e funziona anche altrove (openSUSE, Linux Mint, Pop!_OS).
glibc 2.35+
L'AppImage include le proprie dipendenze grafiche ma non la glibc. Se usi una distribuzione molto vecchia (CentOS 7, Debian 10), non funzionerà.
FUSE
Le AppImage utilizzano FUSE per essere montate in lettura. La maggior parte delle distribuzioni lo installa per impostazione predefinita. Su Ubuntu 22.04+, avrai bisogno specificamente del pacchetto libfuse2.
Almeno 8 GB di RAM
Per eseguire un modello 7B in Q4. 16 GB per lavorare comodamente, 32 GB o più per i modelli 14B o per tenere aperto anche il tuo IDE.
GPU (opzionale ma consigliato)
NVIDIA con driver recenti (CUDA 12+), AMD con ROCm 6.x, o Intel Arc tramite Vulkan. Senza GPU, gira sulla CPU — utilizzabile per modelli da 3B, lento per modelli da 7B.
!
Ubuntu 22.04 e FUSE
Ubuntu 22.04 non include più libfuse2 per impostazione predefinita, il che impedisce a molte AppImage di funzionare, mostrando un messaggio poco chiaro come "dlopen(): error loading libfuse.so.2". Installa il pacchetto con sudo apt install libfuse2 prima di avviare LM Studio.

#1. Recuperare l'AppImage

Il sito ufficiale rileva automaticamente il tuo sistema operativo e propone la versione corretta. Verifica che tu stia effettivamente scaricando da lmstudio.ai — esistono mirror dubbi.

Sito ufficiale
https://lmstudio.ai
  1. 01
    Scarica il file .AppImage
    Il file binario occupa tra 500 e 700 MB. Include llama.cpp, l'interfaccia Electron e tutto il runtime. Salvalo in ~/Applications/ o ~/.local/bin/ per convenzione — in realtà puoi metterlo ovunque, perché l'AppImage è autosufficiente.
  2. 02
    Rendilo eseguibile
    Con il comando chmod +x. Senza questo passaggio, il file è solo un archivio inerte.
  3. 03
    Lancez-le
    Doppio clic dal tuo gestore file o dalla riga di comando. Al primo avvio, LM Studio estrae il suo contenuto in ~/.cache/AppImage/ — è normale e si ripete solo a ogni aggiornamento.
Installazione rapida in CLI
mkdir -p ~/Applications
cd ~/Applications
# Remplacez le nom par celui du fichier téléchargé
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
→
Integrare LM Studio nel menu delle applicazioni
Installa appimaged o AppImageLauncher: questi strumenti rilevano automaticamente gli AppImage in ~/Applications/ e creano le voci .desktop per vederli nel tuo menu, come un'app nativa. AppImageLauncher gestisce anche gli aggiornamenti.

#2. Primo avvio

Al primo avvio, LM Studio chiede di scegliere un livello di interfaccia: User (solo chat), Power User (chat + impostazioni), Developer (tutto, incluso il server). Power User basta per esplorare; in seguito potrai passare a Developer per il server locale, da Settings → UI Mode.

La sidebar di sinistra organizza le viste:

Chat
L'interfaccia principale, simile a ChatGPT. È quella che userai il 90% del tempo.
Discover
Il catalogo dei modelli. Ricerca in tempo reale su Hugging Face, con un indicatore di compatibilità hardware (Full GPU Offload / Partial / Likely too large) basato sulla tua VRAM rilevata.
My Models
Tutti i tuoi modelli scaricati, con le loro dimensioni e le loro quantizzazioni. Utile per fare pulizia.
Developer
Server locale compatibile con OpenAI. Visibile solo in modalità Power User o Developer.

#3. Scaricare un modello GGUF

LM Studio legge soltanto il formato GGUF (il formato binario di llama.cpp, successore di GGML). Se un modello esiste su Hugging Face ma non in GGUF, non potrai caricarlo direttamente. La stragrande maggioranza dei modelli popolari (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) ha versioni GGUF mantenute dalla comunità.

  1. 01
    Apri Discover e cerca un modello
    Per un primo tentativo, digita Qwen 3.5 9B o Granite 4.2 8B — le scelte affidabili del 2026 per la fascia 6-8 GB di VRAM. LM Studio elenca le varianti GGUF disponibili, solitamente pubblicate da bartowski, unsloth o lmstudio-community.
  2. 02
    Leggi i tag di compatibilità
    A destra di ogni variante c’è un indicatore verde/arancione/rosso: “Full GPU Offload” significa che il modello entra interamente nella tua VRAM. “Partial” = una parte verrà caricata nella RAM (l'esecuzione sarà più lenta). “Likely too large” = meglio lasciar perdere.
  3. 03
    Scegli la quantizzazione
    Q4_K_M è il punto ottimale per la maggior parte dei casi (bassa perdita di qualità, circa il 50% della dimensione di FP16). Q5_K_M se hai il 30-40% di VRAM in più. Q8_0 per la qualità massima se hai spazio in abbondanza. FP16 solo per il fine-tuning o il confronto.
  4. 04
    Clicca su Download
    Tra 4 e 8 GB per un 7B in base alla quantizzazione. Il download avviene in background, puoi avviarne diversi in parallelo.
→
Dove sono memorizzati i modelli
Per impostazione predefinita, LM Studio mette i modelli in ~/.cache/lm-studio/models/. Su Linux, questa cartella può crescere velocemente (da 50 a 200 GB con alcuni modelli). Se il tuo /home è su un piccolo SSD, sposta la cartella tramite Settings → Model Directory su un disco più grande.

Una volta scaricato il modello, torna su Chat, selezionalo dal menu a discesa in alto, imposta il cursore GPU offload al massimo proposto e clicca su Load model. Il caricamento richiede da 5 a 30 secondi, a seconda delle dimensioni del modello e della velocità del disco.

#4. Avviare il server locale sulla porta 1234

È qui che LM Studio va oltre la semplice chat grafica. La scheda Developer espone un server HTTP che usa esattamente lo stesso protocollo dell'API di OpenAI. Qualsiasi client OpenAI (openai-python, LangChain, LlamaIndex, Continue.dev) può collegarsi a questo server senza modifiche, semplicemente cambiando l'URL di base.

  1. 01
    Passa alla modalità Developer
    Settings → UI Mode → Developer. La scheda Developer (icona del terminale) compare nella barra laterale.
  2. 02
    Seleziona un modello
    Menu nella parte superiore della scheda Developer. Il modello deve essere già scaricato. Puoi caricarne diversi in parallelo se la VRAM lo permette.
  3. 03
    Imposta Context Length e GPU Offload
    Metti l'offload GPU al massimo purché la VRAM lo permetta. Il context length di 4096 per default basta per la maggior parte degli usi; aumentalo a 8192 o 16384 per RAG o documenti lunghi.
  4. 04
    Clicca su Start Server
    Il server ascolta per impostazione predefinita su 127.0.0.1:1234. La porta è configurabile proprio accanto se la 1234 è già occupata.
Testare il server
# Liste des modèles chargés
curl http://localhost:1234/v1/models

# Une complétion chat minimale
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [
      {"role":"user","content":"Capitale de l'\''Italie ?"}
    ],
    "temperature": 0.2
  }'

Nel linguaggio Python, basta un client ufficiale di OpenAI. La chiave API può essere qualsiasi stringa — LM Studio non la verifica.

Client Python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # placeholder, non vérifié
)

resp = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Tu réponds en une phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un GGUF ?"},
    ],
    stream=True,
)

for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="", flush=True)
i
Log in tempo reale
La scheda Developer mostra i Server Logs in tempo reale: ogni richiesta in entrata, il tempo di generazione, il numero di token. Indispensabile per eseguire il debug di un'integrazione.

Per esporre il server sulla LAN (gli altri computer del team), cambia Host da 127.0.0.1 a 0.0.0.0 nelle impostazioni del server. Attenzione: LM Studio non dispone di alcuna autenticazione nativa. Su una rete condivisa, metti Caddy o Nginx davanti al server con autenticazione basic, oppure limita l'accesso tramite il firewall.

#5. Accelerazione GPU su Linux

È l'aspetto più insidioso di LM Studio su Linux. L'AppImage include diversi backend (CPU, CUDA, ROCm, Vulkan) e ne sceglie uno automaticamente all'avvio — ma il rilevamento automatico a volte sbaglia a seconda dei driver installati.

NVIDIA (CUDA)
Driver proprietari 535+ installati (nvidia-smi deve funzionare). CUDA 12.x è incluso nell'AppImage, non è necessario installarlo separatamente. Verifica in Settings → Hardware che la GPU sia elencata e che il backend sia effettivamente CUDA.
AMD (ROCm)
Driver ROCm 6.x installati sull'host (Radeon RX 6800 XT e successivi ufficialmente supportati, RX 6700 XT e RX 7600 spesso funzionanti con HSA_OVERRIDE_GFX_VERSION). Il tuo utente deve appartenere ai gruppi render e video.
Intel Arc / iGPU
Backend Vulkan, prestazioni discrete su Arc A770/A750 ma inferiori rispetto a NVIDIA/AMD. Installa vulkan-tools per verificare con vulkaninfo che la GPU venga rilevata.
Nessuna GPU
Fallback automatico sulla CPU. Per un Granite 4.2 8B Q4 su un Ryzen 7, aspettati 5-8 token/sec. Un modello da 3B come Qwen 3.5 2B o Granite 4.2 3B rimane molto utilizzabile. Al di sopra di 14B, la pazienza diventa un problema.

Il cursore GPU offload in Chat o Developer controlla quanti strati del modello vengono caricati sulla GPU. Impostalo al massimo finché la VRAM lo consente. Verifica il consumo effettivo in un terminale:

Monitorare la VRAM
# NVIDIA
nvidia-smi -l 1

# AMD (radeontop ou rocm-smi)
rocm-smi --showmeminfo vram
Valori indicativi di VRAM per dimensione del modello (Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Questi valori aumentano un po' se aumenti la lunghezza del contesto oltre 4096.
GPU di riferimento
RTX 3060 12GB gestisce comodamente i modelli da 7B a 14B. RTX 4070 12GB: lo stesso, con margine. RTX 4080 16GB: modelli da 14B in Q5 e i primi modelli da 24B. RTX 4090 24GB: modelli da 32B in Q4 e da 70B in Q3. Mac M4 Pro con 24-48GB di memoria unificata: lo stesso su Apple Silicon, ma tramite la versione macOS di LM Studio.
!
Il tranello del fallback CPU silenzioso
Se la VRAM è insufficiente per il modello alla lunghezza di contesto richiesta, LM Studio trasferisce alcuni strati nella RAM senza segnalarlo sempre chiaramente. Ottieni 2–5 token/sec invece di 40 o più. Controlla Settings → Hardware o nvidia-smi durante la generazione: se la VRAM non è satura, significa che il modello viene eseguito in parte sulla CPU.

#Insidie comuni

L'AppImage non si avvia
Avvialo da un terminale per vedere il messaggio di errore. Il problema più comune: libfuse2 mancante su Ubuntu 22.04+ (sudo apt install libfuse2 risolve il problema). Poi: glibc troppo vecchia (LM Studio richiede 2.35+, quindi niente CentOS 7 né Debian 10).
La GPU non viene utilizzata
Controlla nvidia-smi (o rocm-smi). Se la GPU non è elencata: driver mancanti o troppo vecchi. Se è elencata ma LM Studio continua a usare la CPU: Settings → Hardware permette di forzare il backend (CUDA/ROCm/Vulkan). Su AMD, l'utente deve appartenere ai gruppi render e video — disconnettiti e accedi di nuovo dopo il comando usermod.
Il modello è lento nonostante la GPU
VRAM saturata e offload parziale silenzioso. Riduci la lunghezza del contesto, abbassa il cursore GPU offload per misurare la soglia oppure scegli una quantizzazione più aggressiva (Q5 → Q4 → Q3).
Porta 1234 già occupata
Spesso è occupata da un altro servizio di sviluppo. Cambia la porta in Developer → Settings, oppure termina il processo: ss -tulpn | grep 1234. Non serve modificare il firewall per un utilizzo su localhost.
Aggiornamenti automatici che causano malfunzionamenti
LM Studio si aggiorna automaticamente per impostazione predefinita. In un ambiente controllato (azienda, integrazione CI/CD), disattiva gli aggiornamenti automatici tramite Settings → Updates. Annota il numero della versione che funziona per poter tornare indietro se necessario.
Nessun autocompletamento CLI
L'AppImage non offre una CLI ricca di funzionalità. Per attività di scripting avanzate, l'API HTTP del server (porta 1234) resta la soluzione più pulita. Se hai bisogno di una vera CLI, llama.cpp o Ollama sono più adatti.

#Per approfondire

Hai LM Studio installato, un GGUF caricato e un server compatibile con OpenAI in esecuzione. Ecco i passi successivi più naturali:

Sfruttare a fondo il server API
La guida Trasformare LM Studio in un server API descrive in dettaglio lo streaming, l'esecuzione di più modelli in parallelo, l'esposizione sicura sulla LAN e l'ottimizzazione delle prestazioni.
Confronta con Ollama su Linux
La guida Installare Ollama su Linux tratta l'altro stack diffuso, più orientato a daemon/server. Per molti, la combinazione Ollama (daemon) + LM Studio (interfaccia client che si appoggia al daemon) è l'ideale.
Scegliere la quantizzazione giusta
La guida Scegliere la quantizzazione (Q4, Q5, Q8, FP16) confronta visivamente le perdite effettive di qualità e aiuta a trovare un compromesso tra qualità e VRAM; è particolarmente utile quando si scaricano i propri GGUF.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.