Intermedio 15 minIDE

Copilot gratuito in locale: Cline, Tabby & CodeGeeX in VS Code (2026)

GitHub Copilot costa 10 €/mese e invia ogni carattere che digiti a un server Microsoft. Tre estensioni gratuite per VS Code risolvono entrambi i problemi collegando la chat e l'autocompletamento a un LLM locale: Cline, Tabby e CodeGeeX. Questa guida spiega come installarle tutte e tre, mostra quali modelli usare e confronta ciò che fanno davvero per aiutarti a scegliere un copilot gratuito e locale per VS Code.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
i
Continue non è più mantenuto (giugno 2026)
Continue è stato acquisito da Cursor (Anysphere) il 18 giugno 2026: il repository è archiviato (v2.0.0 è l'ultima versione) e l'estensione non è più mantenuta — resta installabile tramite fork della comunità e questa guida resta utilizzabile così com'è. Per una nuova configurazione, consigliamo piuttosto Cline (open source, MIT, compatibile con Ollama): consulta la nostra guida «Migrare da Continue a Cline».

#Perché un Copilot gratuito locale per VS Code?

Copilot e Cursor inviano il tuo codice a OpenAI o Anthropic. Per un progetto di un cliente soggetto a NDA, per codice proprietario o semplicemente per principio, non è sempre accettabile. Un copilot locale risolve tre problemi in un colpo solo: nessuna fuga di dati (nulla esce dal laptop), nessun abbonamento, nessuna latenza di rete.

Va detto con onestà qual è il compromesso: la qualità di un Qwen 3.5 9B in locale non eguaglia quella del modello più recente di Copilot Pro. Ma per le attività quotidiane — completare un ciclo, scrivere un test, rifattorizzare una funzione di 30 righe — un modello da 9 a 24B in Q4 svolge il compito. E per le attività che il modello locale non riesce a gestire, continui a usare Copilot in parallelo.

i
Cosa fanno questi 3 strumenti
Cline = chat + agente che opera su più file (nessun autocompletamento inline). Tabby = solo autocompletamento, orientato al self-hosting per i team. CodeGeeX = completamento + chat, con un proprio modello integrato. Tutti funzionano in VS Code e JetBrains.
→
E Continue.dev ?
Continue.dev compariva nelle raccolte fino al 2026, ma è stato acquisito da Cursor (acquisizione annunciata il 18 giugno 2026), la v2.0.0 è l'ultima versione stabile pubblicata e il futuro dell'estensione autonoma è incerto. Lo abbiamo sostituito con Cline, il suo equivalente open-source ancora attivo. Se lo utilizzavi ancora, sappi che la finestra per esportare i dati ospitati si è chiusa il 15 luglio 2026.

#Prerequisiti

Il kit Copilota Locale

Questa guida ti porta al modello. Il kit ti porta al copilota che scrive codice nel tuo editor.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
VS Code recente
Versione 1.85+ per l'API di completamento inline. Le estensioni JetBrains sono disponibili anche per i tre strumenti.
Ollama installato
Funziona come backend di inferenza per Cline. È in ascolto per impostazione predefinita su http://localhost:11434. Per Tabby, il runtime è incluso; CodeGeeX può puntare a Ollama.
GPU con almeno 8 GB di VRAM
RTX 3060 12 GB, 4060 Ti 16 GB, Mac M2/M3 con 16 GB di memoria unificata. Al di sotto di queste configurazioni, rimani su modelli da 1.5B (qwen2.5-coder:1.5b) per il completamento del codice, che restano reattivi.
20 GB di spazio disco
Un modello per il codice da 7B in Q4 = 4-5 GB. Prevedi un margine ampio se testi più modelli o più strumenti.
→
VRAM effettiva in base alla dimensione del modello per il codice
Qwen 3.5 9B Q4 ≈ 6,6 GB · Gemma 4 12B ≈ 7,6 GB · Devstral 24B Q4 ≈ 14 GB · Qwen 3.6 35B-A3B ≈ 23 GB. Per il completamento inline (FIM), la latenza conta più della qualità: basta un piccolo modello FIM come Qwen2.5-Coder. Tieni un Qwen 3.5 9B per la chat e un Devstral 24B per l'agente se hai la VRAM necessaria.

#1. Cline (chat + agente)

Cline è l'opzione più completa per l'assistenza: chat laterale e modalità agente capace di leggere e modificare più file, come Cursor, il tutto in locale tramite Ollama. Open source con licenza MIT e in modalità BYO-LLM, è il sostituto naturale di Continue.dev. Anche Roo Code, un fork di Cline, chiude: Cline diventa quindi il punto attorno a cui si consolida questo ecosistema. Il suo limite: non offre l'autocompletamento inline — per questo usiamo Tabby più avanti.

  1. 01
    Installare l'estensione
    In VS Code, apri la palette delle estensioni (Ctrl+Shift+X), cerca Cline e installalo. Un'icona di Cline appare nella barra laterale sinistra.
  2. 02
    Scaricare un modello
    Qwen 3.5 9B se la cava discretamente sia nella chat sia come agente con 8 GB di VRAM. Passa a Devstral 24B o Qwen 3.6 35B-A3B se hai memoria a sufficienza; Devstral è progettato appositamente per le attività degli agenti IA.
  3. 03
    Configurare il provider Ollama
    Apri le impostazioni di Cline, scegli il provider Ollama, inserisci l'URL locale e seleziona il modello.
  4. 04
    Provare la chat
    Fai una domanda, incolla del codice, chiedi una correzione. La risposta arriva nel pannello, senza inviare nulla al cloud.
  5. 05
    Testare l'agente
    Descrivi un'attività che coinvolge più file. Cline propone un piano, poi applica le modifiche sotto forma di diff che approvi uno per uno.
Scaricare il modello
ollama pull qwen3.5:9b
# Plus de VRAM ? Devstral, spécialiste agent de code, suit mieux le mode agent
ollama pull devstral:24b
Impostazioni del provider in Cline
Provider : Ollama
Base URL : http://localhost:11434
Modèle   : qwen3.5:9b
→
Variante instruct per l'agente
Per la chat e l'agente di Cline, usa la variante instruct/chat del modello (non la variante -base, riservata all'autocompletamento). Segue meglio le istruzioni in più passaggi.

#2. Tabby (autocompletazione self-hosted)

Tabby (TabbyML) copre esattamente ciò che Cline non fa: l'autocompletamento inline. È progettato per i team: un unico server ospita il modello e tutti gli sviluppatori vi si collegano dal proprio IDE. Il server include il proprio runtime, quindi non ha bisogno di Ollama.

  1. 01
    Avviare il server Tabby
    Il metodo Docker è il più semplice. Il server espone un endpoint HTTP su :8080 e un'interfaccia web di amministrazione.
  2. 02
    Creare un account amministratore
    Apri http://localhost:8080 nel browser. Al primo accesso, crea l'account proprietario. Vai in Settings → Information per ottenere un token di autenticazione.
  3. 03
    Installare l'estensione VS Code
    Nel pannello delle estensioni, cerca Tabby (editore: TabbyML). Installa.
  4. 04
    Collegare l'estensione
    Apri le impostazioni (Ctrl+,), cerca tabby. Imposta Endpoint = http://localhost:8080 e incolla il token. La barra di stato di VS Code mostra Tabby: ready; la completazione appare in grigio durante la digitazione.
Avvio di Tabby (GPU NVIDIA)
docker run -d --name tabby \
  --gpus all -p 8080:8080 \
  -v $HOME/.tabby:/data \
  registry.tabbyml.com/tabbyml/tabby \
  serve --model StarCoder-1B --device cuda
i
Cline + Tabby: il duo completo
Cline gestisce la chat e l'agente, Tabby gestisce l'autocompletamento inline. Insieme, ricreano l'esperienza completa di Copilot — in locale, gratuitamente. È la combinazione consigliata sia per una postazione individuale sia per un team. Twinny è un'alternativa a Tabby se preferisci usare Ollama anche per il completamento.

#3. CodeGeeX

CodeGeeX (Tsinghua KEG / Zhipu AI) è l'opzione 'tutto in uno': l'estensione include già completamento e chat con un modello proprietario gratuito ospitato da loro. Ma può anche collegarsi a un modello locale, cosa che ci interessa qui.

  1. 01
    Installare l'estensione
    In VS Code, cerca CodeGeeX (editore: aminer). Installa l'estensione. Apparirà un'icona di CodeGeeX nella barra laterale.
  2. 02
    Passare alla modalità locale
    Apri le impostazioni di CodeGeeX (ingranaggio nel pannello laterale). Cerca la sezione Local mode e attivala.
  3. 03
    Configurare il collegamento a Ollama
    Inserisci l'URL del modello locale. CodeGeeX comunica con un endpoint compatibile con OpenAI: quello di Ollama su http://localhost:11434/v1 va bene.
  4. 04
    Scegliere il modello
    codegeex4 (9B) è il modello interno disponibile in Ollama. Altrimenti, qualsiasi modello di programmazione recente va benissimo (qwen3-coder, devstral).
Modello CodeGeeX in Ollama
ollama pull codegeex4
!
Modalità cloud predefinita
Per impostazione predefinita, CodeGeeX utilizza i server Zhipu in Cina. Finché non passi esplicitamente alla modalità locale nelle impostazioni, il tuo codice viene inviato ai loro server. Controlla il badge nella barra di stato di VS Code: deve comparire Local, non Cloud.

#Tabella comparativa

Le 3 alternative gratuite locali a Copilot in VS Code
StrumentoCosa faBackend localeLicenzaIdeale per
ClineChat + agente multi-fileOllama (1 per postazione)MIT, open-sourceUso individuale, utente avanzato
TabbyAutocompletamento inlineRuntime incluso (server)Self-hostedTeam, complemento di Cline
CodeGeeXCompletamento + chatEndpoint compatibile con OpenAIGratuito (cloud predefinito)Setup leggero tutto in uno
Copertura degli usi
Cline: chat + agente (nessun completamento). Tabby: completamento (nessuna chat avanzata). CodeGeeX: completamento + chat di base. La combinazione Cline + Tabby copre tutto.
Impegno richiesto per la configurazione
CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby self-hosted (15-20 min).
Multi-utilisateurs
Solo Tabby è progettato per questo in modo nativo. Cline/CodeGeeX = una postazione = un Ollama.
Privacy
Cline e Tabby restano locali per impostazione predefinita. CodeGeeX usa il cloud finché non si attiva la modalità locale — da tenere d'occhio.
→
Consiglio pratico
Per iniziare da solo: Cline + Qwen 3.5 9B su Ollama per la chat e l'agente, più Tabby per l'autocompletamento. Per un team di almeno 3 sviluppatori che condividono una GPU: Tabby per il completamento condiviso, Cline sulla postazione di lavoro. CodeGeeX resta un'alternativa leggera tutto in uno.

#Risoluzione dei problemi

Cline non risponde
Verifica ollama ps: il modello deve apparire quando lanci una richiesta. Se Ollama non risponde, prova curl http://localhost:11434/api/tags dal terminale. Verifica anche che il provider selezionato in Cline sia proprio Ollama.
Nessuna completazione in grigio
Cline non effettua l'autocompletamento inline: è normale. Installa Tabby (o Twinny) per l'autocompletamento riga per riga, e verifica editor.inlineSuggest.enabled in VS Code.
Tabby mostra "Connection refused"
Il container non è in esecuzione o la porta non è esposta. docker ps deve elencare tabby. docker logs tabby mostra la causa (spesso: modello non ancora scaricato al primo avvio, aspetta 5-10 min).
CodeGeeX restituisce risposte in cinese
Specifica la lingua nel system prompt (Settings CodeGeeX → Custom system prompt → "Rispondi sempre in francese"), oppure usa Qwen 3.5 9B, che risponde in francese quando gli parli in francese.
VRAM saturata quando tutto gira
Potresti avere due modelli caricati (completamento automatico Tabby + chat Cline). Con 8 GB, mantieni un modello FIM leggero per il completamento e un Qwen 3.5 9B per la chat. ollama ps mostra il consumo.

#FAQ

Qual è la migliore alternativa gratuita a Copilot in locale?+
Non c'è una risposta unica, perché gli strumenti non soddisfano la stessa esigenza. Per la chat e l'agente che lavora su più file, Cline è il più completo. Per l'autocompletamento inline, Tabby (o Twinny). In pratica, il duo Cline + Tabby riproduce l'esperienza completa di Copilot, gratuitamente e in locale. CodeGeeX è l'opzione tutto in uno più veloce da installare.
Perché questa guida non parla più di Continue.dev?+
Continue.dev è stato acquisito da Cursor (acqui-hire annunciato il 18 giugno 2026). La v2.0.0 è l'ultima versione stabile pubblicata e il futuro dell'estensione autonoma è incerto. Il codice rimane sotto licenza Apache 2.0, quindi le build bloccate a una versione specifica continuano a funzionare, ma per una base di codice attivamente mantenuta è meglio migrare a Cline. La scadenza per l'esportazione dei dati ospitati era il 15 luglio 2026 (ormai passata).
Cline fa l'autocompletazione come Copilot?+
No. Cline si concentra sulla chat e sulla modalità agente (leggere e modificare più file). Non offre il completamento riga per riga con suggerimenti in grigio. Per questa funzione, aggiungi Tabby o Twinny in parallelo: le due estensioni possono coesistere senza conflitti in VS Code.
Quale modello locale scegliere per programmare?+
Per l'autocompletamento inline (FIM), Qwen2.5-Coder resta una scelta affidabile grazie alla sua bassa latenza. Per la chat e l'agente: Qwen 3.5 9B su 8 GB, Devstral 24B o gpt-oss 20B su 16 GB, Qwen 3.6 35B-A3B se hai margine di memoria. Devstral, specializzato negli agenti di programmazione, è un'eccellente alternativa. Regola semplice: un modello leggero per il completamento, un modello più grande per il ragionamento.
Serve una GPU potente per usarlo?+
No. 8 GB di VRAM sono sufficienti per un Qwen 3.5 9B in Q4 (chat) più un piccolo modello FIM per il completamento del codice. Con meno memoria, rimani su modelli FIM leggeri che restano reattivi. Anche un Mac M2/M3 con 16 GB di memoria unificata svolge molto bene questo compito.

#Per approfondire

Hai un copilot locale che funziona. Tre direzioni logiche in base al tuo profilo:

Approfondire Cline
La guida dedicata a Copilot locale con Cline approfondisce la configurazione: provider Ollama, modalità agente, autocompletamento tramite Tabby/Twinny e impostazioni avanzate per il funzionamento agentico.
Venivi da Continue.dev
La guida alla migrazione Continue → Cline descrive nel dettaglio il passaggio (impostazioni equivalenti, modelli, dati locali).
Scegli il tuo hardware
Prima di passare a un 14B o 32B, la guida Scegliere la GPU per l'IA locale ti evita di acquistare una scheda con una quantità di VRAM appena sufficiente.

Se vuoi risparmiare tempo nella configurazione, la guida a pagamento «Copilota di codice locale» fornisce un pacchetto completo di configurazioni Ollama + Cline + Aider chiavi in mano, pronte da incollare, sia per una postazione individuale sia per un team.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.