Copilot gratuito in locale: Cline, Tabby & CodeGeeX in VS Code (2026)
GitHub Copilot costa 10 €/mese e invia ogni carattere che digiti a un server Microsoft. Tre estensioni gratuite per VS Code risolvono entrambi i problemi collegando la chat e l'autocompletamento a un LLM locale: Cline, Tabby e CodeGeeX. Questa guida spiega come installarle tutte e tre, mostra quali modelli usare e confronta ciò che fanno davvero per aiutarti a scegliere un copilot gratuito e locale per VS Code.
#Perché un Copilot gratuito locale per VS Code?
Copilot e Cursor inviano il tuo codice a OpenAI o Anthropic. Per un progetto di un cliente soggetto a NDA, per codice proprietario o semplicemente per principio, non è sempre accettabile. Un copilot locale risolve tre problemi in un colpo solo: nessuna fuga di dati (nulla esce dal laptop), nessun abbonamento, nessuna latenza di rete.
Va detto con onestà qual è il compromesso: la qualità di un Qwen 3.5 9B in locale non eguaglia quella del modello più recente di Copilot Pro. Ma per le attività quotidiane — completare un ciclo, scrivere un test, rifattorizzare una funzione di 30 righe — un modello da 9 a 24B in Q4 svolge il compito. E per le attività che il modello locale non riesce a gestire, continui a usare Copilot in parallelo.
#Prerequisiti
Questa guida ti porta al modello. Il kit ti porta al copilota che scrive codice nel tuo editor.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- VS Code recente
- Versione 1.85+ per l'API di completamento inline. Le estensioni JetBrains sono disponibili anche per i tre strumenti.
- Ollama installato
- Funziona come backend di inferenza per Cline. È in ascolto per impostazione predefinita su http://localhost:11434. Per Tabby, il runtime è incluso; CodeGeeX può puntare a Ollama.
- GPU con almeno 8 GB di VRAM
- RTX 3060 12 GB, 4060 Ti 16 GB, Mac M2/M3 con 16 GB di memoria unificata. Al di sotto di queste configurazioni, rimani su modelli da 1.5B (qwen2.5-coder:1.5b) per il completamento del codice, che restano reattivi.
- 20 GB di spazio disco
- Un modello per il codice da 7B in Q4 = 4-5 GB. Prevedi un margine ampio se testi più modelli o più strumenti.
#1. Cline (chat + agente)
Cline è l'opzione più completa per l'assistenza: chat laterale e modalità agente capace di leggere e modificare più file, come Cursor, il tutto in locale tramite Ollama. Open source con licenza MIT e in modalità BYO-LLM, è il sostituto naturale di Continue.dev. Anche Roo Code, un fork di Cline, chiude: Cline diventa quindi il punto attorno a cui si consolida questo ecosistema. Il suo limite: non offre l'autocompletamento inline — per questo usiamo Tabby più avanti.
- 01Installare l'estensioneIn VS Code, apri la palette delle estensioni (Ctrl+Shift+X), cerca Cline e installalo. Un'icona di Cline appare nella barra laterale sinistra.
- 02Scaricare un modelloQwen 3.5 9B se la cava discretamente sia nella chat sia come agente con 8 GB di VRAM. Passa a Devstral 24B o Qwen 3.6 35B-A3B se hai memoria a sufficienza; Devstral è progettato appositamente per le attività degli agenti IA.
- 03Configurare il provider OllamaApri le impostazioni di Cline, scegli il provider Ollama, inserisci l'URL locale e seleziona il modello.
- 04Provare la chatFai una domanda, incolla del codice, chiedi una correzione. La risposta arriva nel pannello, senza inviare nulla al cloud.
- 05Testare l'agenteDescrivi un'attività che coinvolge più file. Cline propone un piano, poi applica le modifiche sotto forma di diff che approvi uno per uno.
#2. Tabby (autocompletazione self-hosted)
Tabby (TabbyML) copre esattamente ciò che Cline non fa: l'autocompletamento inline. È progettato per i team: un unico server ospita il modello e tutti gli sviluppatori vi si collegano dal proprio IDE. Il server include il proprio runtime, quindi non ha bisogno di Ollama.
- 01Avviare il server TabbyIl metodo Docker è il più semplice. Il server espone un endpoint HTTP su :8080 e un'interfaccia web di amministrazione.
- 02Creare un account amministratoreApri http://localhost:8080 nel browser. Al primo accesso, crea l'account proprietario. Vai in Settings → Information per ottenere un token di autenticazione.
- 03Installare l'estensione VS CodeNel pannello delle estensioni, cerca Tabby (editore: TabbyML). Installa.
- 04Collegare l'estensioneApri le impostazioni (Ctrl+,), cerca tabby. Imposta Endpoint = http://localhost:8080 e incolla il token. La barra di stato di VS Code mostra Tabby: ready; la completazione appare in grigio durante la digitazione.
#3. CodeGeeX
CodeGeeX (Tsinghua KEG / Zhipu AI) è l'opzione 'tutto in uno': l'estensione include già completamento e chat con un modello proprietario gratuito ospitato da loro. Ma può anche collegarsi a un modello locale, cosa che ci interessa qui.
- 01Installare l'estensioneIn VS Code, cerca CodeGeeX (editore: aminer). Installa l'estensione. Apparirà un'icona di CodeGeeX nella barra laterale.
- 02Passare alla modalità localeApri le impostazioni di CodeGeeX (ingranaggio nel pannello laterale). Cerca la sezione Local mode e attivala.
- 03Configurare il collegamento a OllamaInserisci l'URL del modello locale. CodeGeeX comunica con un endpoint compatibile con OpenAI: quello di Ollama su http://localhost:11434/v1 va bene.
- 04Scegliere il modellocodegeex4 (9B) è il modello interno disponibile in Ollama. Altrimenti, qualsiasi modello di programmazione recente va benissimo (qwen3-coder, devstral).
#Tabella comparativa
| Strumento | Cosa fa | Backend locale | Licenza | Ideale per |
|---|---|---|---|---|
| Cline | Chat + agente multi-file | Ollama (1 per postazione) | MIT, open-source | Uso individuale, utente avanzato |
| Tabby | Autocompletamento inline | Runtime incluso (server) | Self-hosted | Team, complemento di Cline |
| CodeGeeX | Completamento + chat | Endpoint compatibile con OpenAI | Gratuito (cloud predefinito) | Setup leggero tutto in uno |
- Copertura degli usi
- Cline: chat + agente (nessun completamento). Tabby: completamento (nessuna chat avanzata). CodeGeeX: completamento + chat di base. La combinazione Cline + Tabby copre tutto.
- Impegno richiesto per la configurazione
- CodeGeeX (5 min) < Cline + Ollama (10 min) < Tabby self-hosted (15-20 min).
- Multi-utilisateurs
- Solo Tabby è progettato per questo in modo nativo. Cline/CodeGeeX = una postazione = un Ollama.
- Privacy
- Cline e Tabby restano locali per impostazione predefinita. CodeGeeX usa il cloud finché non si attiva la modalità locale — da tenere d'occhio.
#Risoluzione dei problemi
- Cline non risponde
- Verifica ollama ps: il modello deve apparire quando lanci una richiesta. Se Ollama non risponde, prova curl http://localhost:11434/api/tags dal terminale. Verifica anche che il provider selezionato in Cline sia proprio Ollama.
- Nessuna completazione in grigio
- Cline non effettua l'autocompletamento inline: è normale. Installa Tabby (o Twinny) per l'autocompletamento riga per riga, e verifica editor.inlineSuggest.enabled in VS Code.
- Tabby mostra "Connection refused"
- Il container non è in esecuzione o la porta non è esposta. docker ps deve elencare tabby. docker logs tabby mostra la causa (spesso: modello non ancora scaricato al primo avvio, aspetta 5-10 min).
- CodeGeeX restituisce risposte in cinese
- Specifica la lingua nel system prompt (Settings CodeGeeX → Custom system prompt → "Rispondi sempre in francese"), oppure usa Qwen 3.5 9B, che risponde in francese quando gli parli in francese.
- VRAM saturata quando tutto gira
- Potresti avere due modelli caricati (completamento automatico Tabby + chat Cline). Con 8 GB, mantieni un modello FIM leggero per il completamento e un Qwen 3.5 9B per la chat. ollama ps mostra il consumo.
#FAQ
Qual è la migliore alternativa gratuita a Copilot in locale?+
Perché questa guida non parla più di Continue.dev?+
Cline fa l'autocompletazione come Copilot?+
Quale modello locale scegliere per programmare?+
Serve una GPU potente per usarlo?+
#Per approfondire
Hai un copilot locale che funziona. Tre direzioni logiche in base al tuo profilo:
- Approfondire Cline
- La guida dedicata a Copilot locale con Cline approfondisce la configurazione: provider Ollama, modalità agente, autocompletamento tramite Tabby/Twinny e impostazioni avanzate per il funzionamento agentico.
- Venivi da Continue.dev
- La guida alla migrazione Continue → Cline descrive nel dettaglio il passaggio (impostazioni equivalenti, modelli, dati locali).
- Scegli il tuo hardware
- Prima di passare a un 14B o 32B, la guida Scegliere la GPU per l'IA locale ti evita di acquistare una scheda con una quantità di VRAM appena sufficiente.
Se vuoi risparmiare tempo nella configurazione, la guida a pagamento «Copilota di codice locale» fornisce un pacchetto completo di configurazioni Ollama + Cline + Aider chiavi in mano, pronte da incollare, sia per una postazione individuale sia per un team.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.