Copilot locale con Cline: agente IA in VS Code (Ollama)
GitHub Copilot invia il tuo codice a Microsoft. Per uno sviluppatore freelance che firma accordi di riservatezza (NDA) o un team in un settore regolamentato, questo è inaccettabile. Cline è l'estensione per VS Code/JetBrains che sostituisce Copilot con un modello locale (tramite Ollama), con una chat e una modalità agente capace di leggere e modificare più file. Questa guida spiega come installare Cline, configurare un modello recente per il codice (Qwen 3.5, Devstral) e ritrovare gli elementi essenziali dell'esperienza d'uso di Copilot, mantenendo il tuo codice a casa.
#Perché un Copilot locale
- Privacy
- Nessun estratto di codice lascia il tuo computer. NDA, segreto industriale, codice dei clienti: tutto rimane locale.
- Offline
- In aereo, in fondo a un laboratorio senza Internet, in vacanza. Il modello è sul tuo disco.
- Costo
- Gratuito dopo l'acquisto di una GPU. Uno sviluppatore che usa Copilot per due anni copre il costo di una scheda grafica di fascia media.
- Scelta del modello
- Puoi sostituire Qwen 3.5 con Devstral, Qwen3-Coder o GLM 4.7 Flash a seconda del linguaggio e della tua VRAM.
#Perché questo tutorial è passato a Cline
Questa guida si basava inizialmente su Continue.dev. Continue è stato acquisito da Cursor nel giugno 2026, il suo repository è ora archiviato e il prodotto autonomo non è più mantenuto: abbiamo quindi aggiornato la guida per Cline, un assistente open-source equivalente, attivo e anch'esso locale al 100% tramite Ollama.
Questa guida ti porta al modello. Il kit ti porta al copilota che scrive codice nel tuo editor.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
#Modelli da utilizzare
- ⭐ Qwen 3.5 9B
- LA scelta per 8 GB nel 2026. Multilingue (FR incluso), 256k di contesto, visione, Apache 2.0. Valido sia in chat sia come agente per Python, TypeScript, Rust. ~6,6 GB in Q4.
- Devstral 24B (Mistral AI)
- Specialista degli agenti di programmazione, Apache 2.0. LA scelta con 16 GB per le modifiche a più file con Cline. ~14 GB in Q4.
- Qwen3-Coder 30B-A3B
- MoE per il codice (3B attivi, quindi veloce), 256k di contesto. Per 24 GB: chat + agente di fascia alta che rivaleggia con Copilot. ~19 GB in Q4.
- Qwen 3.8 27B
- Il modello «vicino a Copilot» del 2026 (uscito il 14/08/2026), 262k di contesto, visione, Apache 2.0. Per 24 GB — impostare il livello di ragionamento su «low» per evitare che ragioni eccessivamente.
| VRAM | Modello Cline (chat + agente) | Quantizzazione |
|---|---|---|
| 6 GB | granite4.2:8b | Q4_K_M (~5,3 GB) |
| 8 GB | qwen3.5:9b | Q4_K_M (~6,6 GB) |
| 16 GB | devstral:24b / gpt-oss:20b | Q4 / MXFP4 (~14 GB) |
| 24 GB+ | qwen3-coder:30b / qwen3.8:27b | Q4 (~18-19 GB) |
#1. Installare Cline
- 01Installare OllamaSe non è già stato fatto, consulta la guida Installare Ollama su Windows/macOS/Linux. È il motore che fa funzionare il modello in background.
- 02Scaricare il modelloScarica un modello specializzato nella programmazione adatto alla tua VRAM con il comando seguente.
- 03Installare l'estensione ClineIn VS Code: Estensioni (Ctrl+Shift+X) → cercare Cline → Install. Su JetBrains, passa dal marketplace dei plugin.
- 04Aprire il pannelloUn'icona di Cline appare nella barra laterale sinistra. Cliccaci sopra per aprire il pannello dedicato alla chat e all'agente.
#2. Configurare il provider Ollama
Cline deve sapere dove trovare il modello. Apri le sue impostazioni (icona dell'ingranaggio nel pannello), seleziona il provider Ollama, inserisci l'indirizzo locale del demone e scegli il modello nell'elenco rilevato.
#3. Modalità chat
La modalità chat è l'equivalente diretto di un pannello Copilot Chat, in locale. Poni una domanda, incolla del codice, chiedi una spiegazione o una correzione.
- Aprire la chat
- Fai clic sull'icona Cline nella barra laterale. La conversazione si visualizza nel pannello.
- Allegare codice
- Seleziona un blocco nell'editor, poi aggiungilo al contesto della chat perché il modello possa ragionarci sopra.
- Menzionare dei file
- Cline può fare riferimento ai file del tuo progetto per rispondere con il giusto contesto, senza che tu debba copiare e incollare tutto.
- Mantenere la cronologia in locale
- Le tue conversazioni rimangono sulla tua macchina. Niente è sincronizzato in cloud.
#4. Modalità agente
È qui che Cline va oltre una semplice chat. In modalità agente, può leggere la struttura delle cartelle, aprire file, proporre modifiche su più file ed eseguire comandi: ogni azione è soggetta alla tua approvazione.
- Piano poi esecuzione
- Descrivi un compito in francese («aggiungi un endpoint /health e il suo test»). Cline propone un piano, poi applica le modifiche passo dopo passo.
- Diff convalidato
- Ogni modifica viene presentata sotto forma di diff che accetti o rifiuti. Mantieni il controllo in ogni momento.
- Comandi sottoposti a controllo
- L'agente può suggerire di eseguire un comando (test, build). Nulla viene eseguito senza il tuo consenso esplicito.
#5. Autocompletamento: Tabby o Twinny
Punto importante: Cline è un assistente chat + agente, non fornisce l'autocompletamento inline con «testo in grigio» durante la digitazione. Per ritrovare questa comodità in stile Copilot, aggiungi un'estensione dedicata, anch'essa collegata a Ollama.
- Tabby
- Estensione di autocompletamento self-hosted, ideale se più sviluppatori condividono la stessa GPU. L'autocompletamento riga per riga appare in grigio; Tab per accettare.
- Twinny
- Estensione leggera per VS Code con autocompletamento + chat, che si collega direttamente a Ollama. Un buon complemento a Cline per chi lavora da solo e deve scrivere molto codice.
- Il duo che funziona
- Cline per la chat e l'agente, Tabby o Twinny per il completamento inline. Entrambi si collegano allo stesso Ollama e il tuo codice resta locale in entrambi i casi.
#Prestazioni e impostazioni avanzate
- Num_ctx elevato
- In Ollama, imposta num_ctx a 16384 perché l'agente possa inviare molto contesto (file, differenze). Attraverso un Modelfile.
- Flash Attention
- Su RTX 30/40/50, attiva FA in Ollama (variabile OLLAMA_FLASH_ATTENTION=1). Circa +20% di velocità.
- Cache KV quantizzata
- OLLAMA_KV_CACHE_TYPE=q8_0 dimezza la VRAM del contesto. Cruciale quando l'agente lavora su file grandi.
- Un modello per ruolo
- Un modello FIM dedicato (qwen2.5-coder:7b-base, ~4,7 GB) per l'autocompletamento (Tabby/Twinny), un 24B/30B (Devstral, Qwen3-Coder) per la chat e l'agente di Cline. Ollama carica quello richiesto.
#Domande frequenti
Cline sostituisce davvero GitHub Copilot?+
Perché non restare su Continue.dev?+
Quale modello scegliere se ho solo 8 GB di VRAM?+
Il mio codice va su Internet con Cline?+
Cline funziona su JetBrains, non solo su VS Code?+
#Conclusione
In una ventina di minuti hai un copilota di codice 100% locale: Cline per la chat e la modalità agente, un modello di codice recente (Qwen 3.5 9B, o Devstral 24B per l'agente) tramite Ollama come motore, e Tabby o Twinny (con qwen2.5-coder:7b-base) per l'autocompletamento inline. Il tuo codice non lascia mai il tuo computer, lavori offline e mantieni la libertà di cambiare modello in base ai linguaggi che usi. Se vuoi risparmiare ore di configurazione e partire da una base collaudata, la guida a pagamento «Copilota di codice locale» fornisce un pacchetto completo di configurazioni Ollama + Cline + Aider chiavi in mano.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.