Intermedio 20 minDev

Copilot locale con Cline: agente IA in VS Code (Ollama)

GitHub Copilot invia il tuo codice a Microsoft. Per uno sviluppatore freelance che firma accordi di riservatezza (NDA) o un team in un settore regolamentato, questo è inaccettabile. Cline è l'estensione per VS Code/JetBrains che sostituisce Copilot con un modello locale (tramite Ollama), con una chat e una modalità agente capace di leggere e modificare più file. Questa guida spiega come installare Cline, configurare un modello recente per il codice (Qwen 3.5, Devstral) e ritrovare gli elementi essenziali dell'esperienza d'uso di Copilot, mantenendo il tuo codice a casa.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
i
Continue non è più mantenuto (giugno 2026)
Continue è stato acquisito da Cursor (Anysphere) il 18 giugno 2026: il repository è archiviato (v2.0.0 è l'ultima versione) e l'estensione non è più mantenuta — resta installabile tramite fork della comunità e questa guida resta utilizzabile così com'è. Per una nuova configurazione, consigliamo piuttosto Cline (open source, MIT, compatibile con Ollama): consulta la nostra guida «Migrare da Continue a Cline».

#Perché un Copilot locale

Privacy
Nessun estratto di codice lascia il tuo computer. NDA, segreto industriale, codice dei clienti: tutto rimane locale.
Offline
In aereo, in fondo a un laboratorio senza Internet, in vacanza. Il modello è sul tuo disco.
Costo
Gratuito dopo l'acquisto di una GPU. Uno sviluppatore che usa Copilot per due anni copre il costo di una scheda grafica di fascia media.
Scelta del modello
Puoi sostituire Qwen 3.5 con Devstral, Qwen3-Coder o GLM 4.7 Flash a seconda del linguaggio e della tua VRAM.

#Perché questo tutorial è passato a Cline

Questa guida si basava inizialmente su Continue.dev. Continue è stato acquisito da Cursor nel giugno 2026, il suo repository è ora archiviato e il prodotto autonomo non è più mantenuto: abbiamo quindi aggiornato la guida per Cline, un assistente open-source equivalente, attivo e anch'esso locale al 100% tramite Ollama.

Il kit Copilota Locale

Questa guida ti porta al modello. Il kit ti porta al copilota che scrive codice nel tuo editor.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
i
Prima usavi Continue?
Il passaggio è indolore: il tuo backend Ollama non cambia, sostituisci soltanto l'estensione. Puoi continuare a eseguire legalmente i tuoi fork di Continue fissati a una versione specifica (codice con licenza Apache 2.0), ma tieni presente che la finestra per esportare i dati ospitati si è chiusa il 15 luglio 2026. Una guida dedicata illustra in dettaglio la migrazione passo dopo passo, se necessario.

#Modelli da utilizzare

⭐ Qwen 3.5 9B
LA scelta per 8 GB nel 2026. Multilingue (FR incluso), 256k di contesto, visione, Apache 2.0. Valido sia in chat sia come agente per Python, TypeScript, Rust. ~6,6 GB in Q4.
Devstral 24B (Mistral AI)
Specialista degli agenti di programmazione, Apache 2.0. LA scelta con 16 GB per le modifiche a più file con Cline. ~14 GB in Q4.
Qwen3-Coder 30B-A3B
MoE per il codice (3B attivi, quindi veloce), 256k di contesto. Per 24 GB: chat + agente di fascia alta che rivaleggia con Copilot. ~19 GB in Q4.
Qwen 3.8 27B
Il modello «vicino a Copilot» del 2026 (uscito il 14/08/2026), 262k di contesto, visione, Apache 2.0. Per 24 GB — impostare il livello di ragionamento su «low» per evitare che ragioni eccessivamente.
Modello consigliato in base alla VRAM disponibile
VRAMModello Cline (chat + agente)Quantizzazione
6 GBgranite4.2:8bQ4_K_M (~5,3 GB)
8 GBqwen3.5:9bQ4_K_M (~6,6 GB)
16 GBdevstral:24b / gpt-oss:20bQ4 / MXFP4 (~14 GB)
24 GB+qwen3-coder:30b / qwen3.8:27bQ4 (~18-19 GB)
→
Cline preferisce un modello che segue le istruzioni
A differenza della semplice autocompletazione, la modalità agente invia istruzioni articolate in più passaggi. Preferisci la variante instruct/chat del modello (non la variante -base) e passa a un modello più grande (Devstral 24B, Qwen3-Coder 30B), se la tua VRAM lo permette, per una maggiore affidabilità.

#1. Installare Cline

  1. 01
    Installare Ollama
    Se non è già stato fatto, consulta la guida Installare Ollama su Windows/macOS/Linux. È il motore che fa funzionare il modello in background.
  2. 02
    Scaricare il modello
    Scarica un modello specializzato nella programmazione adatto alla tua VRAM con il comando seguente.
  3. 03
    Installare l'estensione Cline
    In VS Code: Estensioni (Ctrl+Shift+X) → cercare Cline → Install. Su JetBrains, passa dal marketplace dei plugin.
  4. 04
    Aprire il pannello
    Un'icona di Cline appare nella barra laterale sinistra. Cliccaci sopra per aprire il pannello dedicato alla chat e all'agente.
Modello da scaricare
# Modèle principal (chat + agent)
ollama pull qwen3.5:9b

# Plus de VRAM ? Devstral, le spécialiste du mode agent (16 Go)
ollama pull devstral:24b

#2. Configurare il provider Ollama

Cline deve sapere dove trovare il modello. Apri le sue impostazioni (icona dell'ingranaggio nel pannello), seleziona il provider Ollama, inserisci l'indirizzo locale del demone e scegli il modello nell'elenco rilevato.

Impostazioni provider
Provider     : Ollama
Base URL     : http://localhost:11434
Modèle       : qwen3.5:9b
!
Assicurati di usare il provider locale
Cline sa anche comunicare con API cloud. Per un utilizzo al 100% locale, verifica che il provider attivo sia Ollama e non un fornitore remoto — è l'unica impostazione che distingue un utilizzo privato dall'invio di codice a un server di terzi.

#3. Modalità chat

La modalità chat è l'equivalente diretto di un pannello Copilot Chat, in locale. Poni una domanda, incolla del codice, chiedi una spiegazione o una correzione.

Aprire la chat
Fai clic sull'icona Cline nella barra laterale. La conversazione si visualizza nel pannello.
Allegare codice
Seleziona un blocco nell'editor, poi aggiungilo al contesto della chat perché il modello possa ragionarci sopra.
Menzionare dei file
Cline può fare riferimento ai file del tuo progetto per rispondere con il giusto contesto, senza che tu debba copiare e incollare tutto.
Mantenere la cronologia in locale
Le tue conversazioni rimangono sulla tua macchina. Niente è sincronizzato in cloud.

#4. Modalità agente

È qui che Cline va oltre una semplice chat. In modalità agente, può leggere la struttura delle cartelle, aprire file, proporre modifiche su più file ed eseguire comandi: ogni azione è soggetta alla tua approvazione.

Piano poi esecuzione
Descrivi un compito in francese («aggiungi un endpoint /health e il suo test»). Cline propone un piano, poi applica le modifiche passo dopo passo.
Diff convalidato
Ogni modifica viene presentata sotto forma di diff che accetti o rifiuti. Mantieni il controllo in ogni momento.
Comandi sottoposti a controllo
L'agente può suggerire di eseguire un comando (test, build). Nulla viene eseguito senza il tuo consenso esplicito.
Esempi di istruzioni per l'agente
- Ajoute du logging pour tracer les entrées/sorties
- Convertis cette fonction en async/await
- Extrais ce bloc dans un fichier util.ts et mets à jour les imports
- Écris des tests unitaires pour les cas limites
→
Fornisci del contesto all'agente
Più precisa è l'istruzione (file interessato, comportamento atteso, vincolo di stile), migliore è il risultato. Un modello da 24B (Devstral) segue le istruzioni a più fasi più fedelmente di uno da 9B.

#5. Autocompletamento: Tabby o Twinny

Punto importante: Cline è un assistente chat + agente, non fornisce l'autocompletamento inline con «testo in grigio» durante la digitazione. Per ritrovare questa comodità in stile Copilot, aggiungi un'estensione dedicata, anch'essa collegata a Ollama.

Tabby
Estensione di autocompletamento self-hosted, ideale se più sviluppatori condividono la stessa GPU. L'autocompletamento riga per riga appare in grigio; Tab per accettare.
Twinny
Estensione leggera per VS Code con autocompletamento + chat, che si collega direttamente a Ollama. Un buon complemento a Cline per chi lavora da solo e deve scrivere molto codice.
Il duo che funziona
Cline per la chat e l'agente, Tabby o Twinny per il completamento inline. Entrambi si collegano allo stesso Ollama e il tuo codice resta locale in entrambi i casi.
→
Modello dedicato al completamento
Per l'autocompletamento (Fill-In-the-Middle), qwen2.5-coder:7b-base resta il riferimento nel 2026 (~4,7 GB) e rimane molto reattivo — è uno dei pochi casi in cui un modello del 2024 resta ancora ai vertici. Riserva il tuo modello di chat/agente (Qwen 3.5 9B, Devstral 24B) a Cline.

#Prestazioni e impostazioni avanzate

Num_ctx elevato
In Ollama, imposta num_ctx a 16384 perché l'agente possa inviare molto contesto (file, differenze). Attraverso un Modelfile.
Flash Attention
Su RTX 30/40/50, attiva FA in Ollama (variabile OLLAMA_FLASH_ATTENTION=1). Circa +20% di velocità.
Cache KV quantizzata
OLLAMA_KV_CACHE_TYPE=q8_0 dimezza la VRAM del contesto. Cruciale quando l'agente lavora su file grandi.
Un modello per ruolo
Un modello FIM dedicato (qwen2.5-coder:7b-base, ~4,7 GB) per l'autocompletamento (Tabby/Twinny), un 24B/30B (Devstral, Qwen3-Coder) per la chat e l'agente di Cline. Ollama carica quello richiesto.
Aumentare la finestra di contesto
# Modelfile : devstral-16k
FROM devstral:24b
PARAMETER num_ctx 16384
Creare il modello a contesto ampliato
ollama create devstral-16k -f Modelfile
# puis sélectionnez devstral-16k comme modèle dans Cline

#Domande frequenti

FAQ
Cline sostituisce davvero GitHub Copilot?+
Per la chat e la modalità agente (leggere/modificare più file, eseguire comandi), sì. Per l'autocompletamento inline con «testo grigio» durante la digitazione, no: Cline non lo offre. Aggiungi Tabby o Twinny, collegati allo stesso Ollama, per ritrovare questa comodità.
Perché non restare su Continue.dev?+
Continue è stato acquisito da Cursor nel giugno 2026; lo sviluppo prosegue presso Cursor (v2.0.0 = ultima release stabile), ma il futuro del prodotto autonomo è incerto. L'estensione si può ancora installare e resta lecito eseguire il codice con licenza Apache 2.0, ma senza aggiornamenti né correzioni. Cline, open source con licenza MIT e attivamente sviluppato, è la scelta consigliata per il consolidamento.
Quale modello scegliere se ho solo 8 GB di VRAM?+
Qwen 3.5 9B in Q4_K_M (~6,6 GB) trova comodamente spazio in 8 GB e resta la scelta migliore della categoria nel 2026 (256k di contesto, multilingue, visione). Se la VRAM è davvero limitata, Granite 4.2 8B (~5,3 GB) richiede ancora meno memoria. Entrambi bastano per la chat; per una modalità agente a più passaggi più affidabile, passa a Devstral 24B non appena la tua VRAM (16 GB) lo permette.
Il mio codice va su Internet con Cline?+
No, purché il provider attivo sia Ollama (http://localhost:11434). Cline può anche comunicare con API cloud: verifica nelle sue impostazioni che il provider selezionato sia effettivamente Ollama locale; è l'unica impostazione che distingue un utilizzo privato al 100% dall'invio a un server di terzi.
Cline funziona su JetBrains, non solo su VS Code?+
Sì. Cline è disponibile per VS Code e per gli IDE JetBrains (tramite il marketplace dei plugin). La configurazione del provider Ollama e la scelta del modello sono identiche in entrambi i casi.

#Conclusione

In una ventina di minuti hai un copilota di codice 100% locale: Cline per la chat e la modalità agente, un modello di codice recente (Qwen 3.5 9B, o Devstral 24B per l'agente) tramite Ollama come motore, e Tabby o Twinny (con qwen2.5-coder:7b-base) per l'autocompletamento inline. Il tuo codice non lascia mai il tuo computer, lavori offline e mantieni la libertà di cambiare modello in base ai linguaggi che usi. Se vuoi risparmiare ore di configurazione e partire da una base collaudata, la guida a pagamento «Copilota di codice locale» fornisce un pacchetto completo di configurazioni Ollama + Cline + Aider chiavi in mano.

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.