Intermedio 14 minAgenti

Cline + Ollama: agente di programmazione 100% locale in VS Codice

Cline trasforma VS Code in un agente di programmazione autonomo: legge i tuoi file, propone diff, esegue comandi e procede per iterazioni fino al completamento del compito. Collegato a Ollama, tutto questo lavoro rimane sulla tua macchina — nessun token viene inviato a un server di terzi. Questa guida ti accompagna nella creazione di una configurazione Cline + Ollama completa e funzionante: quale modello scegliere in base alla tua VRAM, come configurare Ollama per evitare brutte sorprese legate al contesto e quali impostazioni fanno la differenza tra un agente utilizzabile e uno che continua a girare a vuoto.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché un agente Cline locale

Cline (precedentemente Claude Dev) è un'estensione di VS Code che controlla un LLM in un ciclo agentico: pianifica, modifica più file, esegue comandi nel terminale, legge l'output e corregge. A differenza di un semplice completamento inline, è un esecutore che si occupa di interi compiti — scrivere una funzione, migrare un modulo, eseguire il debug di uno stack trace.

Associarlo a Ollama piuttosto che a un'API cloud offre tre vantaggi concreti: il tuo codice proprietario non lascia mai il computer, non ci sono costi per token (Cline consuma un'enorme quantità di contesto, il che fa salire rapidamente i costi nel cloud) e l'agente funziona offline. Il prezzo da pagare: un buon modello locale per il codice richiede VRAM e le impostazioni predefinite di Ollama non sono adatte all'uso con un agente.

i
Questo manuale non è un manuale di migrazione
Se provieni da Continue.dev e cerchi di recuperare la tua configurazione, segui piuttosto la nostra guida dedicata «Continue.dev acquisito da Cursor: migrare a Cline»: tratta l'esportazione dei dati e la corrispondenza tra le impostazioni. Qui partiamo da zero per creare una configurazione Cline + Ollama ben organizzata.

#Prerequisiti

Il kit Copilota Locale

Questa guida ti porta al modello. Il kit ti porta al copilota che scrive codice nel tuo editor.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
VS Code
Versione recente (1.90+). Cline funziona anche nei fork compatibili con Open VSX (VSCodium, Cursor), ma questa guida riguarda VS Code standard.
Ollama installato
Il daemon deve essere in esecuzione e in ascolto su http://localhost:11434. Se non è ancora così, consulta la nostra guida all'installazione di Ollama.
Un GPU con abbastanza VRAM
Almeno 16 GB per usare comodamente un agente, 24 GB per i modelli di fascia alta. L'esecuzione sulla sola CPU resta possibile, ma è troppo lenta per il ciclo dell'agente.
Progetto aperto in VS Code
Cline agisce nella cartella del workspace attuale: apri un vero repository, non un file isolato.

#Scegliere il modello in base alla VRAM

La scelta del modello è la priorità rispetto a tutto il resto: un agente Cline concatena chiamate agli strumenti, lettura di file e diff, quindi deve avere un modello che segua le istruzioni e rispetti il formato degli strumenti. Tre profili coprono la maggior parte delle schede nel 2026.

24 GB (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
Il miglior agente locale oggi. In Q4_K_M occupa circa 19 GB, lasciando margine per un contesto di 32k. È il modello a cui puntare se la tua scheda riesce a gestirlo.
16 GB (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
Modello Mistral specializzato in agenti di codice, ottimizzato per funzionare in 16 GB in Q4_K_M con un contesto utile. Il miglior compromesso in questa gamma di schede.
Un solido modello generalista — Qwen 3.6 27B
Se vuoi un solo modello per il codice e il resto, la variante 27B entra in 24 GB in Q4 e se la cava molto bene come agente. Un gradino sotto Qwen3-Coder per il solo codice, ma più versatile.
→
Indicazione della VRAM in Q4
Con la quantizzazione Q4_K_M (l'impostazione predefinita consigliata): un 14B ≈ 9 GB, un 27B ≈ 16-17 GB, un 32B ≈ 19 GB. Aggiungi la VRAM necessaria per il contesto: più grande è la finestra, più cresce la cache KV. Mantieni sempre un margine di 2-3 GB.

Evita i modelli sotto i 14B per l'uso come agente: non rispettano il formato delle chiamate agli strumenti, entrano in loop o propongono diff che non si possono applicare. Un modello piccolo e veloce è eccellente per il completamento inline (tramite Tabby o Continue), non per guidare Cline.

#1. Preparare Ollama

Verifica prima che Ollama sia in esecuzione, poi scarica il modello scelto. Prendiamo qui Qwen3-Coder 32B come esempio — sostituisci il tag con quello corrispondente alla tua VRAM.

Terminale
# Vérifier que le daemon répond
curl http://localhost:11434/api/version

# Tirer le modèle de code (adapter au tag exact affiché sur ollama.com)
ollama pull qwen3-coder:32b

# Alternatives selon la VRAM
ollama pull devstral-small-2   # 16 Go
ollama pull qwen3.6:27b        # généraliste 24 Go

# Lister ce qui est installé
ollama list
!
Verifica il tag esatto
I nomi dei tag Ollama evolvono (suffissi di quantizzazione, versioni). Copia il tag dalla pagina ufficiale del modello su ollama.com invece di indovinarlo: un tag inesistente restituisce un errore di pull silenzioso.

#2. Impostare il contesto Ollama

È il passaggio che tutti sbagliano. Per impostazione predefinita, Ollama serve i modelli con una finestra di contesto di 4096 token. Ma Cline invia il contenuto di diversi file, la cronologia del compito e le definizioni degli strumenti: a 4k, l'agente dimentica l'inizio del proprio compito a ogni turno e diventa inutilizzabile.

È necessario aumentare num_ctx. La procedura corretta è creare un modello derivato attraverso un Modelfile, in modo che l'impostazione sia permanente e indipendente da Cline.

Modelfile
# Fichier : Modelfile
FROM qwen3-coder:32b

# Contexte élargi pour l'usage agent (32k)
PARAMETER num_ctx 32768

# Un peu de déterminisme pour le code
PARAMETER temperature 0.2
Terminale
# Créer le modèle dérivé
ollama create qwen3-coder-agent -f Modelfile

# Il apparaît désormais dans la liste
ollama list
!
num_ctx costa VRAM
Passare da 4k a 32k aumenta di diversi GB la cache KV. Con 16 GB, resta a 16k (num_ctx 16384) anziché a 32k, altrimenti Ollama sposta parte del modello nella RAM di sistema e l'agente rallenta. Controlla `ollama ps`: se la colonna PROCESSOR indica l'uso della CPU, riduci il contesto o la quantizzazione.

#3. Installare Cline

  1. 01
    Aprire il Marketplace
    In VS Code, apri il pannello Estensioni (Ctrl+Maiusc+X).
  2. 02
    Cercare Cline
    Digita « Cline » nella barra di ricerca. L'estensione ufficiale è pubblicata da « Cline Bot Inc. » — controlla l'editore per evitare i cloni.
  3. 03
    Installare e fissare
    Clicca su Installa. Un'icona di Cline appare nella barra laterale delle attività; fissala per accedervi rapidamente.

#4. Collegare Cline a Ollama

Cline supporta Ollama nativamente: non serve arrangiarsi con un URL di un'API compatibile con OpenAI. Apri il pannello Cline, fai clic sull'icona delle impostazioni, poi configura il fornitore.

  1. 01
    API Provider → Ollama
    Nella lista a discesa « API Provider », seleziona « Ollama ».
  2. 02
    Base URL
    Lascia http://localhost:11434 (valore predefinito). Cambialo solo se Ollama funziona su un'altra macchina o in un contenitore.
  3. 03
    Model
    Seleziona qwen3-coder-agent (il modello derivato creato al passaggio 2), non il modello di base con 4k di contesto.
  4. 04
    Verificare la finestra di contesto
    Cline mostra un campo « Context Window ». Allinealo al valore num_ctx del Modelfile (32768). Una discrepanza qui fa sì che Cline tronchi i prompt prima ancora che arrivino a Ollama.
i
Plan Mode e Act Mode
Cline distingue la modalità Plan (riflette e propone una strategia senza toccare i file) dalla modalità Act (esegue). Con un modello locale, inizia in modalità Plan per verificare l'approccio: così eviti che un modello un po' debole inizi a modificare dieci file nella direzione sbagliata.

#5. Primo avvio in modalità agente

Apri un vero progetto, poi assegna a Cline un compito concreto e circoscritto. I migliori test iniziali sono quelli che coinvolgono pochi file: aggiungere un test, correggere un bug identificato, scrivere una piccola funzione di utilità.

Prompt Cline
Ajoute une fonction `slugify(texte)` dans src/utils/strings.js qui met en minuscules, remplace les accents et les espaces par des tirets. Écris aussi un test unitaire dans le fichier de tests existant à côté.

Cline leggerà la cartella, proporrà un diff e ti chiederà di approvare ogni modifica e ogni comando. La prima volta, approva passo dopo passo per capire il suo comportamento. Quando ti sentirai sicuro, potrai attivare nelle impostazioni l'approvazione automatica di alcune azioni (lettura di file, comandi non distruttivi).

→
Un file con le regole del progetto
Aggiungi un file `.clinerules` alla radice del repository per stabilire le regole dell'agente: convenzioni di denominazione, comando di test da eseguire, cartelle da non toccare mai. Un modello locale segue meglio le istruzioni quando le regole sono esplicite e brevi.

#Insidie comuni

L'agente dimentica la sua attività
Quasi sempre è un problema di contesto: num_ctx troppo basso in Ollama o Context Window impostata male in Cline. Riallinea i due valori.
I diff non si applicano
Il modello è troppo piccolo o eccessivamente quantizzato per rispettare il formato delle modifiche. Passa a un modello più grande (14B → 27B/32B) o passa da Q3 a Q4_K_M.
L'inferenza passa alla CPU
Il modello e il contesto superano la capacità della VRAM. Controlla `ollama ps`; riduci num_ctx o scegli un modello più piccolo. Un agente eseguito in parte sulla CPU diventa inutilizzabile.
Cicli infiniti di chiamate agli strumenti
Alcuni modelli eseguono di nuovo lo stesso comando. Passa prima a Plan Mode e suddividi il compito in sottocompiti più piccoli.
Connessione rifiutata
Ollama non è in ascolto, oppure non all'URL previsto. Prova `curl http://localhost:11434/api/version`. In un container, esponi la porta e configura Cline perché usi l'indirizzo corretto.

#Per approfondire

Hai un agente Cline 100% locale che modifica il tuo codice senza esporre nulla. Due sviluppi naturali: affinare la scelta del modello e integrare l'autocompletamento inline che Cline non fornisce.

→
Kit Copilota Locale
La combinazione completa per sostituire GitHub Copilot in locale: Cline (chat + agente) per le attività, Tabby per il completamento mostrato in grigio durante la digitazione e un modello di codice adatto alla tua GPU. Ogni componente rimane sulla tua macchina.
Miglior LLM locale per la programmazione nel 2026
Il confronto tra Devstral / Qwen3-Coder e le alternative, con VRAM e qualità del codice — per affinare la scelta del modello collegato a Cline.
Continue.dev acquisito da Cursor: passare a Cline
Se passi da Continue.dev, la guida dedicata all'esportazione e alla migrazione della tua configurazione verso questo stesso setup.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Capire i compromessi qualità/VRAM per far entrare il modello più grande possibile sulla tua scheda.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.