Cline + Ollama: agente di programmazione 100% locale in VS Codice
Cline trasforma VS Code in un agente di programmazione autonomo: legge i tuoi file, propone diff, esegue comandi e procede per iterazioni fino al completamento del compito. Collegato a Ollama, tutto questo lavoro rimane sulla tua macchina — nessun token viene inviato a un server di terzi. Questa guida ti accompagna nella creazione di una configurazione Cline + Ollama completa e funzionante: quale modello scegliere in base alla tua VRAM, come configurare Ollama per evitare brutte sorprese legate al contesto e quali impostazioni fanno la differenza tra un agente utilizzabile e uno che continua a girare a vuoto.
#Perché un agente Cline locale
Cline (precedentemente Claude Dev) è un'estensione di VS Code che controlla un LLM in un ciclo agentico: pianifica, modifica più file, esegue comandi nel terminale, legge l'output e corregge. A differenza di un semplice completamento inline, è un esecutore che si occupa di interi compiti — scrivere una funzione, migrare un modulo, eseguire il debug di uno stack trace.
Associarlo a Ollama piuttosto che a un'API cloud offre tre vantaggi concreti: il tuo codice proprietario non lascia mai il computer, non ci sono costi per token (Cline consuma un'enorme quantità di contesto, il che fa salire rapidamente i costi nel cloud) e l'agente funziona offline. Il prezzo da pagare: un buon modello locale per il codice richiede VRAM e le impostazioni predefinite di Ollama non sono adatte all'uso con un agente.
#Prerequisiti
Questa guida ti porta al modello. Il kit ti porta al copilota che scrive codice nel tuo editor.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- VS Code
- Versione recente (1.90+). Cline funziona anche nei fork compatibili con Open VSX (VSCodium, Cursor), ma questa guida riguarda VS Code standard.
- Ollama installato
- Il daemon deve essere in esecuzione e in ascolto su http://localhost:11434. Se non è ancora così, consulta la nostra guida all'installazione di Ollama.
- Un GPU con abbastanza VRAM
- Almeno 16 GB per usare comodamente un agente, 24 GB per i modelli di fascia alta. L'esecuzione sulla sola CPU resta possibile, ma è troppo lenta per il ciclo dell'agente.
- Progetto aperto in VS Code
- Cline agisce nella cartella del workspace attuale: apri un vero repository, non un file isolato.
#Scegliere il modello in base alla VRAM
La scelta del modello è la priorità rispetto a tutto il resto: un agente Cline concatena chiamate agli strumenti, lettura di file e diff, quindi deve avere un modello che segua le istruzioni e rispetti il formato degli strumenti. Tre profili coprono la maggior parte delle schede nel 2026.
- 24 GB (RTX 4090, 3090, RX 7900 XTX) — Qwen3-Coder 32B
- Il miglior agente locale oggi. In Q4_K_M occupa circa 19 GB, lasciando margine per un contesto di 32k. È il modello a cui puntare se la tua scheda riesce a gestirlo.
- 16 GB (RTX 4080, 5070 Ti, 4060 Ti 16GB) — Devstral Small 2
- Modello Mistral specializzato in agenti di codice, ottimizzato per funzionare in 16 GB in Q4_K_M con un contesto utile. Il miglior compromesso in questa gamma di schede.
- Un solido modello generalista — Qwen 3.6 27B
- Se vuoi un solo modello per il codice e il resto, la variante 27B entra in 24 GB in Q4 e se la cava molto bene come agente. Un gradino sotto Qwen3-Coder per il solo codice, ma più versatile.
Evita i modelli sotto i 14B per l'uso come agente: non rispettano il formato delle chiamate agli strumenti, entrano in loop o propongono diff che non si possono applicare. Un modello piccolo e veloce è eccellente per il completamento inline (tramite Tabby o Continue), non per guidare Cline.
#1. Preparare Ollama
Verifica prima che Ollama sia in esecuzione, poi scarica il modello scelto. Prendiamo qui Qwen3-Coder 32B come esempio — sostituisci il tag con quello corrispondente alla tua VRAM.
#2. Impostare il contesto Ollama
È il passaggio che tutti sbagliano. Per impostazione predefinita, Ollama serve i modelli con una finestra di contesto di 4096 token. Ma Cline invia il contenuto di diversi file, la cronologia del compito e le definizioni degli strumenti: a 4k, l'agente dimentica l'inizio del proprio compito a ogni turno e diventa inutilizzabile.
È necessario aumentare num_ctx. La procedura corretta è creare un modello derivato attraverso un Modelfile, in modo che l'impostazione sia permanente e indipendente da Cline.
#3. Installare Cline
- 01Aprire il MarketplaceIn VS Code, apri il pannello Estensioni (Ctrl+Maiusc+X).
- 02Cercare ClineDigita « Cline » nella barra di ricerca. L'estensione ufficiale è pubblicata da « Cline Bot Inc. » — controlla l'editore per evitare i cloni.
- 03Installare e fissareClicca su Installa. Un'icona di Cline appare nella barra laterale delle attività; fissala per accedervi rapidamente.
#4. Collegare Cline a Ollama
Cline supporta Ollama nativamente: non serve arrangiarsi con un URL di un'API compatibile con OpenAI. Apri il pannello Cline, fai clic sull'icona delle impostazioni, poi configura il fornitore.
- 01API Provider → OllamaNella lista a discesa « API Provider », seleziona « Ollama ».
- 02Base URLLascia http://localhost:11434 (valore predefinito). Cambialo solo se Ollama funziona su un'altra macchina o in un contenitore.
- 03ModelSeleziona qwen3-coder-agent (il modello derivato creato al passaggio 2), non il modello di base con 4k di contesto.
- 04Verificare la finestra di contestoCline mostra un campo « Context Window ». Allinealo al valore num_ctx del Modelfile (32768). Una discrepanza qui fa sì che Cline tronchi i prompt prima ancora che arrivino a Ollama.
#5. Primo avvio in modalità agente
Apri un vero progetto, poi assegna a Cline un compito concreto e circoscritto. I migliori test iniziali sono quelli che coinvolgono pochi file: aggiungere un test, correggere un bug identificato, scrivere una piccola funzione di utilità.
Cline leggerà la cartella, proporrà un diff e ti chiederà di approvare ogni modifica e ogni comando. La prima volta, approva passo dopo passo per capire il suo comportamento. Quando ti sentirai sicuro, potrai attivare nelle impostazioni l'approvazione automatica di alcune azioni (lettura di file, comandi non distruttivi).
#Insidie comuni
- L'agente dimentica la sua attività
- Quasi sempre è un problema di contesto: num_ctx troppo basso in Ollama o Context Window impostata male in Cline. Riallinea i due valori.
- I diff non si applicano
- Il modello è troppo piccolo o eccessivamente quantizzato per rispettare il formato delle modifiche. Passa a un modello più grande (14B → 27B/32B) o passa da Q3 a Q4_K_M.
- L'inferenza passa alla CPU
- Il modello e il contesto superano la capacità della VRAM. Controlla `ollama ps`; riduci num_ctx o scegli un modello più piccolo. Un agente eseguito in parte sulla CPU diventa inutilizzabile.
- Cicli infiniti di chiamate agli strumenti
- Alcuni modelli eseguono di nuovo lo stesso comando. Passa prima a Plan Mode e suddividi il compito in sottocompiti più piccoli.
- Connessione rifiutata
- Ollama non è in ascolto, oppure non all'URL previsto. Prova `curl http://localhost:11434/api/version`. In un container, esponi la porta e configura Cline perché usi l'indirizzo corretto.
#Per approfondire
Hai un agente Cline 100% locale che modifica il tuo codice senza esporre nulla. Due sviluppi naturali: affinare la scelta del modello e integrare l'autocompletamento inline che Cline non fornisce.
- Miglior LLM locale per la programmazione nel 2026
- Il confronto tra Devstral / Qwen3-Coder e le alternative, con VRAM e qualità del codice — per affinare la scelta del modello collegato a Cline.
- Continue.dev acquisito da Cursor: passare a Cline
- Se passi da Continue.dev, la guida dedicata all'esportazione e alla migrazione della tua configurazione verso questo stesso setup.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Capire i compromessi qualità/VRAM per far entrare il modello più grande possibile sulla tua scheda.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.