Lo sviluppatore — « Copilot locale, 100% offline, 0 latenza cloud. »
Qwen2.5 Coder 32B collegato a VSCode tramite Continue.dev. Autocompletamento, chat, refactoring su un file intero — senza che una riga del tuo codice vada a Microsoft, OpenAI o Anthropic. La tua PR contiene una chiave API? Resta lì.
Alla fine di questo percorso avrai un server llama.cpp che funziona in background con Qwen2.5 Coder 32B in quantizzazione Q4. Continue.dev sarà collegato a VSCode con autocompletamento (FIM) e chat nella sidebar. La latenza sarà sotto i 100 ms, e la qualità dell'autocompletamento sarà comparabile a Copilot, a volte migliore su codice recente.
Per chi è pensato questo percorso
Preferiamo dirtelo subito piuttosto che lasciarti perdere 30 minuti inutilmente.
- ✓Programmi tutti i giorni e sei stufo di copiare i tuoi snippet in un'interfaccia web.
- ✓Il tuo datore di lavoro vieta GitHub Copilot, ChatGPT, Cursor — per buone ragioni.
- ✓Lavori su codice proprietario, soggetto a un NDA, o con segreti API in chiaro.
- ✓Hai una RTX 4070 Ti+, RTX 4090, RTX 5090 o un MacBook Pro M2/M3/M4 con 32 GB+.
- ✓Il ping di 200 ms verso le API cloud ti interrompe il flusso.
- ·Hai 8 GB di VRAM: è fattibile, ma con un modello da 7B la qualità è nettamente inferiore a quella di Copilot.
- ·Programmi 1 ora a settimana: un account gratuito presso un provider cloud ti darà meno grattacapi.
- ·Vuoi una chat con un assistente generalista: consulta il percorso per curiosi, più semplice.
Il percorso in 4 passaggi
Ogni passaggio rimanda a una guida dettagliata che puoi leggere in parallelo. L’ordine è ottimizzato: non saltare nessun passaggio la prima volta.
- 1Passo 01·12 min·Avanzato
Compilare llama.cpp con accelerazione GPU
Compilare dai sorgenti per ottenere il massimo numero di token al secondo. Su NVIDIA: CUDA. Su Apple Silicon: Metal. Su AMD: ROCm. È più veloce di Ollama dal 15 al 30%.
Binario llama-server pronto, in grado di fornire un'API compatibile con OpenAI.Leggi la guida → - 2Passo 02·6 min·Intermedio
Scarica Qwen2.5 Coder 32B (Q4)
Il miglior modello per la programmazione a pesi aperti della sua categoria. Q4_K_M entra in circa 19 GB di VRAM e mantiene il 95% della qualità del FP16. Download da Hugging Face.
Il modello è servito su localhost:8080 nel formato chat completions.Leggi la guida → - 3Passo 03·8 min·Intermedio
Collega Continue.dev a VSCode
Installare l'estensione Continue dal marketplace, modificare ~/.continue/config.json per puntare al tuo endpoint locale, configurare il modello FIM per l'autocompletamento.
Tab per accettare un suggerimento, Cmd+L per aprire la chat sulla selezione.Leggi la guida → - +Passo bonus·4 min·Avanzato
Bonus — Aider da riga di comando
Per i compiti più ampi (refactoring di un modulo, generazione di test), Aider permette di modificare file in linguaggio naturale dal terminale, con commit automatici in git.
Una CLI agentica collegata allo stesso backend, complementare a Continue.Leggi la guida →
Modelli consigliati
Tre opzioni testate per questo percorso — dalla più leggera a quella con le maggiori capacità. Clicca per aprire la scheda dettagliata (VRAM, contesto, benchmark).
Il tuttofare. 14B = 9 GB in Q4, qualità del codice eccellente, rientra in 12 GB di VRAM.
Buon compromesso se hai 16 GB di VRAM, più generalista.
Vedi la scheda →Il top, se hai un Mac con 64 GB o una GPU con 48 GB. Latenza più alta, ma qualità da maestro.
Domande frequenti
Le domande reali che ci vengono poste via e-mail e su Mastodon. Se manca la tua, apri un ticket.
Il professionista attento alla riservatezza — « I miei dossier non lasciano il mio pc. »
Juriste, médecin, RH, consultant, expert-comptable, notaire — vos documents sont sous secret professionnel ou NDA. Un LLM local couplé à un RAG vous laisse les interroger, résumer,…
Sostituisci GitHub Copilot e Cursor con un copilota per la programmazione 100 % locale — la guida di riferimento, configurazioni incluse.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Una domanda, un errore di battitura, un bug?
Questo percorso evolve a ogni uscita di un modello. I tuoi feedback sono la materia prima.