Percorso 02 · Per programmare

Lo sviluppatore — « Copilot locale, 100% offline, 0 latenza cloud. »

Qwen2.5 Coder 32B collegato a VSCode tramite Continue.dev. Autocompletamento, chat, refactoring su un file intero — senza che una riga del tuo codice vada a Microsoft, OpenAI o Anthropic. La tua PR contiene una chiave API? Resta lì.

Durata totale
~30 min
Livello richiesto
A proprio agio con un terminale
Costo
0 €
Macchina tipica
GPU con 16 GB di VRAM o Mac della serie M con almeno 32 GB
↑
La nostra promessa

Alla fine di questo percorso avrai un server llama.cpp che funziona in background con Qwen2.5 Coder 32B in quantizzazione Q4. Continue.dev sarà collegato a VSCode con autocompletamento (FIM) e chat nella sidebar. La latenza sarà sotto i 100 ms, e la qualità dell'autocompletamento sarà comparabile a Copilot, a volte migliore su codice recente.

Per chi è pensato questo percorso

Preferiamo dirtelo subito piuttosto che lasciarti perdere 30 minuti inutilmente.

✓ È per te se
  • ✓Programmi tutti i giorni e sei stufo di copiare i tuoi snippet in un'interfaccia web.
  • ✓Il tuo datore di lavoro vieta GitHub Copilot, ChatGPT, Cursor — per buone ragioni.
  • ✓Lavori su codice proprietario, soggetto a un NDA, o con segreti API in chiaro.
  • ✓Hai una RTX 4070 Ti+, RTX 4090, RTX 5090 o un MacBook Pro M2/M3/M4 con 32 GB+.
  • ✓Il ping di 200 ms verso le API cloud ti interrompe il flusso.
✕ Cerca altrove se
  • ·Hai 8 GB di VRAM: è fattibile, ma con un modello da 7B la qualità è nettamente inferiore a quella di Copilot.
  • ·Programmi 1 ora a settimana: un account gratuito presso un provider cloud ti darà meno grattacapi.
  • ·Vuoi una chat con un assistente generalista: consulta il percorso per curiosi, più semplice.

Il percorso in 4 passaggi

Ogni passaggio rimanda a una guida dettagliata che puoi leggere in parallelo. L’ordine è ottimizzato: non saltare nessun passaggio la prima volta.

Totale cumulato · ~30 min
  1. 1
    Passo 01·12 min·Avanzato

    Compilare llama.cpp con accelerazione GPU

    Compilare dai sorgenti per ottenere il massimo numero di token al secondo. Su NVIDIA: CUDA. Su Apple Silicon: Metal. Su AMD: ROCm. È più veloce di Ollama dal 15 al 30%.

    Binario llama-server pronto, in grado di fornire un'API compatibile con OpenAI.
    Leggi la guida →
  2. 2
    Passo 02·6 min·Intermedio

    Scarica Qwen2.5 Coder 32B (Q4)

    Il miglior modello per la programmazione a pesi aperti della sua categoria. Q4_K_M entra in circa 19 GB di VRAM e mantiene il 95% della qualità del FP16. Download da Hugging Face.

    Il modello è servito su localhost:8080 nel formato chat completions.
    Leggi la guida →
  3. 3
    Passo 03·8 min·Intermedio

    Collega Continue.dev a VSCode

    Installare l'estensione Continue dal marketplace, modificare ~/.continue/config.json per puntare al tuo endpoint locale, configurare il modello FIM per l'autocompletamento.

    Tab per accettare un suggerimento, Cmd+L per aprire la chat sulla selezione.
    Leggi la guida →
  4. +
    Passo bonus·4 min·Avanzato

    Bonus — Aider da riga di comando

    Per i compiti più ampi (refactoring di un modulo, generazione di test), Aider permette di modificare file in linguaggio naturale dal terminale, con commit automatici in git.

    Una CLI agentica collegata allo stesso backend, complementare a Continue.
    Leggi la guida →

Modelli consigliati

Tre opzioni testate per questo percorso — dalla più leggera a quella con le maggiori capacità. Clicca per aprire la scheda dettagliata (VRAM, contesto, benchmark).

Modello citato
qwen2.5-14b

Il tuttofare. 14B = 9 GB in Q4, qualità del codice eccellente, rientra in 12 GB di VRAM.

Il polivalente
Mistral Small 3
Mistral AI · 24B · 14 GB in Q4

Buon compromesso se hai 16 GB di VRAM, più generalista.

Vedi la scheda →
Modello citato
llama-3.3-70b

Il top, se hai un Mac con 64 GB o una GPU con 48 GB. Latenza più alta, ma qualità da maestro.

Domande frequenti

Le domande reali che ci vengono poste via e-mail e su Mastodon. Se manca la tua, apri un ticket.

Nel completamento automatico riga per riga, Qwen2.5 Coder 32B è molto vicino, a volte migliore su codice recente (post-2024). Nella chat, Copilot Chat (basato su GPT-4o) resta un passo avanti. Ma mantieni il controllo sui tuoi dati.
Una volta completato questo percorso
Percorso successivo

Il professionista attento alla riservatezza — « I miei dossier non lasciano il mio pc. »

Juriste, médecin, RH, consultant, expert-comptable, notaire — vos documents sont sous secret professionnel ou NDA. Un LLM local couplé à un RAG vous laisse les interroger, résumer,…

→
Il kit Copilota Locale

Sostituisci GitHub Copilot e Cursor con un copilota per la programmazione 100 % locale — la guida di riferimento, configurazioni incluse.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Una domanda, un errore di battitura, un bug?

Questo percorso evolve a ogni uscita di un modello. I tuoi feedback sono la materia prima.