◆ IA Locale — Il tuo ChatGPT privato e gratuito, sul tuo computer, in 1 h · 24 € · o tutti i kit 49 € →

Guida al budget · aggiornata nel 2026

Costruire il proprio stack LLM locale per budget

La combinazione hardware + modello più economica che permette davvero di eseguire Qwen 3, Gemma 3 e le distillazioni di DeepSeek R1 a una velocità utilizzabile nel 2026.

Quale macchina per il mio budget?

Inserisci il tuo budget e la tua priorità: lo strumento propone le macchine che rientrano nel budget, i modelli che possono eseguire e i loro prezzi verificati questa settimana.

Come leggere questo manuale

Imposta due variabili: budget et uso principale. Tutto il resto — quantizzazione, runtime, lunghezza del contesto — ne deriva. Parti dalla VRAM, scegli il modello più grande che riesci a caricare in Q4_K_M lasciando un margine con un contesto di 8K, poi scegli il runtime.

Regola base: un modello in GGUF Q4_K_M occupa circa (paramètres × 0,6) Go di VRAM, più circa 1,5 GB di cache KV a 8K. Un modello da 14B ha quindi bisogno di circa 10 GB, il che spiega perché una RTX 3060 da 12 GB usata rimane un punto di riferimento per il rapporto qualità/prezzo.

Scegli il tuo livello

LivelloBudgetConfigurazione di riferimentoVRAM / memoria unificataModello ideale (Q4_K_M)
Input400-550 €Mini-PC Ryzen 7 5700U usato, 16 GB DDR40 GB GPU / 16 GB RAMQwen3 4B
Qualità-prezzo850-1 000 €Ryzen 5 7600 + RTX 3060 12 GB usata + 32 GB DDR512 GBQwen 3 14B o Qwen 2.5 Coder 14B
Prestazione1 400-1 600 €Ryzen 7 7700 + RTX 3090 24 GB usata + 64 GB DDR524 GBQwen3-Coder 30B-A3B o DeepSeek-R1-Distill-Qwen-32B
Silenzioso≈ 2 000 €Apple Mac mini M5 Pro 24 GB (nuovo)≈ 16 GB utilizzabiliQwen 3 14B

Prezzi indicativi del mercato dell'usato in Francia/UE a metà 2026 — il mercato dell'usato oscilla, verifica i prezzi attuali prima di acquistare.

Livello 2 — il vincitore a 900 €

È la fascia che consigliamo alla maggior parte dei lettori. Una RTX 3060 da 12 GB usata si trova intorno ai 200-240 € sul mercato dell'usato, e 12 GB di VRAM rappresentano esattamente il punto ideale per i modelli di classe 14B.

Modello (Q4_K_M)VRAM utilizzataTokens/s (stima)Ideale per
Qwen 3 8B~6 GB~50Chat, RAG
Qwen 2.5 Coder 14B~10 GB~28Completamento di codice, refactoring
Gemma 3 12B~8 GB~34Multilingue, domande e risposte su documenti
DeepSeek-R1-Distill-Qwen-14B~10 GB~28Ragionamento passo dopo passo

Stima, non misura QuelLLM: circa il 70% del limite teorico (banda della RTX 3060, 360 GB/s, divisa per la dimensione del modello). Il limite di un 8B in Q4 è di circa 72 token/s, quello di un 14B di circa 40.

Runtime: Ollama, llama.cpp o vLLM?

Sviluppatori che lavorano da soli → Ollama come scelta predefinita. Team di 3 o più persone → vLLM dietro un piccolo proxy FastAPI.

Consumo, rumore e costo totale

ConfigA riposo (W)Potenza (W)kWh/anno (4 ore al giorno sotto carico)Costo annuale @ 0,20 €/kWh
Mini-PC di fascia base8355110,20 €
3060 valore4522032164,20 €
Prestazioni della 309050360526105,10 €
Mac mini (processore Pro)6659519,00 €

Valori di potenza approssimativi. Calcolo: potenza sotto carico × 4 h × 365 giorni, con la macchina spenta per il resto del tempo. Se la lasci accesa a riposo, aggiungi la potenza a riposo × 20 h × 365.

Anche la configurazione che consuma di più costa circa 105 € di elettricità all'anno a questo ritmo, ovvero poco più di cinque mesi di un abbonamento da 20 € al mese.

Verdetto

ProfiloLivello consigliatoPerché
Curioso, solo chatFascia iniziale: 400 €Qwen3 4B su CPU va più veloce della lettura
Sviluppatore che lavora da solo, programmazione quotidianaValore 900 €Un modello da 14B per il codice a ~28 tok/s è il punto di equilibrio tra prezzo e prestazioni
Ragionamento, agenti, più modelliPerformance 1.500 €24 GB permettono di usare i modelli di classe 32B
Silenzio e zero manutenzioneSilenzioso ≈ 2 000 €Il Mac mini consuma solo pochi watt quando è inattivo

Domande frequenti

8 GB di VRAM sono sufficienti per un utilizzo utile nel 2026?

Solo marginalmente. Puoi eseguire Qwen3 8B Q4_K_M con un contesto 4K su una RTX 3050 8 GB o una RX 6600, ma perdi il margine per i modelli 14B che rendono l'inferenza locale davvero interessante. Puntare a 12 GB, se possibile.

Conviene acquistare una scheda AMD anziché NVIDIA?

Per la sola inferenza, le Radeon RDNA3 e RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) funzionano bene con il backend Vulkan di llama.cpp e con ROCm. Spesso costano meno a parità di memoria, ma perdi parte dell'ecosistema CUDA: vLLM più limitato, flash-attn e la maggior parte degli strumenti di fine-tuning.

È possibile fare fine-tuning con questi budget?

Il fine-tuning LoRA dei modelli 7B funziona su una scheda da 12 GB con Unsloth. Un modello 14B+ richiede realisticamente 24 GB. Il fine-tuning completo oltre 1B supera ciò che l’hardware di fascia consumer permette nel 2026.

Come si confronta la memoria unificata del Mac con la VRAM dedicata?

La sua banda passante rimane comunque inferiore a quella di una scheda di alto livello: 307 GB/s su un Mac mini M5 Pro contro 936 GB/s su una RTX 3090. Su un modello contenuto nella scheda, il Mac genera quindi circa 2 a 3 volte meno token al secondo. Guadagna sulla consumazione, sulla capacità di memoria e sul caricamento di diversi modelli; perde sui token al secondo per euro.

Altri strumenti gratuiti