Guida al budget · aggiornata nel 2026
Costruire il proprio stack LLM locale per budget
La combinazione hardware + modello più economica che permette davvero di eseguire Qwen 3, Gemma 3 e le distillazioni di DeepSeek R1 a una velocità utilizzabile nel 2026.
Quale macchina per il mio budget?
Inserisci il tuo budget e la tua priorità: lo strumento propone le macchine che rientrano nel budget, i modelli che possono eseguire e i loro prezzi verificati questa settimana.
Come leggere questo manuale
Imposta due variabili: budget et uso principale. Tutto il resto — quantizzazione, runtime, lunghezza del contesto — ne deriva. Parti dalla VRAM, scegli il modello più grande che riesci a caricare in Q4_K_M lasciando un margine con un contesto di 8K, poi scegli il runtime.
Regola base: un modello in GGUF Q4_K_M occupa circa (paramètres × 0,6) Go di VRAM, più circa 1,5 GB di cache KV a 8K. Un modello da 14B ha quindi bisogno di circa 10 GB, il che spiega perché una RTX 3060 da 12 GB usata rimane un punto di riferimento per il rapporto qualità/prezzo.
Scegli il tuo livello
| Livello | Budget | Configurazione di riferimento | VRAM / memoria unificata | Modello ideale (Q4_K_M) |
|---|---|---|---|---|
| Input | 400-550 € | Mini-PC Ryzen 7 5700U usato, 16 GB DDR4 | 0 GB GPU / 16 GB RAM | Qwen3 4B |
| Qualità-prezzo | 850-1 000 € | Ryzen 5 7600 + RTX 3060 12 GB usata + 32 GB DDR5 | 12 GB | Qwen 3 14B o Qwen 2.5 Coder 14B |
| Prestazione | 1 400-1 600 € | Ryzen 7 7700 + RTX 3090 24 GB usata + 64 GB DDR5 | 24 GB | Qwen3-Coder 30B-A3B o DeepSeek-R1-Distill-Qwen-32B |
| Silenzioso | ≈ 2 000 € | Apple Mac mini M5 Pro 24 GB (nuovo) | ≈ 16 GB utilizzabili | Qwen 3 14B |
Prezzi indicativi del mercato dell'usato in Francia/UE a metà 2026 — il mercato dell'usato oscilla, verifica i prezzi attuali prima di acquistare.
Livello 2 — il vincitore a 900 €
È la fascia che consigliamo alla maggior parte dei lettori. Una RTX 3060 da 12 GB usata si trova intorno ai 200-240 € sul mercato dell'usato, e 12 GB di VRAM rappresentano esattamente il punto ideale per i modelli di classe 14B.
| Modello (Q4_K_M) | VRAM utilizzata | Tokens/s (stima) | Ideale per |
|---|---|---|---|
| Qwen 3 8B | ~6 GB | ~50 | Chat, RAG |
| Qwen 2.5 Coder 14B | ~10 GB | ~28 | Completamento di codice, refactoring |
| Gemma 3 12B | ~8 GB | ~34 | Multilingue, domande e risposte su documenti |
| DeepSeek-R1-Distill-Qwen-14B | ~10 GB | ~28 | Ragionamento passo dopo passo |
Stima, non misura QuelLLM: circa il 70% del limite teorico (banda della RTX 3060, 360 GB/s, divisa per la dimensione del modello). Il limite di un 8B in Q4 è di circa 72 token/s, quello di un 14B di circa 40.
Runtime: Ollama, llama.cpp o vLLM?
- Ollama — il migliore per l'uso da parte di un solo utente su una postazione di lavoro. Scarica automaticamente i GGUF, offre un'API compatibile con OpenAI, si integra con Open WebUI con un solo comando.
- llama.cpp — il migliore quando serve ottenere ogni token/s possibile da una CPU o dalla memoria unificata. CLI più tecnica, maggiore portabilità.
- vLLM — il migliore per servire più utenti o agenti in parallelo, grazie a PagedAttention e al batching continuo.
Sviluppatori che lavorano da soli → Ollama come scelta predefinita. Team di 3 o più persone → vLLM dietro un piccolo proxy FastAPI.
Consumo, rumore e costo totale
| Config | A riposo (W) | Potenza (W) | kWh/anno (4 ore al giorno sotto carico) | Costo annuale @ 0,20 €/kWh |
|---|---|---|---|---|
| Mini-PC di fascia base | 8 | 35 | 51 | 10,20 € |
| 3060 valore | 45 | 220 | 321 | 64,20 € |
| Prestazioni della 3090 | 50 | 360 | 526 | 105,10 € |
| Mac mini (processore Pro) | 6 | 65 | 95 | 19,00 € |
Valori di potenza approssimativi. Calcolo: potenza sotto carico × 4 h × 365 giorni, con la macchina spenta per il resto del tempo. Se la lasci accesa a riposo, aggiungi la potenza a riposo × 20 h × 365.
Anche la configurazione che consuma di più costa circa 105 € di elettricità all'anno a questo ritmo, ovvero poco più di cinque mesi di un abbonamento da 20 € al mese.
Verdetto
| Profilo | Livello consigliato | Perché |
|---|---|---|
| Curioso, solo chat | Fascia iniziale: 400 € | Qwen3 4B su CPU va più veloce della lettura |
| Sviluppatore che lavora da solo, programmazione quotidiana | Valore 900 € | Un modello da 14B per il codice a ~28 tok/s è il punto di equilibrio tra prezzo e prestazioni |
| Ragionamento, agenti, più modelli | Performance 1.500 € | 24 GB permettono di usare i modelli di classe 32B |
| Silenzio e zero manutenzione | Silenzioso ≈ 2 000 € | Il Mac mini consuma solo pochi watt quando è inattivo |
Domande frequenti
8 GB di VRAM sono sufficienti per un utilizzo utile nel 2026?
Solo marginalmente. Puoi eseguire Qwen3 8B Q4_K_M con un contesto 4K su una RTX 3050 8 GB o una RX 6600, ma perdi il margine per i modelli 14B che rendono l'inferenza locale davvero interessante. Puntare a 12 GB, se possibile.
Conviene acquistare una scheda AMD anziché NVIDIA?
Per la sola inferenza, le Radeon RDNA3 e RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) funzionano bene con il backend Vulkan di llama.cpp e con ROCm. Spesso costano meno a parità di memoria, ma perdi parte dell'ecosistema CUDA: vLLM più limitato, flash-attn e la maggior parte degli strumenti di fine-tuning.
È possibile fare fine-tuning con questi budget?
Il fine-tuning LoRA dei modelli 7B funziona su una scheda da 12 GB con Unsloth. Un modello 14B+ richiede realisticamente 24 GB. Il fine-tuning completo oltre 1B supera ciò che l’hardware di fascia consumer permette nel 2026.
Come si confronta la memoria unificata del Mac con la VRAM dedicata?
La sua banda passante rimane comunque inferiore a quella di una scheda di alto livello: 307 GB/s su un Mac mini M5 Pro contro 936 GB/s su una RTX 3090. Su un modello contenuto nella scheda, il Mac genera quindi circa 2 a 3 volte meno token al secondo. Guadagna sulla consumazione, sulla capacità di memoria e sul caricamento di diversi modelli; perde sui token al secondo per euro.