Quale GPU per un LLM locale? Da RTX 4070 a 5090, Mac (2026)
Per un LLM locale, il criterio n.1 è la VRAM (non la potenza di gaming), poi i token al secondo, poi il consumo. Una RTX 3090 usata (24 GB VRAM) può superare una RTX 4070 nuova per l'IA locale grazie alla sua memoria superiore, anche se ha un'architettura più vecchia.
La GPU è il componente che cambia di più la tua esperienza di IA locale. Ma non cerchi la stessa GPU di un gamer: per un LLM, ciò che conta è la VRAM, poi i token al secondo, poi il consumo. Questa guida aiuta a orientarsi tra le offerte del 2026 (NVIDIA, AMD, Apple Silicon, Intel Arc), fornisce configurazioni reali per ogni budget e spiega perché una RTX 3090 usata può superare una 4070 nuova.
Stai scegliendo un computer? Le nostre scelte per budget →
Alternativa d'acquisto per questa guida: Mac mini M5 Pro (24 GB / 512 GB).
Perché questa scelta? La nostra scheda completa su Mac mini M5 Pro (24 GB / 512 GB) →
Confronta tutte le opzioni per budget, da 800 a 3 500 € →
Budget ridotto: RTX 5060 · Modelli grandi: RTX 5090 · Mac Studio.
In mobilità: quale portatile per l'IA locale →
Link affiliati — possibile commissione senza costi aggiuntivi per te. In qualità di Partner Amazon, QuelLLM ottiene un guadagno dagli acquisti che soddisfano i requisiti.
#La VRAM, regina assoluta
Un LLM deve stare interamente in VRAM per funzionare a piena velocità. Non appena parte del modello viene trasferita nella RAM di sistema, la velocità si riduce di un fattore 10. La dimensione dei modelli che potrai far girare è quindi determinata dalla VRAM, NON dalla potenza bruta della GPU.
- 8 GB
- Qwen 3.5 9B (6,6 GB). Utilizzo confortevole, contesto lungo limitato dalla memoria. Fascia entry-level.
- 12 GB
- Qwen 3.5 9B in Q8 (11 GB) gira comodamente, un 24B in Q4 ci sta. Il punto ottimale per il rapporto qualità/prezzo.
- 16 GB
- un 24B (Devstral, Mistral Small) utilizzabile comodamente, gpt-oss 20B oppure un 27B in Q4 che entra in memoria. Ottimo compromesso.
- 24 GB
- Qwen 3.8 27B (18 GB), che ci sta comodamente, i MoE 30B-A3B per il codice, un 35B in Q4.
- 48 GB +
- Uso agevole di un 70B in Q4, fine-tuning LoRA possibile, più modelli in parallelo.
#Determinare i propri bisogni
- Chat occasionale, compiti semplici
- Qwen 3.5 9B = ~7 GB di VRAM sono sufficienti. RTX 4060 Ti 16 GB, RTX 3060 12 GB, Arc A770 16 GB.
- Sviluppo (autocompletamento + chat)
- Qwen2.5-Coder 7B base per l'autocompletamento FIM + Devstral 24B per la chat, usati in tandem. 16–20 GB consigliati.
- RAG pro, documenti lunghi
- Contesto 32k+ che consuma 4-6 GB di VRAM in più. Cerca almeno 16 GB.
- Fine-tuning, sperimentazione
- Almeno 24 GB (RTX 3090/4090). Per un vero fine-tuning completo di un modello 7B, punta a 48 GB (A6000, RTX 6000 Ada).
- Servire una squadra di 10 persone
- Una RTX 4090 o A6000, oppure 2× RTX 4090 in parallelismo tensoriale per un 70B.
#NVIDIA — le opzioni 2026
- RTX 3060 da 12 GB (~250 €)
- La scelta economica. CUDA, 12 GB di VRAM, prestazioni discrete per 7B e 13B in Q4. Scheda di fascia bassa consigliata.
- RTX 4060 Ti 16 GB (~450 €)
- Perfetta per i LLM: 16 GB di VRAM, consumi ridotti (160 W). Meno potente di una 3090 in termini di prestazioni pure, ma più efficiente dal punto di vista energetico.
- RTX 4070 Super 12 GB (~600 €)
- Eccellente in termini di potenza di calcolo, ma i 12 GB sono un limite. Una buona scelta se usi il computer anche per giocare.
- RTX 3090 24 GB (~700 € usata)
- ⭐ Il miglior rapporto VRAM/€ sul mercato. Sul mercato da 2 anni, ma i 24 GB fanno miracoli. Consumo elevato (350 W).
- RTX 4090 24 GB (di seconda mano, prezzo variabile)
- La migliore GPU consumer del periodo 2023-2025. Prestazioni + 24 GB. Disponibilità limitata nel 2026, priorità alla RTX 5090.
- RTX 5080 16 GB / 5090 32 GB (≈ da 1 500 a 1 850 € / ≈ 5 700 € a fine settembre 2026)
- Generazione 2025. 5090 = 32 GB di VRAM, il sogno degli utenti LLM.
- RTX A6000 48 GB (pro, ~4500 €)
- 48 GB di VRAM per modelli 70B in Q6 o per il fine-tuning di un 13B. Per professionisti che ammortizzano l'investimento.
#AMD — ROCm recupera terreno
- RX 7600 XT 16 GB (~350 €)
- Fascia entry-level AMD. 16 GB di VRAM al prezzo di una 3060. ROCm ufficiale.
- RX 7800 XT 16 GB (~550 €)
- Prestazioni equivalenti a quelle di una 4070, ROCm stabile, ottimo rapporto prestazioni/prezzo.
- RX 7900 XTX 24 GB (~900 €)
- 24 GB per molto meno di una 3090 usata. Per chi accetta la complessità di ROCm.
- RX 9070 XT 16 GB (≈ 1 070 € a fine settembre 2026)
- Nuova generazione RDNA 4 (2025). Ancora da valutare per quanto riguarda ROCm.
#Apple Silicon — caso particolare
I Mac della serie M non hanno una GPU dedicata ma una memoria unificata: tutta la RAM è accessibile alla GPU. Un Mac da 64 GB può allocare 48 GB a un LLM — abbastanza per far girare un 70B.
- Mac mini M6 16 GB (1 049 €)
- Minimo utilizzabile (il Mac mini M4 non è più venduto nuovo). Un 7B gira bene. Consumo irrisorio (20 W durante l'inferenza).
- Mac mini M5 Pro 24 GB (1 999 €, 48-64 GB in configurazione Apple)
- Ottimo rapporto qualità/prezzo per gli LLM (sostituisce il M4 Pro). Con 48 GB, circa 36 GB sono allocati alla GPU: un 32B Q6 ci sta comodamente.
- MacBook Pro M4 Max 64 GB (~4000 €)
- Portatile + LLM 70B Q4. Equivalente ergonomico di un desktop RTX 4090 + mobilità.
- Mac Studio M5 Ultra 96 GB (a partire da 6 599 €, prezzo Apple a fine settembre 2026)
- Il top. Circa 72 GB utilizzabili dai LLM su 96 GB, di più nelle versioni con maggiore memoria. Può eseguire i più grandi modelli open-weight attuali in Q8, oppure diversi Qwen 3.8 27B in parallelo.
#Intel Arc — outsider alla buona
- Arc A770 16 GB (~300 €)
- 16 GB di VRAM a 300 €. Prestazioni pure inferiori a quelle delle schede NVIDIA/AMD equivalenti, ma rapporto VRAM/€ imbattibile.
- Arc B580 12 GB (≈ 430 € a fine settembre 2026)
- Nuova generazione Battlemage. Prestazioni notevolmente migliorate. Promettente.
#Budget concreti
- 300 € — solo per iniziare
- RTX 3060 12 GB usata, oppure Arc A770 16 GB. Puoi eseguire modelli da 7B a 13B senza problemi.
- 700 € — il punto ottimale
- RTX 3090 da 24 GB usata. Il miglior rapporto VRAM/€. Esegue qualsiasi modello da 32B e i modelli da 70B in Q4.
- 1500 € — comfort professionale
- RTX 5070 Ti 16 GB nuova (≈ da 1 250 a 1 400 €) da aggiungere a un PC che ha già 64 GB di RAM.
- 3000 € — workstation LLM
- PC completo con RTX 5080 16 GB (≈ da 1 500 a 1 850 € per la scheda) OPPURE Mac Studio M5 Max 36 GB (2 999 €). Per caricare un 70B: mini-PC Ryzen AI Max+ 395 128 GB (≈ 3 300 €, fino a 4 000 € a seconda del modello). Una scelta sensata per uno sviluppatore che lo fa tutti i giorni.
- 6 600 € e oltre — la fascia altissima
- Mac Studio M5 Ultra (96 GB e oltre, a partire da 6.599 €) O PC 2× RTX 5090 (≈ 11.400 € per le due schede, fine settembre 2026). Server LLM per un piccolo team.
#Acquistare nuovo o usato?
- Nuovo
- Garanzia, ultima generazione, supporto dei driver a lungo termine. Per un investimento professionale ammortizzabile in 3-5 anni.
- Usato (RTX 3090, 4090)
- Risparmio del 30-40 %. Le schede usate per gli LLM non hanno subito la stessa usura di quelle usate per il mining (la maggior parte ha trascorso poche ore sotto carico).
- Controlli per l'usato
- Burn-in di 24 ore durante l'inferenza, monitoraggio della temperatura (non deve superare gli 80 °C), nessun rifacimento dei pad termici, preferibilmente fattura originale.
- Acquisto professionale
- RTX A6000 o L40 nuove. Garanzia di 3 anni, prezzi professionali, prestazioni identiche a quelle delle schede consumer. Per chi ammortizza l'investimento.
I prezzi cambiano rapidamente: il nostro monitoraggio rileva ogni lunedì e ogni giovedì il prezzo più basso delle schede grafiche per l'IA locale, con il prezzo per GB di VRAM.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.