VRAM: che cos'è e quanta ne serve per l'IA ?
La VRAM (Video RAM) è la memoria saldata sulla scheda grafica, riservata alla GPU: da 8 a 32 GB sulle schede destinate al grande pubblico a fine settembre 2026, contro un massimo di 512 GB di memoria unificata su un Mac Studio M5 Ultra. Determina direttamente quali modelli di IA locale possono essere caricati: un LLM che supera la capacità della VRAM viene caricato in parte nella RAM e diventa da 5 a 20 volte più lento. La capacità determina cosa entra in memoria, la larghezza di banda determina la velocità.
La VRAM, o memoria video, è la memoria saldata sulla tua scheda grafica, riservata alla GPU. È molto più veloce della RAM del computer ed è quella che determina quali modelli di IA puoi eseguire in locale: un LLM deve rientrarvi interamente per rispondere rapidamente. Al 20 settembre 2026, le schede destinate al grande pubblico hanno da 8 a 32 GB. Questa pagina spiega che cos'è la VRAM, come verificare la tua in trenta secondi e che cosa permette realmente ciascuna fascia di capacità.
#La VRAM in un minuto
VRAM significa Video Random Access Memory. È una memoria ad accesso casuale, come la RAM, ma collocata a pochi millimetri dal chip grafico e collegata a esso tramite un bus molto ampio. Il suo ruolo originario è memorizzare ciò che la GPU gestisce continuamente: le texture, la geometria e le immagini di un gioco. Per l'IA, memorizza i pesi del modello e la sua memoria di lavoro.
Due valori la caratterizzano. La capacità, in gigabyte, indica quanto può contenere. La banda passante, in gigabyte al secondo, indica a quale velocità la GPU può leggerla. Nei videogiochi si guarda soprattutto alla capacità. Nell'IA contano entrambe: la capacità determina se il modello può essere caricato, la banda passante determina a quale velocità il modello scrive.
#RAM e VRAM: le differenze
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
| RAM (memoria di sistema) | VRAM (memoria video) | |
|---|---|---|
| Posizione | Moduli di memoria sulla scheda madre | Chip saldati sulla scheda grafica |
| Al servizio di | Il processore (CPU) | Il processore grafico (GPU) |
| Tecnologia | DDR4, DDR5 | GDDR6, GDDR6X, GDDR7 |
| Larghezza di banda | Da 60 a 100 GB/s con DDR5 a doppio canale | 360 GB/s (RTX 3060) a 1 792 GB/s (RTX 5090) |
| Capacità tipica | Da 16 a 64 GB | Da 8 a 32 GB |
| Espandibile | Sì, si aggiungono moduli di RAM | No, è saldata |
La differenza di larghezza di banda, dell'ordine di dieci-venti volte, spiega tutto il resto di questa pagina. Un modello di IA rilegge tutti i suoi pesi a ogni token che produce. Dalla VRAM, la lettura è veloce. Dalla RAM, lo stesso modello gira da cinque a venti volte più lentamente.
#Conoscere la VRAM
- Windows, senza installare nulla
- Apri Gestione attività (Ctrl + Maiusc + Esc), seleziona la scheda Prestazioni, poi GPU nella colonna a sinistra. La voce « Memoria GPU dedicata » indica la tua VRAM. La « memoria GPU condivisa » visualizzata accanto non è VRAM: è RAM che Windows può mettere a disposizione della GPU, molto più lenta.
- Windows, metodo alternativo
- Tasto Windows + R, digita dxdiag, scheda « Affichage »: la riga « Mémoire d'affichage (VRAM) ».
- Windows e Linux con una scheda NVIDIA
- In un terminale, il comando nvidia-smi mostra la memoria totale e quella occupata in tempo reale. È lo strumento da tenere aperto mentre un modello funziona.
- Linux con una scheda AMD
- Il comando rocm-smi --showmeminfo vram, oppure lo strumento grafico della tua distribuzione.
- Mac
- Menu Apple, Informazioni su questo Mac: la voce Memoria. Un Mac Apple Silicon non ha una VRAM separata; vedere la sezione dedicata più in basso.
#Perché l'IA locale dipende dalla VRAM
Un LLM occupa la VRAM in tre modi. I pesi, innanzitutto: il numero di parametri moltiplicato per la precisione. Con la quantizzazione a 4 bit, considera circa 0,6 GB per miliardo di parametri, cioè 5 GB per un modello da 8B. Poi la cache KV, che conserva la conversazione in corso e cresce con la lunghezza del contesto. Infine un margine di funzionamento, nell'ordine di 1–2 GB.
Se il totale supera la VRAM, strumenti come Ollama o llama.cpp spostano parte del modello nella RAM: si tratta dell'offload CPU+GPU, una funzionalità documentata del progetto llama.cpp per eseguire modelli più grandi della VRAM disponibile. Il modello continua a funzionare, ma la velocità crolla non appena alcuni strati passano dall'altra parte, perché ogni token deve allora attendere una lettura dalla RAM di sistema, da dieci a venti volte più lenta. È per questo che una scheda più vecchia con molta VRAM, come una RTX 3090 da 24 GB, rimane più utile per l'IA locale rispetto a una scheda recente da 12 GB, pur essendo quest'ultima più veloce nei giochi e nel rendering 3D.
- Calcolatore di VRAM: pesi, contesto e margine per il tuo modello
- Scegli la quantizzazione: Q4, Q5, Q8 o FP16
#Quanti GB di VRAM per quale modello
La tabella incrocia il nostro database di 90 schede e chip con i 249 modelli del catalogo. Per ogni fascia, indica un modello rappresentativo che entra interamente nella VRAM in Q4_K_M. Lascia da 1 a 3 GB di margine per il contesto: quando il peso del modello si avvicina alla capacità della scheda, la conversazione deve rimanere breve.
| VRAM | Schede tipiche | Modello rappresentativo che rientra nella memoria disponibile | Pesi in Q4 | Guida dettagliata |
|---|---|---|---|---|
| 6 GB | RTX 2060, GTX 1660, RTX 4050 portatile | Qwen 3 8B, con contesto breve | 5 GB | Quale LLM per 6 GB |
| 8 GB | RTX 3060 Ti, RTX 4060, RTX 5060 | Qwen 3 8B entra con ampio margine, Gemma 4 12B con contesto breve | 5 e 7 GB | Quale LLM per 8 GB |
| 12 GB | RTX 3060 12 GB, RTX 4070, RTX 5070 | Qwen 3 14B | 9 GB | Quale LLM per 12 GB |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5070 Ti, RTX 5080, RX 9070 XT | gpt-oss 20B, Mistral Small 3.2 24B | 13 e 14 GB | Quale LLM per 16 GB |
| 24 GB | RTX 3090, RTX 4090, RX 7900 XTX | Qwen 3.8 27B, Qwen 3.6 35B-A3B | 16 e 21 GB | Quale LLM per 24 GB |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B in Q5 | 25 GB | Quale LLM per 32 GB |
| 48 GB | 2 × RTX 3090 o 4090, Mac 64 GB | Llama 3.3 70B | 40 GB | Vedi il calcolatore |
| 96 GB | Mac 128 GB | gpt-oss 120B | 70 GB | Vedi il calcolatore |
- Quale LLM usare con 8 GB di VRAM?
- Quale LLM per 12 GB di VRAM?
- Quale LLM usare con 16 GB di VRAM?
- Quale LLM per 24 GB di VRAM?
#È possibile aumentare la VRAM?
Su una scheda grafica dedicata, no, indipendentemente dal produttore. I chip di memoria sono saldati e dimensionati insieme alla GPU fin dalla progettazione: l'unico modo per avere più VRAM è cambiare scheda o aggiungerne una seconda, cosa che gli strumenti di IA locale sanno sfruttare distribuendo automaticamente il modello tra le schede. Le impostazioni che promettono di «aumentare la VRAM» in Windows o nel BIOS non creano memoria aggiuntiva: riguardano due casi particolari, descritti di seguito, che non apportano alcun beneficio a una scheda dedicata già pienamente riconosciuta dal sistema.
- GPU integrato (iGPU)
- Non ha VRAM propria e preleva una parte della RAM. Il BIOS permette spesso di aumentare questa parte (regolazione UMA Frame Buffer Size o equivalente). Aumenta la capacità, non la velocità, che rimane quella della RAM.
- Memoria GPU condivisa di Windows
- Windows permette a una scheda dedicata di usare la RAM quando la sua memoria non basta. Per un gioco, questo evita un crash. Per un LLM, è lo scenario lento descritto sopra.
Il vero margine di manovra è nel software: scegliere una quantizzazione più leggera, ridurre la finestra di contesto, quantizzare la cache KV. Questi tre interventi permettono spesso di risparmiare diversi gigabyte senza toccare l'hardware.
- Quantizzare la cache KV: risparmiare VRAM con contesti lunghi
- Sommare la VRAM di due schede con llama.cpp
#I Mac: la memoria unificata
I Mac Apple Silicon non hanno una VRAM separata. Il processore e la GPU condividono un'unica memoria, detta unificata, con un'elevata larghezza di banda. Nella generazione M4: 120 GB/s per il chip di base, fino a 546 GB/s per un M4 Max. La GPU non può utilizzare tutta questa memoria, perché macOS ne riserva una parte; in pratica, considera piuttosto 16 GB utilizzabili da un modello su un Mac da 24 GB, 48 GB su un Mac da 64 GB e 96 GB su un Mac da 128 GB. Questa riserva pesa proporzionalmente di più sulle configurazioni più piccole.
Da allora la gamma è cambiata: Apple ha lanciato il chip M5 alla fine del 2025 (153,6 GB/s, massimo 32 GB di memoria), poi l'M5 Pro (307 GB/s, 64 GB) e l'M5 Max (fino a 614 GB/s, 128 GB). Il Mac Studio è arrivato in seguito con l'M5 Ultra, annunciato il 25 agosto 2026: Apple dichiara «fino a 512 GB» di memoria unificata e «1,2 TB/s» di larghezza di banda, sufficienti in teoria a caricare un modello con diverse centinaia di miliardi di parametri. Lo stesso giorno, Apple ha lanciato l'M6, prodotto con un processo a 2 nm e commercializzato dal 22 settembre 2026: è un chip esclusivamente di fascia base, senza varianti Pro né Max in questa generazione, limitato a 32 GB di memoria e 170 GB/s di larghezza di banda, quindi meno di un M5 Pro uscito un anno prima. Un aspetto da verificare prima di acquistare un Mac «di ultima generazione» per l'IA: il nome del chipset non dice tutto, la variante conta più dell'anno di uscita.
| Chip | Larghezza di banda | Memoria massima |
|---|---|---|
| M4 | 120 GB/s | 32 GB |
| M4 Pro | 273 GB/s | 64 GB |
| M4 Max | Da 410 a 546 GB/s | 128 GB |
| M5 | 153,6 GB/s | 32 GB |
| M5 Pro | 307 GB/s | 64 GB |
| M5 Max | fino a 614 GB/s | 128 GB |
| M5 Ultra | 1,2 TB/s (1 228,8 GB/s) | 512 GB |
| M6 | 170 GB/s | 32 GB |
È questo che rende i Mac di fascia alta particolari per l'IA locale: nessuna scheda grafica consumer offre 96 GB di VRAM utilizzabile, tanto meno le centinaia di gigabyte di un Mac Studio M5 Ultra. In compenso, a parità di capacità, una scheda NVIDIA recente rimane più veloce grazie a una maggiore banda passante per gigabyte: i 1 792 GB/s di una RTX 5090 con 32 GB superano di gran lunga i 614 GB/s di un M5 Max con 128 GB, ma quest'ultimo carica un modello quattro volte più grande.
- Hardware per l'IA locale: le nostre schede sui computer
- Quale GPU per un LLM locale?
- Fonte: comunicato Apple Newsroom, M6 e M5 Ultra (25/08/2026)
- Fonte: scheda tecnica NVIDIA GeForce RTX 5090
- Fonte: repository GitHub llama.cpp (distribuzione multi-GPU)
#FAQ
Qual è la differenza tra RAM e VRAM?+
8 GB di VRAM sono sufficienti nel 2026?+
Perché Windows mostra più memoria GPU di quanta ne abbia la mia scheda?+
La VRAM di due schede grafiche si somma?+
La VRAM conta più della potenza della GPU per l'IA locale?+
Hardware consigliato: RTX 5070 Ti 16 GB — 16 GB di VRAM, sufficienti per caricare un modello 14B quantizzato in Q4 con il suo contesto. Tutto l'hardware per l'IA →
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.