Principiante 11 minConcetti

VRAM: che cos'è e quanta ne serve per l'IA ?

Risposta diretta

La VRAM (Video RAM) è la memoria saldata sulla scheda grafica, riservata alla GPU: da 8 a 32 GB sulle schede destinate al grande pubblico a fine settembre 2026, contro un massimo di 512 GB di memoria unificata su un Mac Studio M5 Ultra. Determina direttamente quali modelli di IA locale possono essere caricati: un LLM che supera la capacità della VRAM viene caricato in parte nella RAM e diventa da 5 a 20 volte più lento. La capacità determina cosa entra in memoria, la larghezza di banda determina la velocità.

La VRAM, o memoria video, è la memoria saldata sulla tua scheda grafica, riservata alla GPU. È molto più veloce della RAM del computer ed è quella che determina quali modelli di IA puoi eseguire in locale: un LLM deve rientrarvi interamente per rispondere rapidamente. Al 20 settembre 2026, le schede destinate al grande pubblico hanno da 8 a 32 GB. Questa pagina spiega che cos'è la VRAM, come verificare la tua in trenta secondi e che cosa permette realmente ciascuna fascia di capacità.

Di Mohamed Meguedmi·Agg. 2026-09-28·Testato su Windows, macOS e Linux

#La VRAM in un minuto

VRAM significa Video Random Access Memory. È una memoria ad accesso casuale, come la RAM, ma collocata a pochi millimetri dal chip grafico e collegata a esso tramite un bus molto ampio. Il suo ruolo originario è memorizzare ciò che la GPU gestisce continuamente: le texture, la geometria e le immagini di un gioco. Per l'IA, memorizza i pesi del modello e la sua memoria di lavoro.

Due valori la caratterizzano. La capacità, in gigabyte, indica quanto può contenere. La banda passante, in gigabyte al secondo, indica a quale velocità la GPU può leggerla. Nei videogiochi si guarda soprattutto alla capacità. Nell'IA contano entrambe: la capacità determina se il modello può essere caricato, la banda passante determina a quale velocità il modello scrive.

#RAM e VRAM: le differenze

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Larghezze di banda: specifiche dei produttori
RAM (memoria di sistema)VRAM (memoria video)
PosizioneModuli di memoria sulla scheda madreChip saldati sulla scheda grafica
Al servizio diIl processore (CPU)Il processore grafico (GPU)
TecnologiaDDR4, DDR5GDDR6, GDDR6X, GDDR7
Larghezza di bandaDa 60 a 100 GB/s con DDR5 a doppio canale360 GB/s (RTX 3060) a 1 792 GB/s (RTX 5090)
Capacità tipicaDa 16 a 64 GBDa 8 a 32 GB
EspandibileSì, si aggiungono moduli di RAMNo, è saldata

La differenza di larghezza di banda, dell'ordine di dieci-venti volte, spiega tutto il resto di questa pagina. Un modello di IA rilegge tutti i suoi pesi a ogni token che produce. Dalla VRAM, la lettura è veloce. Dalla RAM, lo stesso modello gira da cinque a venti volte più lentamente.

#Conoscere la VRAM

Windows, senza installare nulla
Apri Gestione attività (Ctrl + Maiusc + Esc), seleziona la scheda Prestazioni, poi GPU nella colonna a sinistra. La voce « Memoria GPU dedicata » indica la tua VRAM. La « memoria GPU condivisa » visualizzata accanto non è VRAM: è RAM che Windows può mettere a disposizione della GPU, molto più lenta.
Windows, metodo alternativo
Tasto Windows + R, digita dxdiag, scheda « Affichage »: la riga « Mémoire d'affichage (VRAM) ».
Windows e Linux con una scheda NVIDIA
In un terminale, il comando nvidia-smi mostra la memoria totale e quella occupata in tempo reale. È lo strumento da tenere aperto mentre un modello funziona.
Linux con una scheda AMD
Il comando rocm-smi --showmeminfo vram, oppure lo strumento grafico della tua distribuzione.
Mac
Menu Apple, Informazioni su questo Mac: la voce Memoria. Un Mac Apple Silicon non ha una VRAM separata; vedere la sezione dedicata più in basso.
Monitorare la VRAM mentre un modello è in esecuzione (NVIDIA)
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv -l 2

#Perché l'IA locale dipende dalla VRAM

Un LLM occupa la VRAM in tre modi. I pesi, innanzitutto: il numero di parametri moltiplicato per la precisione. Con la quantizzazione a 4 bit, considera circa 0,6 GB per miliardo di parametri, cioè 5 GB per un modello da 8B. Poi la cache KV, che conserva la conversazione in corso e cresce con la lunghezza del contesto. Infine un margine di funzionamento, nell'ordine di 1–2 GB.

Se il totale supera la VRAM, strumenti come Ollama o llama.cpp spostano parte del modello nella RAM: si tratta dell'offload CPU+GPU, una funzionalità documentata del progetto llama.cpp per eseguire modelli più grandi della VRAM disponibile. Il modello continua a funzionare, ma la velocità crolla non appena alcuni strati passano dall'altra parte, perché ogni token deve allora attendere una lettura dalla RAM di sistema, da dieci a venti volte più lenta. È per questo che una scheda più vecchia con molta VRAM, come una RTX 3090 da 24 GB, rimane più utile per l'IA locale rispetto a una scheda recente da 12 GB, pur essendo quest'ultima più veloce nei giochi e nel rendering 3D.

#Quanti GB di VRAM per quale modello

La tabella incrocia il nostro database di 90 schede e chip con i 249 modelli del catalogo. Per ogni fascia, indica un modello rappresentativo che entra interamente nella VRAM in Q4_K_M. Lascia da 1 a 3 GB di margine per il contesto: quando il peso del modello si avvicina alla capacità della scheda, la conversazione deve rimanere breve.

Calcolato a partire dal catalogo e dal database hardware di QuelLLM · pesi in Q4_K_M · 20/09/2026
VRAMSchede tipicheModello rappresentativo che rientra nella memoria disponibilePesi in Q4Guida dettagliata
6 GBRTX 2060, GTX 1660, RTX 4050 portatileQwen 3 8B, con contesto breve5 GBQuale LLM per 6 GB
8 GBRTX 3060 Ti, RTX 4060, RTX 5060Qwen 3 8B entra con ampio margine, Gemma 4 12B con contesto breve5 e 7 GBQuale LLM per 8 GB
12 GBRTX 3060 12 GB, RTX 4070, RTX 5070Qwen 3 14B9 GBQuale LLM per 12 GB
16 GBRTX 4060 Ti 16 GB, RTX 5070 Ti, RTX 5080, RX 9070 XTgpt-oss 20B, Mistral Small 3.2 24B13 e 14 GBQuale LLM per 16 GB
24 GBRTX 3090, RTX 4090, RX 7900 XTXQwen 3.8 27B, Qwen 3.6 35B-A3B16 e 21 GBQuale LLM per 24 GB
32 GBRTX 5090Qwen 3.6 35B-A3B in Q525 GBQuale LLM per 32 GB
48 GB2 × RTX 3090 o 4090, Mac 64 GBLlama 3.3 70B40 GBVedi il calcolatore
96 GBMac 128 GBgpt-oss 120B70 GBVedi il calcolatore
→
Cosa fare prima di acquistare
A parità di budget, per l'IA locale, dai priorità alla capacità della VRAM rispetto alla generazione della scheda. Passare da 12 a 16 GB apre la classe dei modelli da 20 a 24 miliardi di parametri; passare da 16 a 24 GB apre quella dei modelli da 27 a 35 miliardi. Nessun aumento di velocità compensa un modello che non si carica.

#È possibile aumentare la VRAM?

Su una scheda grafica dedicata, no, indipendentemente dal produttore. I chip di memoria sono saldati e dimensionati insieme alla GPU fin dalla progettazione: l'unico modo per avere più VRAM è cambiare scheda o aggiungerne una seconda, cosa che gli strumenti di IA locale sanno sfruttare distribuendo automaticamente il modello tra le schede. Le impostazioni che promettono di «aumentare la VRAM» in Windows o nel BIOS non creano memoria aggiuntiva: riguardano due casi particolari, descritti di seguito, che non apportano alcun beneficio a una scheda dedicata già pienamente riconosciuta dal sistema.

GPU integrato (iGPU)
Non ha VRAM propria e preleva una parte della RAM. Il BIOS permette spesso di aumentare questa parte (regolazione UMA Frame Buffer Size o equivalente). Aumenta la capacità, non la velocità, che rimane quella della RAM.
Memoria GPU condivisa di Windows
Windows permette a una scheda dedicata di usare la RAM quando la sua memoria non basta. Per un gioco, questo evita un crash. Per un LLM, è lo scenario lento descritto sopra.

Il vero margine di manovra è nel software: scegliere una quantizzazione più leggera, ridurre la finestra di contesto, quantizzare la cache KV. Questi tre interventi permettono spesso di risparmiare diversi gigabyte senza toccare l'hardware.

#I Mac: la memoria unificata

I Mac Apple Silicon non hanno una VRAM separata. Il processore e la GPU condividono un'unica memoria, detta unificata, con un'elevata larghezza di banda. Nella generazione M4: 120 GB/s per il chip di base, fino a 546 GB/s per un M4 Max. La GPU non può utilizzare tutta questa memoria, perché macOS ne riserva una parte; in pratica, considera piuttosto 16 GB utilizzabili da un modello su un Mac da 24 GB, 48 GB su un Mac da 64 GB e 96 GB su un Mac da 128 GB. Questa riserva pesa proporzionalmente di più sulle configurazioni più piccole.

Da allora la gamma è cambiata: Apple ha lanciato il chip M5 alla fine del 2025 (153,6 GB/s, massimo 32 GB di memoria), poi l'M5 Pro (307 GB/s, 64 GB) e l'M5 Max (fino a 614 GB/s, 128 GB). Il Mac Studio è arrivato in seguito con l'M5 Ultra, annunciato il 25 agosto 2026: Apple dichiara «fino a 512 GB» di memoria unificata e «1,2 TB/s» di larghezza di banda, sufficienti in teoria a caricare un modello con diverse centinaia di miliardi di parametri. Lo stesso giorno, Apple ha lanciato l'M6, prodotto con un processo a 2 nm e commercializzato dal 22 settembre 2026: è un chip esclusivamente di fascia base, senza varianti Pro né Max in questa generazione, limitato a 32 GB di memoria e 170 GB/s di larghezza di banda, quindi meno di un M5 Pro uscito un anno prima. Un aspetto da verificare prima di acquistare un Mac «di ultima generazione» per l'IA: il nome del chipset non dice tutto, la variante conta più dell'anno di uscita.

Chip Apple Silicon: memoria unificata e larghezza di banda (confronto da M4 a M6)
ChipLarghezza di bandaMemoria massima
M4120 GB/s32 GB
M4 Pro273 GB/s64 GB
M4 MaxDa 410 a 546 GB/s128 GB
M5153,6 GB/s32 GB
M5 Pro307 GB/s64 GB
M5 Maxfino a 614 GB/s128 GB
M5 Ultra1,2 TB/s (1 228,8 GB/s)512 GB
M6170 GB/s32 GB

È questo che rende i Mac di fascia alta particolari per l'IA locale: nessuna scheda grafica consumer offre 96 GB di VRAM utilizzabile, tanto meno le centinaia di gigabyte di un Mac Studio M5 Ultra. In compenso, a parità di capacità, una scheda NVIDIA recente rimane più veloce grazie a una maggiore banda passante per gigabyte: i 1 792 GB/s di una RTX 5090 con 32 GB superano di gran lunga i 614 GB/s di un M5 Max con 128 GB, ma quest'ultimo carica un modello quattro volte più grande.

#FAQ

Qual è la differenza tra RAM e VRAM?+
La RAM serve al processore e si trova sulla scheda madre; la VRAM serve alla GPU ed è saldata sulla scheda grafica. La VRAM ha una larghezza di banda da dieci a venti volte maggiore, ma è disponibile in quantità minore e non è espandibile. Un modello di IA che entra interamente nella VRAM risponde molto più velocemente rispetto a quando deve essere caricato in parte nella RAM.
8 GB di VRAM sono sufficienti nel 2026?+
Per giocare a 1080p, sì nella maggior parte dei casi. Per l'IA locale, 8 GB consentono di eseguire modelli fino a 12 miliardi di parametri in Q4, come Gemma 4 12B, a patto di mantenere un contesto breve; un modello 8B ha più margine. È un buon punto di partenza, ma diventa presto limitante se punti a modelli da 20 miliardi di parametri in su.
Perché Windows mostra più memoria GPU di quanta ne abbia la mia scheda?+
Gestione attività somma due valori diversi: la memoria dedicata, la tua vera VRAM saldata sulla scheda, e la memoria condivisa, una parte della RAM di sistema che Windows consente alla GPU di prendere in prestito in caso di necessità. Solo la memoria dedicata conta per valutare quanto un modello di IA può caricare mantenendo la piena velocità: non appena un LLM occupa anche la memoria condivisa, la generazione rallenta fortemente, esattamente come se fosse eseguito sulla CPU.
La VRAM di due schede grafiche si somma?+
Per l'IA, sì: i motori di inferenza come llama.cpp, Ollama o vLLM sanno distribuire gli strati di un modello su più GPU, così che due schede da 24 GB permettono di caricare, in pratica, un modello che occupa fino a 40-45 GB. Per il gioco, invece, la risposta è no: ogni scheda continua a lavorare con la propria memoria, senza possibilità di sommare la memoria delle due schede.
La VRAM conta più della potenza della GPU per l'IA locale?+
Per eseguire un modello, sì: la capacità determina ciò che può essere caricato in memoria, e la larghezza di banda della memoria determina poi la velocità di generazione token per token, molto più della potenza di calcolo grezza della GPU. Quest'ultima incide soprattutto sull'elaborazione del prompt iniziale e sulla generazione di immagini, due attività che richiedono molto più calcolo puro che letture ripetute della memoria.

Hardware consigliato: RTX 5070 Ti 16 GB — 16 GB di VRAM, sufficienti per caricare un modello 14B quantizzato in Q4 con il suo contesto. Tutto l'hardware per l'IA →

Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.