Principiante 8 minConcetti

LLM 7B, 30B, 70B: cosa significano queste dimensioni ?

Su Hugging Face o Ollama, ogni modello ha un numero: 1B, 7B, 32B, 70B. Questo numero — i miliardi di parametri — determina cosa il modello sa fare, quanta VRAM richiede e la sua velocità. Ma un LLM 7B recente può superare un 70B di due anni fa, e «più grande» non vuol dire «migliore per te». Questa guida spiega cos'è un parametro, cosa offre realmente ogni livello e come trovare il giusto compromesso tra dimensioni, quantizzazione e hardware senza farti ingannare dal marketing.

Di Clara M.·Agg. 2026-09-21·Testato su Windows, macOS e Linux

#Che cos'è concretamente un parametro?

Un parametro è un numero. Niente di più: un valore numerico, spesso codificato su 16 bit, appreso durante l'addestramento. Un modello « 7B » ne contiene 7 miliardi. Questi numeri sono i pesi delle connessioni tra i neuroni artificiali della rete — codificano tutto ciò che il modello « sa »: la grammatica, i fatti, le espressioni, le associazioni di idee.

L'analogia più corretta è quella delle sinapsi. Un parametro è come la forza di una connessione tra due neuroni del cervello. Più connessioni ci sono, più sfumature e schemi sottili la rete può memorizzare. Un modello da 1 miliardo di parametri ha circa 1 miliardo di queste regolazioni; un 70B ne ha settanta volte di più. Ogni parametro è minuscolo e stupido se preso isolatamente; sono il loro numero e la loro disposizione a produrre il linguaggio.

i
Perché la 'B'
La B sta per billion in inglese, cioè un miliardo. 7B = 7 miliardi di parametri. Questa cifra non dice nulla sulla qualità dei dati di addestramento né sull’architettura: indica solo la dimensione complessiva della rete.

Concretamente, questi parametri occupano spazio. A 16 bit (FP16), ogni parametro pesa 2 byte: un modello 7B occupa quindi circa 14 GB a piena precisione. È questa dimensione su disco e in memoria che determina se il modello trova spazio sulla tua macchina — torneremo su questo con la quantizzazione, che comprime questi pesi.

#La scala reale delle capacità, da 1B a 70B

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Le capacità non aumentano in modo lineare con le dimensioni: procedono per salti. Superata una certa soglia di parametri, nuove abilità compaiono all'improvviso — è ciò che si chiama capacità emergenti. Ecco cosa si osserva in pratica nei modelli recenti.

1B – 3B
Completamento del testo, riformulazione semplice, classificazione, estrazione di parole chiave. Utile su dispositivi mobili o in ambiente edge, ma con capacità di ragionamento fragili e allucinazioni frequenti non appena aumenta la complessità.
7B – 8B
Il primo livello davvero utile. Conversazione coerente, riassunto affidabile, codice semplice, corretta adesione alle istruzioni. È il punto di partenza per un uso serio dei LLM locali.
13B – 14B
Prestazioni migliori nei compiti lunghi, meno errori fattuali, codice più solido. Un livello di finezza in più rispetto al 7B, senza far esplodere il consumo di VRAM.
30B – 34B
Ragionamento a più fasi più affidabile, sfumature nelle risposte, buona qualità del codice e della traduzione. Il punto ottimale tra qualità e costo per un uso esigente in locale.
70B
Il meglio dei modelli per il grande pubblico. Ragionamento vicino a quello dei modelli cloud su molti compiti, risposte dettagliate e ricche di sfumature. Richiede una configurazione potente o l'offload.

Da ricordare: ogni raddoppio delle dimensioni porta un miglioramento reale ma decrescente. Il salto da 1B a 7B è spettacolare; quello da 30B a 70B è reale ma molto più sottile e ha senso solo se la tua attività lo richiede.

#Quello che un LLM 7B sa fare e un 1B non sa fare

È la comparazione più convincente, perché la differenza è enorme anche se l'incremento di dimensione sembra modesto. Un modello da 1B ripete schemi; un modello da 7B inizia a ragionare. Il passaggio da uno all'altro attiva competenze concrete che senti immediatamente nell'uso.

Seguire un'istruzione in più parti
Un modello da 1B dimentica spesso la seconda metà della tua richiesta. Un modello da 7B segue un'istruzione del tipo «riassumi questo testo in 3 punti, poi traducili in inglese».
Ragionamento a catena
Un problema logico o matematico a due o tre passaggi resta al di fuori della portata di un 1B; un 7B lo scompone correttamente in buona parte dei casi.
Coerenza su un testo lungo
Il modello 1B perde il filo dopo pochi paragrafi. Il 7B mantiene il contesto, il tono e i nomi propri in una risposta completa.
Codice funzionante
Un modello 7B specializzato scrive funzioni corrette e corregge bug semplici; un modello 1B produce soprattutto codice che 'sembra' codice.
Meno allucinazioni
Senza eliminarle, il 7B inventa nettamente meno e sa più spesso dire che non sa.
→
La soglia dei 7B
Se la tua macchina lo permette, inizia sempre con un 7B/8B piuttosto che con un 3B. Il guadagno in affidabilità è sproporzionato rispetto al consumo aggiuntivo di VRAM (circa 5 GB in Q4).

#Dimensioni e VRAM: la tabella che conta

La domanda pratica non è « qual è il modello migliore » ma « quale modello sta nella memoria della mia scheda ». La VRAM necessaria dipende direttamente dal numero di parametri. Ecco i valori di riferimento con quantizzazione Q4_K_M, il formato consigliato come scelta predefinita, che riduce le dimensioni a circa un quarto rispetto al FP16.

3B ≈ 2 GB
Funziona ovunque, anche su una scheda grafica di fascia bassa o con la sola CPU. Ideale per dispositivi mobili e compiti semplici.
7B ≈ 5 GB
Gira agevolmente su una RTX 3060 da 12 GB o una RTX 4070 da 12 GB. Il miglior rapporto tra capacità e accessibilità.
14B ≈ 9 GB
Rientra in 12 GB di VRAM con un contesto ragionevole, con un buon margine su 16 GB.
32B ≈ 19 GB
Punta a una RTX 4090 da 24 GB oppure a una scheda da 16 GB con un po' di offload nella RAM.
70B ≈ 40 GB
Fuori dalla portata di una sola scheda destinata al grande pubblico: due GPU, offload su RAM/SSD, oppure un Mac Apple Silicon con un'ampia memoria unificata (M4 Pro 48 GB).
!
Non dimenticare il contesto
Queste cifre riguardano solo i pesi del modello. La finestra di contesto (la cache KV) consuma ulteriore VRAM, tanto più quanto è ampia. Prevedi un margine da 1 a qualche GB oltre la dimensione del modello.

#Dimensione vs quantizzazione: il vero compromesso

Con una VRAM limitata, hai due possibilità: scegliere un modello più piccolo oppure un modello più grande ma più compresso. La quantizzazione riduce la precisione dei parametri — da 16 bit a 4 o 8 bit — per far stare il modello in meno memoria, al prezzo di una lieve perdita di qualità.

La regola empirica confermata dall'esperienza: a parità di VRAM, un modello più grande con una quantizzazione più spinta supera quasi sempre un modello più piccolo a piena precisione. Un 13B in Q4 occupa la stessa quantità di memoria di un 7B in Q8 e si rivela generalmente più capace. Il numero di parametri conta più degli ultimi bit di precisione.

Q4_K_M
L'impostazione predefinita consigliata. Perdita di qualità minima, memoria divisa per circa 4. La scelta predefinita per quasi tutti gli usi.
Q5_K_M
Un gradino in più in termini di qualità, al costo di un po' più di VRAM. Un buon compromesso se la memoria lo consente.
Q8_0
Quasi indistinguibile dal FP16. Da riservare ai piccoli modelli o alle schede molto ben dotate.
FP16
Piena precisione, il doppio del peso rispetto a Q8. Utile soprattutto per il fine-tuning, raramente necessario per l'inferenza.
→
Il compromesso in una frase
A parità di memoria, preferisci un modello più grande in Q4 a un modello più piccolo in Q8. Non scendere sotto Q4 se non è necessario: al di sotto, la qualità cala rapidamente.

#Perché un piccolo modello recente supera un grande modello vecchio

È il punto che più confonde i principianti: un LLM 7B del 2026 può superare un 70B del 2023. La dimensione è solo uno dei fattori che determinano la qualità — e non sempre il più decisivo. Altri tre fattori hanno fatto enormi progressi.

Qualità dei dati
I modelli recenti sono addestrati su corpus meglio filtrati, deduplicati e arricchiti di dati sintetici di alta qualità. A parità di dimensioni, imparano molto di più.
Volume di addestramento
I moderni modelli 7B vengono addestrati su decine di migliaia di miliardi di token, molti più dei vecchi modelli di grandi dimensioni. Una rete piccola ma molto addestrata supera una rete grande ma non sufficientemente addestrata.
Architettura e post-training
Architetture migliori, allineamento tramite RLHF, training specifico per il ragionamento: tanti vantaggi che nulla hanno a che fare con il numero di parametri.

La distillazione gioca anche un ruolo chiave: si trasferisce il sapere da un modello molto grande a uno piccolo, che eredita una parte delle sue capacità con dimensioni molto più ridotte. È così che un modello 7B o 8B distillato ragiona come un modello molto più pesante. Conseguenza pratica: guarda sempre la data di uscita e i benchmark recenti, mai solo il numero di parametri.

!
La trappola del marketing
«Più grande = migliore» non è vero in assoluto. La qualità di un modello dipende dai suoi dati, dal suo addestramento e dalla sua architettura tanto quanto dalle sue dimensioni. Diffida dei confronti che mettono a confronto soltanto i miliardi di parametri.

#Come scegliere la dimensione in pratica

La dimensione giusta è quella che rientra nelle capacità del tuo hardware e soddisfa le tue esigenze d'uso. Parti dal modello recente più grande che la tua VRAM può ospitare in Q4, poi adatta la scelta alle reali esigenze di velocità o di finezza delle risposte.

  1. 01
    Misura la tua VRAM
    Identifica la memoria della tua GPU (o la RAM unificata su Mac). È il limite invalicabile che esclude fin da subito i modelli troppo grandi.
  2. 02
    Punta al modello recente più grande che entra in memoria in Q4
    Con 12 GB, un modello 14B recente. Con 24 GB, un modello 32B. Con 8 GB, un buon 7B/8B. Preferisci sempre un modello uscito di recente a uno più vecchio ma più grande.
  3. 03
    Adatta la scelta all'uso
    Chat quotidiana e velocità: resta sui 7B–14B. Ragionamento, codice complesso, traduzione accurata: passa a 30B+ se la memoria lo permette.
  4. 04
    Verifica la velocità
    Se la velocità in token al secondo ti frustra, scendi di un livello. Un 7B veloce spesso supera un 32B lento per un uso interattivo.

#Confrontare due dimensioni in 5 minuti

Il modo migliore per percepire la differenza è far girare due modelli di dimensioni diverse fianco a fianco sulla tua macchina. Se Ollama è installato e in ascolto sulla porta predefinita (http://localhost:11434), bastano due comandi.

Terminale
# Un petit modèle rapide
ollama run llama3.2:3b --verbose

# Le même prompt sur un modèle plus gros
ollama run llama3.1:8b --verbose

Poni la stessa domanda di ragionamento a entrambi (ad esempio un piccolo problema logico in più passaggi) e confronta la qualità delle risposte e il throughput mostrato da --verbose. Vedrai concretamente dove si colloca il compromesso tra capacità e velocità sul tuo hardware.

i
Leggere i token al secondo
Il flag --verbose mostra alla fine della risposta il numero di token al secondo. È la misura oggettiva per scegliere tra due dimensioni sulla tua GPU.

#Per approfondire

Le dimensioni si comprendono meglio collegandole agli altri concetti di base dell'esecuzione in locale. Queste guide approfondiscono direttamente questa guida:

Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
L'altra metà del compromesso sulla memoria: come comprimere un modello senza degradarlo, con una guida visiva.
MoE spiegato: perché un 30B-A3B gira come un modello piccolo
La notazione con due numeri che rompe il legame tra dimensioni e velocità, da leggere subito dopo questa guida.
Distillazione: come i modelli piccoli ereditano dai grandi
Per capire in profondità perché un modello piccolo e recente può superare uno grande e vecchio.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.