Llama 4 Scout in locale: installazione e primi test con Ollama
Llama 4 Scout è il più piccolo dei tre modelli della famiglia Llama 4 di Meta. È anche l'unico che si può eseguire localmente su una workstation di alto livello — Maverick e Behemoth rimangono riservati al cloud o a un server dedicato. Questa guida mostra come installare Llama 4 Scout con Ollama, cosa serve davvero in termini di VRAM (la promessa MoE è spesso mal compresa), e come sfruttare i suoi due punti distintivi: la multimodalità nativa e il contesto di 10M token.
#Perché installare Llama 4 Scout localmente con Ollama?
Scout è il solo modello della serie Llama 4 progettato per funzionare su una singola macchina. Meta lo ha posizionato come il "workstation model" della famiglia: nativamente multimodale (testo + immagini), con una finestra di contesto dichiarata di 10 milioni di token e un'architettura MoE (Mixture of Experts) che attiva solo una frazione dei parametri per ogni token.
In pratica, rispetto a un modello denso di dimensioni equivalenti, Scout offre una latenza migliore (pochi parametri attivi per token), una memoria di contesto molto più ampia e capacità di visione incluse senza un modello separato. Il prezzo da pagare: un ingombro su disco considerevole (tutti gli esperti devono rimanere caricati in VRAM perché il routing funzioni).
#Scout, Maverick, Behemoth: chi fa cosa
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Scout (17B attivi)
- Il modello per workstation. 16 esperti, ~109B parametri totali. Multimodale. Contesto di 10M token. Target: RTX 4090, M3/M4 Max/Ultra o configurazione multi-GPU da 48 GB+.
- Maverick (17B attivi)
- Il modello per server. 128 esperti, ~400B parametri totali. Stesso numero di parametri attivi di Scout, ma molte più conoscenze codificate. Destinazione: server con 8 H100 o cluster. Fuori portata in locale per la maggior parte delle configurazioni.
- Behemoth (288B attivi)
- Modello di frontiera. ~2T parametri totali. Non eseguibile localmente senza datacenter. Soprattutto utile come modello "maestro" per distillare gli altri due.
#VRAM effettiva: ciò che la scheda tecnica non dice
L'errore classico con i modelli MoE consiste nel ragionare sui parametri attivi. "17B attivi = ci sta in 12 GB in Q4": falso. Per far funzionare il routing, tutti gli esperti devono rimanere in memoria. Scout in Q4_K_M richiede molto di più di quanto i suoi 17B attivi lascerebbero credere.
- Q4_K_M (raccomandato)
- ≈ 65 GB di VRAM per il modello solo. Aggiungere ~4 GB per un contesto ragionevole (32k token). Totale ≈ 70 GB.
- Q5_K_M
- ≈ 78 GB. Miglioramento marginale della qualità nella maggior parte delle attività rispetto al Q4_K_M.
- Q8_0
- ≈ 115 GB. Riservato ai benchmark di riferimento.
- FP16
- ≈ 220 GB. Solo in cloud o su più server.
Le configurazioni che permettono di eseguire Scout agevolmente in locale:
- Mac Studio M3 Ultra / M5 Ultra 96 GB e oltre
- La migliore piattaforma per il grande pubblico per Scout. Memoria unificata, nessun offload, circa 25-40 token al secondo a seconda della quantizzazione.
- 2x RTX 4090 / 2x 5090
- 48 GB o 64 GB complessivi, sufficienti per Q4_K_M con contesto esteso. Contare su llama.cpp o Ollama con la variabile OLLAMA_NUM_GPU.
- Workstation RTX 6000 Ada (48 GB) o A6000
- Scout Q4 entra comodamente in memoria, con margine per il contesto.
#Prerequisiti
- Ollama 0.6 o più recente
- Il supporto per Llama 4 è stato aggiunto a partire da Ollama 0.6. Controlla con ollama --version, aggiorna se necessario.
- 70 GB di spazio disco libero
- Il tag Q4_K_M pesa circa 65 GB. Prevedi un ampio margine per la cache.
- Banda passante della memoria elevata
- Su Mac: puntare a ≥ 400 GB/s (M3 Max e superiori). Su PC: DDR5 se si prevede l'offload sulla CPU.
- Una connessione stabile
- Il download iniziale può durare da 1 a 3 ore a seconda del tuo link. ollama pull supporte la ripresa in caso di interruzione.
#1. Installare Llama 4 Scout con Ollama
Se Ollama non è ancora installato, segui prima la guida adatta al tuo sistema. Poi, il download di Scout avviene con un semplice comando.
Questo tag punta per impostazione predefinita alla quantizzazione Q4_K_M. Se vuoi forzare un'altra variante:
Appena il download è terminato, elenca i modelli per verificare il peso reale:
#2. Primo test: testo e ragionamento
Avvia una sessione interattiva per verificare il corretto funzionamento prima di toccare il resto.
Quando compare il prompt >>>, verifica la lingua e la qualità del ragionamento con un semplice test:
Mentre la conversazione prosegue, apri un secondo terminale per osservare il carico:
La colonna SIZE deve riflettere la dimensione effettiva dei pesi caricati. In PROCESSOR, idealmente dovrebbe comparire 100% GPU. Se vedi un mix CPU/GPU, significa che la VRAM non è sufficiente e che Ollama ricorre all'offload: la velocità ne risentirà pesantemente.
#3. Test di visione in francese
Scout è nativamente multimodale: immagine e testo passano attraverso lo stesso backbone, a differenza di un approccio che collega un encoder visivo separato a un modello puramente testuale. Questo dà risultati migliori nelle attività che combinano le due modalità (OCR contestuale, lettura di schemi, descrizioni dettagliate).
Con l'API REST di Ollama, inviamo l'immagine in formato base64 nel campo images:
In casi tipici (screenshot di un'interfaccia, foto di una lavagna bianca, scansione di un PDF), Scout produce una descrizione dettagliata e rimane coerente in francese anche quando l'immagine contiene testo in inglese. Sui dettagli strutturati è un gradino sopra un piccolo modello di visione generalista come Qwen 3.5 9B.
#4. Contesto di 10M token: promessa e realtà
Meta annuncia una finestra di contesto di 10 milioni di token per Scout. In pratica, nell'uso locale bisogna fare i conti con due limiti.
- Il cache KV esplode
- Con 1M di token, la cache KV aggiunge facilmente 30-50 GB alla VRAM utilizzata dal modello. Oltre questa soglia, occorre attivare la quantizzazione della cache KV (opzione num_ctx + parametri sperimentali) oppure rassegnarsi all’offload della cache sulla CPU.
- La qualità diminuisce ben prima di 10M
- I benchmark indipendenti (RULER, NoLiMa) mostrano un calo delle prestazioni effettive intorno a 256k-512k token, nonostante l'addestramento su contesti lunghi. Oltre questa soglia, è tecnicamente possibile ma poco affidabile.
Per sfruttare un contesto esteso senza far crashare tutto, configura Ollama attraverso un Modelfile :
#Scout vs Qwen3-30B-A3B: il vero confronto
Qwen3-30B-A3B è l'altro MoE preso seriamente in considerazione per l'uso locale nel 2026: 30B totali, 3B attivi, contesto nativo di 256k. Vale la pena confrontarli, perché i due non appartengono alla stessa categoria in termini di hardware.
- Occupazione della VRAM in Q4
- Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. La differenza è enorme e cambia completamente il tipo di macchina necessario.
- Velocità di generazione
- Con un numero comparabile di parametri attivi (17B vs 3B), Qwen3-30B-A3B è più veloce in token/sec — tipicamente 2-3 volte più veloce sulla stessa macchina, quando entrambi i modelli rientrano nella memoria disponibile.
- Qualità del ragionamento
- Nei benchmark pubblici MMLU-Pro e GPQA, Scout resta davanti a Qwen3-30B-A3B. Il divario si riduce molto con la modalità thinking di Qwen3 attivata.
- Multimodalità
- Scout è nativamente multimodale. Qwen3-30B-A3B non lo è — se vuoi funzionalità di visione nello stesso stack, devi usare in parallelo un modello di visione separato come Qwen 3.5 9B.
- Contesto lungo
- Scout punta a 10M (256k utilizzabili stabilmente nella pratica). Qwen3-30B-A3B offre un contesto nativo di 256k, più prevedibile e meno oneroso in termini di cache KV.
#Risoluzione dei problemi
- "Error: model requires more system memory than is available"
- La quantità complessiva di VRAM e RAM a tua disposizione è insufficiente. Passa a una quantizzazione più aggressiva (raramente possibile in Q4, già molto compressa), oppure cambia modello. Ollama non può fare miracoli.
- Velocità < 5 token/sec su GPU da 24 GB
- Sei in offload CPU. Controlla con ollama ps: la colonna PROCESSOR deve mostrare il 100% GPU. Se non è così, Scout non è adatto alla tua macchina.
- Risposte troncate
- Aumenta num_predict (predefinito 128 su alcune configurazioni). Con /set parameter num_predict 2048 nella sessione, o tramite Modelfile.
- Crash oltre 64k token
- La cache KV satura la VRAM. Riduci num_ctx, oppure attiva la quantizzazione KV tramite OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0 nell'ambiente.
- Immagine rifiutata con "unsupported image format"
- Converti in JPEG o PNG standard. I formati WebP, HEIC, AVIF non sono tutti supportati a seconda della versione di Ollama.
#Per approfondire
Una volta che Scout è operativo, vale la pena esplorare diverse strade per sfruttarne le caratteristiche specifiche.
- Scegliere bene la quantizzazione
- Q4_K_M è il punto ottimale per Scout, ma capire quando passare a Q5 o Q8 dipende dal caso d'uso — soprattutto nelle attività multimodali, dove la quantizzazione può degradare la qualità più che con il solo testo.
- Sfruttare la visione in locale
- Il manuale dedicato alla visione copre i pattern di prompt che funzionano davvero (OCR contestuale, estrazione strutturata, confronto di immagini) con Scout e i suoi concorrenti multimodali come Qwen 3.5 9B e Gemma 4 12B.
- Modelfile per personalizzare
- Oltre a num_ctx, un Modelfile permette di fissare un system prompt, un formato di output JSON e una temperatura adatta al tuo caso — utile per non dover riconfigurare tutto a ogni sessione.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.