Intermedio 12 minOllama

Llama 4 Scout in locale: installazione e primi test con Ollama

Llama 4 Scout è il più piccolo dei tre modelli della famiglia Llama 4 di Meta. È anche l'unico che si può eseguire localmente su una workstation di alto livello — Maverick e Behemoth rimangono riservati al cloud o a un server dedicato. Questa guida mostra come installare Llama 4 Scout con Ollama, cosa serve davvero in termini di VRAM (la promessa MoE è spesso mal compresa), e come sfruttare i suoi due punti distintivi: la multimodalità nativa e il contesto di 10M token.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché installare Llama 4 Scout localmente con Ollama?

Scout è il solo modello della serie Llama 4 progettato per funzionare su una singola macchina. Meta lo ha posizionato come il "workstation model" della famiglia: nativamente multimodale (testo + immagini), con una finestra di contesto dichiarata di 10 milioni di token e un'architettura MoE (Mixture of Experts) che attiva solo una frazione dei parametri per ogni token.

In pratica, rispetto a un modello denso di dimensioni equivalenti, Scout offre una latenza migliore (pochi parametri attivi per token), una memoria di contesto molto più ampia e capacità di visione incluse senza un modello separato. Il prezzo da pagare: un ingombro su disco considerevole (tutti gli esperti devono rimanere caricati in VRAM perché il routing funzioni).

i
MoE in due parole
Un modello MoE come Scout contiene N "esperti" (sottoreti specializzate). A ogni token, un router ne sceglie k (tipicamente 1 o 2). Il calcolo viene eseguito solo per questi k esperti. Risultato: la velocità di inferenza è quella di un modello piccolo, ma la qualità tende a quella del modello grande. Tutti i parametri rimangono in VRAM: solo il calcolo è parziale.

#Scout, Maverick, Behemoth: chi fa cosa

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Scout (17B attivi)
Il modello per workstation. 16 esperti, ~109B parametri totali. Multimodale. Contesto di 10M token. Target: RTX 4090, M3/M4 Max/Ultra o configurazione multi-GPU da 48 GB+.
Maverick (17B attivi)
Il modello per server. 128 esperti, ~400B parametri totali. Stesso numero di parametri attivi di Scout, ma molte più conoscenze codificate. Destinazione: server con 8 H100 o cluster. Fuori portata in locale per la maggior parte delle configurazioni.
Behemoth (288B attivi)
Modello di frontiera. ~2T parametri totali. Non eseguibile localmente senza datacenter. Soprattutto utile come modello "maestro" per distillare gli altri due.
→
Quale scegliere?
Se leggi questa guida e installi in locale, la scelta è Scout. Maverick richiede almeno un server multi-GPU di fascia alta — a quel livello, le guide su DeepSeek V4 Flash o Qwen3.7 Max sono più pertinenti.

#VRAM effettiva: ciò che la scheda tecnica non dice

L'errore classico con i modelli MoE consiste nel ragionare sui parametri attivi. "17B attivi = ci sta in 12 GB in Q4": falso. Per far funzionare il routing, tutti gli esperti devono rimanere in memoria. Scout in Q4_K_M richiede molto di più di quanto i suoi 17B attivi lascerebbero credere.

Q4_K_M (raccomandato)
≈ 65 GB di VRAM per il modello solo. Aggiungere ~4 GB per un contesto ragionevole (32k token). Totale ≈ 70 GB.
Q5_K_M
≈ 78 GB. Miglioramento marginale della qualità nella maggior parte delle attività rispetto al Q4_K_M.
Q8_0
≈ 115 GB. Riservato ai benchmark di riferimento.
FP16
≈ 220 GB. Solo in cloud o su più server.
!
Non per una GPU da 24 GB
Se hai una sola RTX 4090 o 3090, Scout non funzionerà correttamente. Puoi forzare l'offload sulla CPU, ma la velocità crolla (< 2 token/sec). Per una GPU da 24 GB, considera piuttosto Qwen3-30B-A3B o Mistral Small 24B. Per una RTX 5090 da 32 GB, Qwen 3.6 35B-A3B resta una scelta più adatta di Scout con offload.

Le configurazioni che permettono di eseguire Scout agevolmente in locale:

Mac Studio M3 Ultra / M5 Ultra 96 GB e oltre
La migliore piattaforma per il grande pubblico per Scout. Memoria unificata, nessun offload, circa 25-40 token al secondo a seconda della quantizzazione.
2x RTX 4090 / 2x 5090
48 GB o 64 GB complessivi, sufficienti per Q4_K_M con contesto esteso. Contare su llama.cpp o Ollama con la variabile OLLAMA_NUM_GPU.
Workstation RTX 6000 Ada (48 GB) o A6000
Scout Q4 entra comodamente in memoria, con margine per il contesto.

#Prerequisiti

Ollama 0.6 o più recente
Il supporto per Llama 4 è stato aggiunto a partire da Ollama 0.6. Controlla con ollama --version, aggiorna se necessario.
70 GB di spazio disco libero
Il tag Q4_K_M pesa circa 65 GB. Prevedi un ampio margine per la cache.
Banda passante della memoria elevata
Su Mac: puntare a ≥ 400 GB/s (M3 Max e superiori). Su PC: DDR5 se si prevede l'offload sulla CPU.
Una connessione stabile
Il download iniziale può durare da 1 a 3 ore a seconda del tuo link. ollama pull supporte la ripresa in caso di interruzione.

#1. Installare Llama 4 Scout con Ollama

Se Ollama non è ancora installato, segui prima la guida adatta al tuo sistema. Poi, il download di Scout avviene con un semplice comando.

Terminale — pull del modello
ollama pull llama4:scout

Questo tag punta per impostazione predefinita alla quantizzazione Q4_K_M. Se vuoi forzare un'altra variante:

Varianti disponibili
ollama pull llama4:scout-q5_K_M
ollama pull llama4:scout-q8_0
ollama pull llama4:scout-fp16

Appena il download è terminato, elenca i modelli per verificare il peso reale:

Verifica
ollama list
i
Pazienza al primo caricamento
Caricare 65 GB in VRAM richiede tempo: tra 30 secondi e 2 minuti a seconda dell'SSD. I caricamenti successivi sono più rapidi grazie alla cache del sistema operativo.

#2. Primo test: testo e ragionamento

Avvia una sessione interattiva per verificare il corretto funzionamento prima di toccare il resto.

Sessione interattiva
ollama run llama4:scout

Quando compare il prompt >>>, verifica la lingua e la qualità del ragionamento con un semplice test:

Prompt di test
>>> Explique en 4 phrases ce qu'est un modèle MoE, puis donne un avantage et un inconvénient.

[Réponse attendue : explication structurée en français, distinction entre paramètres totaux et actifs, mention de la latence comme avantage et de la VRAM comme inconvénient.]

Mentre la conversazione prosegue, apri un secondo terminale per osservare il carico:

Monitorare il carico
ollama ps

La colonna SIZE deve riflettere la dimensione effettiva dei pesi caricati. In PROCESSOR, idealmente dovrebbe comparire 100% GPU. Se vedi un mix CPU/GPU, significa che la VRAM non è sufficiente e che Ollama ricorre all'offload: la velocità ne risentirà pesantemente.

#3. Test di visione in francese

Scout è nativamente multimodale: immagine e testo passano attraverso lo stesso backbone, a differenza di un approccio che collega un encoder visivo separato a un modello puramente testuale. Questo dà risultati migliori nelle attività che combinano le due modalità (OCR contestuale, lettura di schemi, descrizioni dettagliate).

Con l'API REST di Ollama, inviamo l'immagine in formato base64 nel campo images:

Test di visione in Python
import base64, requests, json

with open('facture.jpg', 'rb') as f:
    img_b64 = base64.b64encode(f.read()).decode()

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama4:scout',
        'prompt': 'Décris cette image en français. Si c\'est un document, extrais les montants et la date.',
        'images': [img_b64],
        'stream': False,
    }
)
print(response.json()['response'])

In casi tipici (screenshot di un'interfaccia, foto di una lavagna bianca, scansione di un PDF), Scout produce una descrizione dettagliata e rimane coerente in francese anche quando l'immagine contiene testo in inglese. Sui dettagli strutturati è un gradino sopra un piccolo modello di visione generalista come Qwen 3.5 9B.

→
Formato dell'immagine
JPEG e PNG funzionano. Evita immagini troppo grandi (> 4 MB): Ollama le ridimensiona, ma l'operazione è costosa. Prima dell'invio, ridimensionale in modo che il lato più lungo non superi 1024 px.

#4. Contesto di 10M token: promessa e realtà

Meta annuncia una finestra di contesto di 10 milioni di token per Scout. In pratica, nell'uso locale bisogna fare i conti con due limiti.

Il cache KV esplode
Con 1M di token, la cache KV aggiunge facilmente 30-50 GB alla VRAM utilizzata dal modello. Oltre questa soglia, occorre attivare la quantizzazione della cache KV (opzione num_ctx + parametri sperimentali) oppure rassegnarsi all’offload della cache sulla CPU.
La qualità diminuisce ben prima di 10M
I benchmark indipendenti (RULER, NoLiMa) mostrano un calo delle prestazioni effettive intorno a 256k-512k token, nonostante l'addestramento su contesti lunghi. Oltre questa soglia, è tecnicamente possibile ma poco affidabile.

Per sfruttare un contesto esteso senza far crashare tutto, configura Ollama attraverso un Modelfile :

Modelfile per contesto 128k
FROM llama4:scout

PARAMETER num_ctx 131072
PARAMETER num_predict 4096
PARAMETER temperature 0.6
Creazione della variante
ollama create llama4-scout-128k -f Modelfile
ollama run llama4-scout-128k
!
128k è già molto
Un contesto di 128k token rappresenta già circa 250 pagine di testo. Per il 95% dei casi d'uso locali (intera base di codice, PDF lunghi, archivi di ticket), è ampiamente sufficiente e molto più stabile delle configurazioni da 1M in su.

#Scout vs Qwen3-30B-A3B: il vero confronto

Qwen3-30B-A3B è l'altro MoE preso seriamente in considerazione per l'uso locale nel 2026: 30B totali, 3B attivi, contesto nativo di 256k. Vale la pena confrontarli, perché i due non appartengono alla stessa categoria in termini di hardware.

Occupazione della VRAM in Q4
Scout ≈ 65 GB. Qwen3-30B-A3B ≈ 18 GB. La differenza è enorme e cambia completamente il tipo di macchina necessario.
Velocità di generazione
Con un numero comparabile di parametri attivi (17B vs 3B), Qwen3-30B-A3B è più veloce in token/sec — tipicamente 2-3 volte più veloce sulla stessa macchina, quando entrambi i modelli rientrano nella memoria disponibile.
Qualità del ragionamento
Nei benchmark pubblici MMLU-Pro e GPQA, Scout resta davanti a Qwen3-30B-A3B. Il divario si riduce molto con la modalità thinking di Qwen3 attivata.
Multimodalità
Scout è nativamente multimodale. Qwen3-30B-A3B non lo è — se vuoi funzionalità di visione nello stesso stack, devi usare in parallelo un modello di visione separato come Qwen 3.5 9B.
Contesto lungo
Scout punta a 10M (256k utilizzabili stabilmente nella pratica). Qwen3-30B-A3B offre un contesto nativo di 256k, più prevedibile e meno oneroso in termini di cache KV.
→
Verdetto pratico
Se hai un Mac Studio Ultra, una configurazione con 2 RTX 4090 o una A6000, scegli Scout per la visione nativa e la qualità. Se usi una sola RTX 4090, una 3090 o un Mac M3 Max con 36–64 GB, scegli Qwen3-30B-A3B — è una scelta razionale e nettamente più veloce. Eseguire Scout con offload sulla CPU su questo tipo di macchina è un'idea che sembra buona, ma non lo è.

#Risoluzione dei problemi

"Error: model requires more system memory than is available"
La quantità complessiva di VRAM e RAM a tua disposizione è insufficiente. Passa a una quantizzazione più aggressiva (raramente possibile in Q4, già molto compressa), oppure cambia modello. Ollama non può fare miracoli.
Velocità < 5 token/sec su GPU da 24 GB
Sei in offload CPU. Controlla con ollama ps: la colonna PROCESSOR deve mostrare il 100% GPU. Se non è così, Scout non è adatto alla tua macchina.
Risposte troncate
Aumenta num_predict (predefinito 128 su alcune configurazioni). Con /set parameter num_predict 2048 nella sessione, o tramite Modelfile.
Crash oltre 64k token
La cache KV satura la VRAM. Riduci num_ctx, oppure attiva la quantizzazione KV tramite OLLAMA_FLASH_ATTENTION=1 + OLLAMA_KV_CACHE_TYPE=q8_0 nell'ambiente.
Immagine rifiutata con "unsupported image format"
Converti in JPEG o PNG standard. I formati WebP, HEIC, AVIF non sono tutti supportati a seconda della versione di Ollama.

#Per approfondire

Una volta che Scout è operativo, vale la pena esplorare diverse strade per sfruttarne le caratteristiche specifiche.

Scegliere bene la quantizzazione
Q4_K_M è il punto ottimale per Scout, ma capire quando passare a Q5 o Q8 dipende dal caso d'uso — soprattutto nelle attività multimodali, dove la quantizzazione può degradare la qualità più che con il solo testo.
Sfruttare la visione in locale
Il manuale dedicato alla visione copre i pattern di prompt che funzionano davvero (OCR contestuale, estrazione strutturata, confronto di immagini) con Scout e i suoi concorrenti multimodali come Qwen 3.5 9B e Gemma 4 12B.
Modelfile per personalizzare
Oltre a num_ctx, un Modelfile permette di fissare un system prompt, un formato di output JSON e una temperatura adatta al tuo caso — utile per non dover riconfigurare tutto a ogni sessione.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.