Intermedio 14 minOllama

Qwen 3.8 27B in locale: installazione Ollama e VRAM

I pesi di Qwen3.8-27B sono stati pubblicati il 14 agosto 2026 su Hugging Face, sotto licenza Apache 2.0, e il tag ufficiale Ollama è arrivato lo stesso giorno. È il primo modello della generazione 3.8 realmente installabile sulla tua macchina: denso, multimodale (immagini e video), 262.144 token di contesto nativo. Questa guida fornisce il comando esatto, la VRAM effettivamente necessaria tag per tag, le impostazioni della modalità «thinking» attivata per impostazione predefinita e le due insidie che rovinano la maggior parte dei primi tentativi — il contesto troncato senza avviso e il trasferimento di parte del modello nella RAM di sistema.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Il verdetto in 30 secondi

Qwen 3.8 27B si installa con un semplice comando: «ollama run qwen3.8:27b». Il pacchetto predefinito (Q4_K_M) pesa 18 GB e richiede una scheda con 24 GB di VRAM — RTX 3090, 4090, 5090 — oppure un Mac Apple Silicon con almeno 32 GB di memoria unificata per lavorare comodamente. Al di sotto, il modello funziona comunque, ma una parte degli strati viene spostata sul processore e il throughput crolla.

Cos'è
Un modello denso con 27 miliardi di parametri, capacità native di visione e linguaggio (immagini e video), 262.144 token di contesto, con licenza Apache 2.0 — quindi utilizzabile commercialmente senza clausole restrittive.
Il prerequisito realistico
24 GB di VRAM o 32 GB di memoria unificata per la versione Q4_K_M. 30 GB di file e circa 40 GB di VRAM per la Q8, 56 GB per la BF16.
Il comando
ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
Trappola n.1
Il contesto annunciato è di 256k, ma Ollama applica per default una finestra molto più piccola e tronca senza avvisare. È necessario regolare manualmente num_ctx.
Il tranello n.2
La modalità « thinking » è attiva per impostazione predefinita e consuma molti token prima di rispondere. In locale, riduci reasoning_effort o disattiva questa modalità per i compiti semplici.
!
I dati di performance provengono da Alibaba
Alla data di pubblicazione di questa guida, nessun benchmark indipendente è stato riprodotto su Qwen3.8-27B. Tutti i punteggi citati di seguito provengono dalla scheda ufficiale del modello. Sono coerenti con la generazione precedente, ma vanno considerati dati dichiarati dal produttore.

#Che cos'è davvero Qwen 3.8 27B

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

In controtendenza rispetto alla moda dei Mixture-of-Experts, Qwen3.8-27B è un modello denso: tutti i 27 miliardi di parametri vengono attivati a ogni token. È questo che rende prevedibile il suo utilizzo della memoria — nessuna sorpresa positiva nella velocità di generazione, nessuna sorpresa negativa sulla VRAM — ed è anche ciò che spiega una velocità di generazione in locale più modesta rispetto a un MoE di dimensioni comparabili.

Architettura
64 livelli organizzati in 16 blocchi di « 3 × (Gated DeltaNet → FFN) poi 1 × (Gated Attention → FFN) ». Un'attenzione ibrida: la maggior parte dei livelli utilizza un'attenzione lineare, che richiede poca memoria, intervallata da veri e propri livelli di attenzione per la precisione.
Modalità
Integrazione nativa di visione e linguaggio: immagini fisse, documenti, diagrammi scientifici e video. Non è un adattatore aggiunto successivamente.
Contesto
262.144 token nativi, estendibili a 1.000.000 tramite YaRN — ma solo su vLLM, SGLang o TokenSpeed, non tramite Ollama.
Licenza
Apache 2.0. Uso commerciale autorizzato, nessuna soglia di utenti come per Llama, nessuna clausola d'uso come per Gemma.
Particolarità
Il modello è addestrato con Multi-Token Prediction (MTP) — da qui i tag Ollama « mtp », che accelerano la generazione sui motori che sanno sfruttarla.
i
Non confondere con Qwen 3.8-Max
Qwen 3.8-Max, rilasciato il 3 agosto 2026, è un MoE di circa 2 400 miliardi di parametri, disponibile solo tramite API: non esiste alcun modo per eseguirlo sul tuo computer. Il 27B è la variante open-weight della stessa generazione. La cronologia completa è ricostruita nella nostra guida sugli open weights Qwen 3.8.

#L'hardware necessario, tag per tag

La libreria Ollama pubblica dodici varianti. La dimensione del download non corrisponde alla VRAM necessaria: bisogna aggiungere la cache KV, che cresce con la lunghezza del contesto, e l'encoder visivo. Prevedi un margine dal 15 al 25% rispetto alla dimensione del file.

Varianti ufficiali di Qwen 3.8 27B su Ollama (rilevazione del 18 agosto 2026)
TagDimensioneMemoria per un utilizzo agevolePer chi
qwen3.8:27b (Q4_K_M, predefinito)18 GB24 GBScelta predefinita: RTX 3090/4090/5090, Mac 32 GB
qwen3.8:27b-q8_030 GB40 GB e oltreQualità quasi massima: RTX Pro 6000, bi-GPU 24 GB
qwen3.8:27b-bf1656 GB80 GBPesi di riferimento, macchine per il calcolo (H100, H200)
qwen3.8:27b-mlx18 GB32 GB unificatiApple Silicon: build Metal, la scelta predefinita giusta su Mac
qwen3.8:27b-mxfp832 GB48 GB unificatiMac Studio / M4 Max 64 GB, qualità superiore
qwen3.8:27b-mlx-bf1656 GB96 GB unificatiMac Studio 128 GB, nessuna perdita dovuta alla quantizzazione
qwen3.8:27b-mtp-q4_K_M18 GB24 GBIdentico all'impostazione predefinita, con predizione multi-token esplicita
!
16 GB di VRAM: possibile, ma non comodo
Su una RTX 4060 Ti da 16 GB o una 5070 Ti, la versione Q4_K_M non entra interamente in memoria: Ollama fa elaborare la parte restante alla CPU e la velocità di generazione scende spesso sotto i 5 token al secondo. Con 16 GB, un modello da 12 a 14 miliardi di parametri resta un modo molto migliore di sfruttare la macchina.

Quanto alla velocità di generazione, le nostre stime per un modello denso da 27B in Q4 si aggirano intorno a 14 token al secondo su una configurazione di fascia media e a 22 token al secondo su una configurazione recente di fascia alta. Sono ordini di grandezza calcolati, non misurazioni: la modalità «thinking», attivata per impostazione predefinita, può inoltre raddoppiare il tempo percepito prima della prima riga di risposta.

#Installare Qwen 3.8 27B con Ollama

  1. 01
    Aggiorna Ollama
    Gli strati ibridi e il parser per la visione di Qwen 3.8 richiedono una versione recente di Ollama. Una versione precedente ad agosto 2026 restituirà un errore di architettura o un messaggio « model not found » fuorviante. Reinstalla dal sito ufficiale oppure esegui di nuovo lo script di installazione su Linux.
  2. 02
    Scarica il modello
    Vengono trasferiti 18 GB: prevedi spazio sul disco di sistema, dove Ollama conserva i suoi blob. Il pull può essere ripreso se la connessione si interrompe.
  3. 03
    Avvia un primo scambio
    La prima risposta è più lenta, perché occorre attendere che i pesi vengano caricati in memoria. Se impiega più di un minuto ad avviarsi, è segno che parte dell'elaborazione viene trasferita al processore.
  4. 04
    Verifica dove gira il modello
    Il comando ollama ps mostra la ripartizione GPU/CPU. Finché non vedi «100 % GPU», ogni token costa caro: scendi di un livello di quantizzazione o riduci il contesto.
Installazione e primo test
# 1. Récupérer le modèle (18 Go)
ollama pull qwen3.8:27b

# 2. Discuter avec
ollama run qwen3.8:27b

# 3. Vérifier la répartition GPU / CPU
ollama ps
i
qwen3.8 senza tag = il 27B
Il tag «qwen3.8:latest» punta oggi allo stesso blob di «qwen3.8:27b»: è l'unico formato pubblicato nella libreria ufficiale. Scrivere «ollama run qwen3.8» equivale esattamente alla stessa cosa, ma fissare la dimensione nei tuoi script evita brutte sorprese quando arriveranno altre varianti.

#Su Mac Apple Silicon: scegli la versione MLX

Ollama pubblica una build MLX, compilata per il motore Metal di Apple. A parità di dimensioni del file (18 GB), sfrutta meglio la memoria unificata e offre un throughput sensibilmente superiore rispetto al GGUF generico sui chip M3, M4 e successivi.

Su Mac Apple Silicon
# Build MLX (Metal) — recommandé sur M1/M2/M3/M4
ollama run qwen3.8:27b-mlx

# Mac 64 Go et plus : qualité supérieure
ollama run qwen3.8:27b-mxfp8
Mac 16 GB
Insufficiente. macOS rende disponibile alla GPU solo circa il 70% della memoria unificata: il modello finisce nello swap e diventa inutilizzabile.
Mac 24 GB
Ci sta appena, con un contesto breve e senza altre applicazioni pesanti aperte. Accettabile per fare una prova, frustrante nell'uso quotidiano.
Mac 32 GB
Il vero punto di partenza: il modello entra in memoria e rimane margine per la cache KV e il sistema.
Mac con 64 GB e oltre
Confortevole, e permette di passare a mxfp8 o di lavorare su documenti lunghi.

#Il tranello del contesto 256k

È l'errore che fanno quasi tutti gli utenti alle prime armi. Il modello dichiara 262.144 token, ma Ollama applica per impostazione predefinita una finestra molto più corta: oltre questo limite, l'inizio del tuo documento viene semplicemente tagliato, senza alcun messaggio di errore. Il modello risponde con sicurezza su un testo che non ha visto per intero.

Regolare la finestra di contesto
# Dans une session interactive
/set parameter num_ctx 32768

# Ou via un Modelfile réutilisable
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
PARAMETER top_p 0.95
PARAMETER top_k 20
EOF
ollama create qwen38-long -f Modelfile
!
256k sulla carta, da 16k a 64k sulla tua macchina
La cache KV cresce in modo approssimativamente lineare con il contesto e si aggiunge ai 18 GB di pesi. Su una scheda da 24 GB, una finestra di 32.000 token è un'impostazione ragionevole; una da 64.000 rientra nella memoria disponibile a costo di un po' di lentezza; una da 262.144 è fuori portata. Attivare Flash Attention e quantizzare la cache KV in q8_0 (variabili OLLAMA_FLASH_ATTENTION e OLLAMA_KV_CACHE_TYPE) permette di recuperare diversi gigabyte.

Quanto al milione di token annunciato: si basa su un'estensione YaRN, configurata nel file di configurazione del modello, ed è supportato solo da vLLM, SGLang o TokenSpeed. Attualmente non esiste alcun modo per accedervi da Ollama.

#Modalità Thinking e parametri di sampling

Qwen 3.8 riflette prima di rispondere: genera un blocco di ragionamento tra i tag « think », poi la risposta finale. Questa modalità è attivata per impostazione predefinita ed è ciò che spiega la maggior parte della latenza percepita. Nei motori che la supportano, la profondità si regola con reasoning_effort — xhigh per impostazione predefinita, poi medium e low.

Parametri di sampling raccomandati da Alibaba
Modalitàtemperaturetop_ptop_kpresence_penalty
Thinking (predefinito)1.00.95200.0
Instruct (senza riflessione)0.70.80201.5
Compiti brevi in locale
Riduci reasoning_effort a low o medium: per una riformulazione o un'estrazione, un ragionamento prolungato non cambia la qualità e triplica il tempo di attesa.
Compiti agentici
Mantieni xhigh. Alibaba osserva che un impegno ridotto causa analisi insufficienti, quindi ripetizioni — il guadagno per turno viene annullato dai fallimenti.
Risposte che si ripetono in loop
Aumenta presence_penalty (tra 0 e 2). Al di sopra di 1,5, il modello inizia a mescolare le lingue.
Uscita contaminata dal ragionamento
Se la tua applicazione mostra i tag di ragionamento, significa che non separa reasoning_content dal contenuto finale. Disattiva il ragionamento per questo caso d'uso anziché filtrare il testo a posteriori.

#Analizzare un'immagine o un documento

La vision è native: schermata, foto di tavolo, schema tecnico, pagina scansa. Da riga di comando basta indicare il percorso del file nel prompt; tramite API le immagini vengono codificate in base64 nel campo previsto da Ollama.

Visione dalla riga di comando
ollama run qwen3.8:27b
>>> Décris ce schéma et liste les valeurs lisibles ./schema.png
!
Prova la visione prima di metterla in produzione
Il percorso multimodale ha ricevuto una correzione del parser poco dopo il rilascio. Se le risposte ignorano l'immagine o descrivono qualcos'altro, aggiorna Ollama prima di indagare ulteriormente e verifica il funzionamento su una decina di tuoi documenti prima di passare all'uso su scala industriale.

#Cosa valgono i punteggi annunciati

Il salto dichiarato rispetto a Qwen 3.6-27B, il modello delle stesse dimensioni della generazione precedente, è significativo — soprattutto nella programmazione agentica e nell'uso del computer. Ecco i dati pubblicati da Alibaba, tenendo presente che non sono stati riprodotti in modo indipendente.

Qwen3.8-27B vs Qwen3.6-27B — punteggi comunicati da Alibaba (agosto 2026)
ProvaQwen3.8-27BQwen3.6-27B
Terminal Bench 2.1 (programmazione agentica)73,063,4
SWE-bench Pro61,753,5
LiveCodeBench v690,383,9
IFBench (capacità di seguire le istruzioni)79,569,1
GPQA Diamond (scienze)89,287,8
OSWorld-Verified (uso di computer)84,363,9
MathVision (matematica visiva)90,085,1
OmniDocBench 1.5 (documenti)91,189,4

Ciò che bisogna tenere a mente per un uso locale: i progressi riguardano soprattutto le attività lunghe che richiedono l'uso di strumenti — gestire un terminale, correggere un repository, eseguire una sequenza di passaggi senza perdere la rotta. In una semplice conversazione o in un riassunto, la differenza rispetto alla generazione precedente sarà molto meno evidente di quanto questi numeri lascino credere.

#È necessario abbandonare Qwen 3.6, Gemma 4 o gpt-oss?

Usi Qwen 3.6-27B
Sì, vale la pena aggiornare: stesso consumo di memoria, stessa licenza permissiva, miglioramenti netti nel codice e nelle capacità agentiche. Mantieni il vecchio tag finché non hai validato i tuoi prompt: lo stile delle risposte cambia.
Usi Gemma 4 26B
Qwen 3.8 mantiene il vantaggio nella programmazione e nelle funzionalità agentiche; quanto alla licenza, entrambi sono ora distribuiti con licenza Apache 2.0, dopo il passaggio di Gemma a una licenza permissiva nell'aprile 2026. Gemma 4 (MoE 26B-A4B, multimodale) rimane spesso più naturale nel francese conversazionale e più rapido da avviare.
Usi gpt-oss-20b
Due filosofie: gpt-oss è più leggero e più veloce, Qwen 3.8 vede le immagini, gestisce un contesto molto più lungo ed è pensato per compiti lunghi. Scegli in base alla VRAM disponibile.
Cerchi soprattutto di scrivere codice
Un modello MoE da 30B specializzato nel codice rimane più veloce nell'autocompletamento. Qwen 3.8 27B ha senso quando l'agente deve leggere, pianificare e modificare diversi file.
Hai meno di 24 GB
Non forzare. Un modello 12-14B in Q4 ti darà un'esperienza migliore rispetto a un 27B che viene eseguito in parte sulla CPU.

#Risoluzione dei problemi

« model not found » durante il pull
Ollama è troppo vecchio per riconoscere questo repository, oppure il tag è scritto male — il tag corretto è « qwen3.8:27b », con un punto, non un trattino. Aggiorna Ollama, poi riprova.
Errore di architettura durante il caricamento
Stessa causa: i layer ibridi di Qwen 3.8 sono supportati solo dalle versioni recenti del motore.
Generazione molto lenta (meno di 5 token/s)
Il modello viene caricato in parte nella RAM di sistema. Controlla con ollama ps: se la ripartizione non è al 100% GPU, riduci num_ctx, chiudi le altre applicazioni che usano la GPU oppure passa a un modello più piccolo.
Risposte che ignorano l'inizio del documento
Contesto troncato senza avviso. Imposta num_ctx in base alla lunghezza effettiva del tuo input, oppure suddividi il documento.
Il modello « pensa » senza fine
reasoning_effort troppo elevato per il compito. Abbassalo a medium o low, oppure disattiva la riflessione per i compiti semplici.
L'immagine è ignorata
Il percorso del file deve essere accessibile dal processo Ollama e il parser vision richiede una versione aggiornata. Prova con una semplice immagine locale prima di dare la colpa al modello.
Manca spazio su disco
Tra i blob e la cache, prevedi il doppio dello spazio indicato durante l'installazione. Un pull interrotto perché il disco è pieno lascia frammenti: ollama rm, poi un nuovo pull.
Domande frequenti
Quanta VRAM serve per Qwen 3.8 27B?+
24 GB di VRAM per la versione predefinita Q4_K_M, i cui file occupano 18 GB, a cui si aggiunge la cache KV. Prevedi 40 GB per la versione Q8 e 56 GB per i pesi BF16. Su Mac, servono almeno 32 GB di memoria unificata.
Come installare Qwen 3.8 27B localmente?+
Installa o aggiorna Ollama, poi esegui « ollama pull qwen3.8:27b » e « ollama run qwen3.8:27b ». Il download è di 18 GB. Su un Mac Apple Silicon, usa preferibilmente il tag qwen3.8:27b-mlx, ottimizzato per Metal.
Qwen 3.8 27B è gratuito e utilizzabile in azienda?+
Sì. I pesi sono pubblicati sotto licenza Apache 2.0, che consente l'uso commerciale, la modifica e la redistribuzione, senza soglie relative al numero di utenti né clausole restrittive sull'uso. È una delle licenze più permissive tra i modelli aperti.
Qual è la differenza tra Qwen 3.8 27B e Qwen 3.8-Max?+
Qwen 3.8-Max è un modello proprietario di tipo Mixture-of-Experts con circa 2.400 miliardi di parametri, accessibile esclusivamente tramite API. Qwen3.8-27B è la variante densa a pesi aperti della stessa generazione: è l'unica delle due che puoi eseguire sulla tua macchina.
È possibile eseguire Qwen 3.8 27B con 16 GB di VRAM?+
Tecnicamente sì, ma una parte del modello passa al processore e il throughput scende generalmente sotto i 5 token al secondo. Su 16 GB, un modello da 12 a 14 miliardi di parametri offre un'esperienza molto migliore.
Qwen 3.8 27B è meglio di Qwen 3.6 27B?+
Secondo i dati pubblicati da Alibaba, sì, nettamente nella programmazione agentica (73,0 contro 63,4 su Terminal Bench 2.1) e nell'uso del computer (84,3 contro 63,9 su OSWorld-Verified). Questi punteggi non sono ancora stati riprodotti in modo indipendente e la differenza è meno evidente negli usi conversazionali.
È possibile disattivare la modalità di ragionamento di Qwen 3.8?+
Sì. La modalità thinking è attiva per impostazione predefinita, ma può essere disattivata per ogni richiesta e la sua profondità si regola con il parametro reasoning_effort (xhigh, medium o low). In modalità diretta, le impostazioni consigliate sono temperature 0,7 e top_p 0,80.
È possibile avere un contesto di un milione di token localmente?+
Non tramite Ollama. Il contesto nativo è di 262.144 token e l'estensione a un milione passa attraverso una configurazione YaRN supportata solo da vLLM, SGLang e TokenSpeed. In pratica, su una scheda da 24 GB, una finestra da 16.000 a 64.000 token è l'impostazione realistica.

#Per approfondire

Questa guida presuppone un'installazione funzionante di Ollama e una scelta consapevole della quantizzazione. Queste pagine completano l'argomento:

Installare Ollama
Il prerequisito se il motore non è ancora installato, su Windows, macOS o Linux — e l'aggiornamento, indispensabile per Qwen 3.8.
Scegliere la quantizzazione
Per scegliere consapevolmente tra Q4, Q8 e BF16: quanta memoria richiede ogni livello e cosa offre in termini di qualità.
Qwen 3.8: la cronologia dei modelli open weights
Da dove nasce la confusione tra il Max disponibile via API e il 27B aperto, e che cosa è stato realmente annunciato e quando.
Quale LLM per 24 GB di VRAM
Il confronto dei modelli che rientrano nella memoria di una scheda da 24 GB, se sei ancora indeciso tra Qwen 3.8 27B e un'alternativa più leggera.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.