Qwen 3.8 27B in locale: installazione Ollama e VRAM
I pesi di Qwen3.8-27B sono stati pubblicati il 14 agosto 2026 su Hugging Face, sotto licenza Apache 2.0, e il tag ufficiale Ollama è arrivato lo stesso giorno. È il primo modello della generazione 3.8 realmente installabile sulla tua macchina: denso, multimodale (immagini e video), 262.144 token di contesto nativo. Questa guida fornisce il comando esatto, la VRAM effettivamente necessaria tag per tag, le impostazioni della modalità «thinking» attivata per impostazione predefinita e le due insidie che rovinano la maggior parte dei primi tentativi — il contesto troncato senza avviso e il trasferimento di parte del modello nella RAM di sistema.
#Il verdetto in 30 secondi
Qwen 3.8 27B si installa con un semplice comando: «ollama run qwen3.8:27b». Il pacchetto predefinito (Q4_K_M) pesa 18 GB e richiede una scheda con 24 GB di VRAM — RTX 3090, 4090, 5090 — oppure un Mac Apple Silicon con almeno 32 GB di memoria unificata per lavorare comodamente. Al di sotto, il modello funziona comunque, ma una parte degli strati viene spostata sul processore e il throughput crolla.
- Cos'è
- Un modello denso con 27 miliardi di parametri, capacità native di visione e linguaggio (immagini e video), 262.144 token di contesto, con licenza Apache 2.0 — quindi utilizzabile commercialmente senza clausole restrittive.
- Il prerequisito realistico
- 24 GB di VRAM o 32 GB di memoria unificata per la versione Q4_K_M. 30 GB di file e circa 40 GB di VRAM per la Q8, 56 GB per la BF16.
- Il comando
- ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
- Trappola n.1
- Il contesto annunciato è di 256k, ma Ollama applica per default una finestra molto più piccola e tronca senza avvisare. È necessario regolare manualmente num_ctx.
- Il tranello n.2
- La modalità « thinking » è attiva per impostazione predefinita e consuma molti token prima di rispondere. In locale, riduci reasoning_effort o disattiva questa modalità per i compiti semplici.
#Che cos'è davvero Qwen 3.8 27B
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
In controtendenza rispetto alla moda dei Mixture-of-Experts, Qwen3.8-27B è un modello denso: tutti i 27 miliardi di parametri vengono attivati a ogni token. È questo che rende prevedibile il suo utilizzo della memoria — nessuna sorpresa positiva nella velocità di generazione, nessuna sorpresa negativa sulla VRAM — ed è anche ciò che spiega una velocità di generazione in locale più modesta rispetto a un MoE di dimensioni comparabili.
- Architettura
- 64 livelli organizzati in 16 blocchi di « 3 × (Gated DeltaNet → FFN) poi 1 × (Gated Attention → FFN) ». Un'attenzione ibrida: la maggior parte dei livelli utilizza un'attenzione lineare, che richiede poca memoria, intervallata da veri e propri livelli di attenzione per la precisione.
- Modalità
- Integrazione nativa di visione e linguaggio: immagini fisse, documenti, diagrammi scientifici e video. Non è un adattatore aggiunto successivamente.
- Contesto
- 262.144 token nativi, estendibili a 1.000.000 tramite YaRN — ma solo su vLLM, SGLang o TokenSpeed, non tramite Ollama.
- Licenza
- Apache 2.0. Uso commerciale autorizzato, nessuna soglia di utenti come per Llama, nessuna clausola d'uso come per Gemma.
- Particolarità
- Il modello è addestrato con Multi-Token Prediction (MTP) — da qui i tag Ollama « mtp », che accelerano la generazione sui motori che sanno sfruttarla.
#L'hardware necessario, tag per tag
La libreria Ollama pubblica dodici varianti. La dimensione del download non corrisponde alla VRAM necessaria: bisogna aggiungere la cache KV, che cresce con la lunghezza del contesto, e l'encoder visivo. Prevedi un margine dal 15 al 25% rispetto alla dimensione del file.
| Tag | Dimensione | Memoria per un utilizzo agevole | Per chi |
|---|---|---|---|
| qwen3.8:27b (Q4_K_M, predefinito) | 18 GB | 24 GB | Scelta predefinita: RTX 3090/4090/5090, Mac 32 GB |
| qwen3.8:27b-q8_0 | 30 GB | 40 GB e oltre | Qualità quasi massima: RTX Pro 6000, bi-GPU 24 GB |
| qwen3.8:27b-bf16 | 56 GB | 80 GB | Pesi di riferimento, macchine per il calcolo (H100, H200) |
| qwen3.8:27b-mlx | 18 GB | 32 GB unificati | Apple Silicon: build Metal, la scelta predefinita giusta su Mac |
| qwen3.8:27b-mxfp8 | 32 GB | 48 GB unificati | Mac Studio / M4 Max 64 GB, qualità superiore |
| qwen3.8:27b-mlx-bf16 | 56 GB | 96 GB unificati | Mac Studio 128 GB, nessuna perdita dovuta alla quantizzazione |
| qwen3.8:27b-mtp-q4_K_M | 18 GB | 24 GB | Identico all'impostazione predefinita, con predizione multi-token esplicita |
Quanto alla velocità di generazione, le nostre stime per un modello denso da 27B in Q4 si aggirano intorno a 14 token al secondo su una configurazione di fascia media e a 22 token al secondo su una configurazione recente di fascia alta. Sono ordini di grandezza calcolati, non misurazioni: la modalità «thinking», attivata per impostazione predefinita, può inoltre raddoppiare il tempo percepito prima della prima riga di risposta.
#Installare Qwen 3.8 27B con Ollama
- 01Aggiorna OllamaGli strati ibridi e il parser per la visione di Qwen 3.8 richiedono una versione recente di Ollama. Una versione precedente ad agosto 2026 restituirà un errore di architettura o un messaggio « model not found » fuorviante. Reinstalla dal sito ufficiale oppure esegui di nuovo lo script di installazione su Linux.
- 02Scarica il modelloVengono trasferiti 18 GB: prevedi spazio sul disco di sistema, dove Ollama conserva i suoi blob. Il pull può essere ripreso se la connessione si interrompe.
- 03Avvia un primo scambioLa prima risposta è più lenta, perché occorre attendere che i pesi vengano caricati in memoria. Se impiega più di un minuto ad avviarsi, è segno che parte dell'elaborazione viene trasferita al processore.
- 04Verifica dove gira il modelloIl comando ollama ps mostra la ripartizione GPU/CPU. Finché non vedi «100 % GPU», ogni token costa caro: scendi di un livello di quantizzazione o riduci il contesto.
#Su Mac Apple Silicon: scegli la versione MLX
Ollama pubblica una build MLX, compilata per il motore Metal di Apple. A parità di dimensioni del file (18 GB), sfrutta meglio la memoria unificata e offre un throughput sensibilmente superiore rispetto al GGUF generico sui chip M3, M4 e successivi.
- Mac 16 GB
- Insufficiente. macOS rende disponibile alla GPU solo circa il 70% della memoria unificata: il modello finisce nello swap e diventa inutilizzabile.
- Mac 24 GB
- Ci sta appena, con un contesto breve e senza altre applicazioni pesanti aperte. Accettabile per fare una prova, frustrante nell'uso quotidiano.
- Mac 32 GB
- Il vero punto di partenza: il modello entra in memoria e rimane margine per la cache KV e il sistema.
- Mac con 64 GB e oltre
- Confortevole, e permette di passare a mxfp8 o di lavorare su documenti lunghi.
#Il tranello del contesto 256k
È l'errore che fanno quasi tutti gli utenti alle prime armi. Il modello dichiara 262.144 token, ma Ollama applica per impostazione predefinita una finestra molto più corta: oltre questo limite, l'inizio del tuo documento viene semplicemente tagliato, senza alcun messaggio di errore. Il modello risponde con sicurezza su un testo che non ha visto per intero.
Quanto al milione di token annunciato: si basa su un'estensione YaRN, configurata nel file di configurazione del modello, ed è supportato solo da vLLM, SGLang o TokenSpeed. Attualmente non esiste alcun modo per accedervi da Ollama.
#Modalità Thinking e parametri di sampling
Qwen 3.8 riflette prima di rispondere: genera un blocco di ragionamento tra i tag « think », poi la risposta finale. Questa modalità è attivata per impostazione predefinita ed è ciò che spiega la maggior parte della latenza percepita. Nei motori che la supportano, la profondità si regola con reasoning_effort — xhigh per impostazione predefinita, poi medium e low.
| Modalità | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Thinking (predefinito) | 1.0 | 0.95 | 20 | 0.0 |
| Instruct (senza riflessione) | 0.7 | 0.80 | 20 | 1.5 |
- Compiti brevi in locale
- Riduci reasoning_effort a low o medium: per una riformulazione o un'estrazione, un ragionamento prolungato non cambia la qualità e triplica il tempo di attesa.
- Compiti agentici
- Mantieni xhigh. Alibaba osserva che un impegno ridotto causa analisi insufficienti, quindi ripetizioni — il guadagno per turno viene annullato dai fallimenti.
- Risposte che si ripetono in loop
- Aumenta presence_penalty (tra 0 e 2). Al di sopra di 1,5, il modello inizia a mescolare le lingue.
- Uscita contaminata dal ragionamento
- Se la tua applicazione mostra i tag di ragionamento, significa che non separa reasoning_content dal contenuto finale. Disattiva il ragionamento per questo caso d'uso anziché filtrare il testo a posteriori.
#Analizzare un'immagine o un documento
La vision è native: schermata, foto di tavolo, schema tecnico, pagina scansa. Da riga di comando basta indicare il percorso del file nel prompt; tramite API le immagini vengono codificate in base64 nel campo previsto da Ollama.
#Cosa valgono i punteggi annunciati
Il salto dichiarato rispetto a Qwen 3.6-27B, il modello delle stesse dimensioni della generazione precedente, è significativo — soprattutto nella programmazione agentica e nell'uso del computer. Ecco i dati pubblicati da Alibaba, tenendo presente che non sono stati riprodotti in modo indipendente.
| Prova | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| Terminal Bench 2.1 (programmazione agentica) | 73,0 | 63,4 |
| SWE-bench Pro | 61,7 | 53,5 |
| LiveCodeBench v6 | 90,3 | 83,9 |
| IFBench (capacità di seguire le istruzioni) | 79,5 | 69,1 |
| GPQA Diamond (scienze) | 89,2 | 87,8 |
| OSWorld-Verified (uso di computer) | 84,3 | 63,9 |
| MathVision (matematica visiva) | 90,0 | 85,1 |
| OmniDocBench 1.5 (documenti) | 91,1 | 89,4 |
Ciò che bisogna tenere a mente per un uso locale: i progressi riguardano soprattutto le attività lunghe che richiedono l'uso di strumenti — gestire un terminale, correggere un repository, eseguire una sequenza di passaggi senza perdere la rotta. In una semplice conversazione o in un riassunto, la differenza rispetto alla generazione precedente sarà molto meno evidente di quanto questi numeri lascino credere.
#È necessario abbandonare Qwen 3.6, Gemma 4 o gpt-oss?
- Usi Qwen 3.6-27B
- Sì, vale la pena aggiornare: stesso consumo di memoria, stessa licenza permissiva, miglioramenti netti nel codice e nelle capacità agentiche. Mantieni il vecchio tag finché non hai validato i tuoi prompt: lo stile delle risposte cambia.
- Usi Gemma 4 26B
- Qwen 3.8 mantiene il vantaggio nella programmazione e nelle funzionalità agentiche; quanto alla licenza, entrambi sono ora distribuiti con licenza Apache 2.0, dopo il passaggio di Gemma a una licenza permissiva nell'aprile 2026. Gemma 4 (MoE 26B-A4B, multimodale) rimane spesso più naturale nel francese conversazionale e più rapido da avviare.
- Usi gpt-oss-20b
- Due filosofie: gpt-oss è più leggero e più veloce, Qwen 3.8 vede le immagini, gestisce un contesto molto più lungo ed è pensato per compiti lunghi. Scegli in base alla VRAM disponibile.
- Cerchi soprattutto di scrivere codice
- Un modello MoE da 30B specializzato nel codice rimane più veloce nell'autocompletamento. Qwen 3.8 27B ha senso quando l'agente deve leggere, pianificare e modificare diversi file.
- Hai meno di 24 GB
- Non forzare. Un modello 12-14B in Q4 ti darà un'esperienza migliore rispetto a un 27B che viene eseguito in parte sulla CPU.
#Risoluzione dei problemi
- « model not found » durante il pull
- Ollama è troppo vecchio per riconoscere questo repository, oppure il tag è scritto male — il tag corretto è « qwen3.8:27b », con un punto, non un trattino. Aggiorna Ollama, poi riprova.
- Errore di architettura durante il caricamento
- Stessa causa: i layer ibridi di Qwen 3.8 sono supportati solo dalle versioni recenti del motore.
- Generazione molto lenta (meno di 5 token/s)
- Il modello viene caricato in parte nella RAM di sistema. Controlla con ollama ps: se la ripartizione non è al 100% GPU, riduci num_ctx, chiudi le altre applicazioni che usano la GPU oppure passa a un modello più piccolo.
- Risposte che ignorano l'inizio del documento
- Contesto troncato senza avviso. Imposta num_ctx in base alla lunghezza effettiva del tuo input, oppure suddividi il documento.
- Il modello « pensa » senza fine
- reasoning_effort troppo elevato per il compito. Abbassalo a medium o low, oppure disattiva la riflessione per i compiti semplici.
- L'immagine è ignorata
- Il percorso del file deve essere accessibile dal processo Ollama e il parser vision richiede una versione aggiornata. Prova con una semplice immagine locale prima di dare la colpa al modello.
- Manca spazio su disco
- Tra i blob e la cache, prevedi il doppio dello spazio indicato durante l'installazione. Un pull interrotto perché il disco è pieno lascia frammenti: ollama rm, poi un nuovo pull.
Quanta VRAM serve per Qwen 3.8 27B?+
Come installare Qwen 3.8 27B localmente?+
Qwen 3.8 27B è gratuito e utilizzabile in azienda?+
Qual è la differenza tra Qwen 3.8 27B e Qwen 3.8-Max?+
È possibile eseguire Qwen 3.8 27B con 16 GB di VRAM?+
Qwen 3.8 27B è meglio di Qwen 3.6 27B?+
È possibile disattivare la modalità di ragionamento di Qwen 3.8?+
È possibile avere un contesto di un milione di token localmente?+
#Per approfondire
Questa guida presuppone un'installazione funzionante di Ollama e una scelta consapevole della quantizzazione. Queste pagine completano l'argomento:
- Installare Ollama
- Il prerequisito se il motore non è ancora installato, su Windows, macOS o Linux — e l'aggiornamento, indispensabile per Qwen 3.8.
- Scegliere la quantizzazione
- Per scegliere consapevolmente tra Q4, Q8 e BF16: quanta memoria richiede ogni livello e cosa offre in termini di qualità.
- Qwen 3.8: la cronologia dei modelli open weights
- Da dove nasce la confusione tra il Max disponibile via API e il 27B aperto, e che cosa è stato realmente annunciato e quando.
- Quale LLM per 24 GB di VRAM
- Il confronto dei modelli che rientrano nella memoria di una scheda da 24 GB, se sei ancora indeciso tra Qwen 3.8 27B e un'alternativa più leggera.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.