🇺🇸 Gemma 4 E4B
Multimodale con 4B effettivi (testo+immagine+audio). 140 lingue. Per laptop ed edge.
ollama run gemma4:e4b
Classifica aggiornata il 22/09/2026
Il MacBook Air M4 (16 / 24 / 32 GB di memoria unificata, 120 GB/s) esegue molto bene i LLM da 3 a 9B in Q4_K_M tramite Ollama o MLX. L'assenza della ventola limita le sessioni lunghe: si privilegiano modelli efficienti (MoE con pochi parametri attivi) e quantizzazioni aggressive.
MacBook Air M4 : alternativa d'acquisto disponibile per l'IA locale — MacBook Pro M5 Pro — 24 GB / 1 TB :
Quale PC scegliere in base al tuo budget? Le nostre scelte da 800 a 3 500 € →
Link di affiliazione — QuelLLM può ricevere una commissione sugli acquisti, senza costi aggiuntivi per te, il che non influenza la classifica (stabilita in modo indipendente). In qualità di Partner Amazon, QuelLLM realizza un guadagno sugli acquisti che soddisfano i requisiti.
Multimodale con 4B effettivi (testo+immagine+audio). 140 lingue. Per laptop ed edge.
ollama run gemma4:e4b
Denso 8B Apache 2.0, 12 lingue tra cui FR, 131k ctx, GQA 32Q/8KV. MMLU 73.84, HumanEval 85.37. Uscita 29 aprile 2026.
# HuggingFace : ibm-granite/granite-4.1-8b
Granite 4.2 8B (IBM): denso Apache 2.0, contesto 128k, ~4,6 GB di VRAM in Q4. Chat, codice e ragionamento multilingui per le aziende.
ollama pull granite4.2
Versione ottenuta tramite fine-tuning SFT «thinking» di OLMo 3 7B: ragionamento passo per passo, contesto 16k, circa 4,2 GB di VRAM in Q4. 100% aperto, licenza Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu): denso 7B specializzato in codice e ragionamento, contesto 128k, ~4,1 GB di VRAM in Q4. Leggero, gira su GPU da 6-8 GB, licenza MIT.
ollama pull glm-5.3
Modello denso 7B aperto al 100% (pesi + dati + codice). Trasparenza totale per la ricerca.
ollama run olmo-3:7b
Modalità ibrida thinking/fast. 119 lingue, 32k nativi (131k tramite YaRN).
ollama run qwen3:8b
| Posizione | Modello | Params | VRAM Q4 | Contesto | Licenza | Su Apple M4 (24 GB) |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | 14 tok/s · FP16 |
| #2 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · FP16 |
| #3 | Granite 4.2 8B | 8B | 4.6 GB | 128 000 | Apache 2.0 | 32 tok/s · FP16 |
| #4 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | 32 tok/s · FP16 |
| #5 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | 32 tok/s · FP16 |
| #6 | OLMo 3 7B | 7B | 5 GB | 8 192 | Apache 2.0 | 12 tok/s · FP16 |
| #7 | Qwen 3 8B | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · FP16 |
L'IA locale sul tuo Mac, al massimo: memoria unificata, MLX vs GGUF, il modello giusto per il tuo chip, Ollama e LM Studio configurati per Apple Silicon.
Memo gratuito
Ricevi il memo VRAM → miglior modello per la programmazione → comando Ollama (una sola schermata, copia-incolla). E passa al kit Copilote Local per farne un setup che funziona davvero.
Il kit Copilota Locale — le configurazioni Ollama + Cline + Aider pronte da incollare, Modelfile configurati, risoluzione dei problemi, spazio online a vita →Niente spam. Disiscrizione in 1 clic. I tuoi dati restano da noi (mai rivenduti).
La tua scheda → il miglior modello per programmare da far girare in locale e il comando Ollama esatto:
| La tua VRAM | GPU / Mac tipici | Modello consigliato per la programmazione | Comando Ollama |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6,6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) o Gemma 4 12B (7,6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — specialista negli agenti di programmazione | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — il « quasi Copilot » | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — MoE veloce | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — è ancora il riferimento per questo caso specifico. ⚠️ Qwen 3.8: il suo livello di ragionamento è impostato su un valore molto alto per impostazione predefinita e « ragiona troppo » sulle richieste semplici — abbassalo a low (o disattivalo) al primo avvio. ⚠️ Insidia della licenza: Codestral 22B = Mistral Non-Production License → vietato per programmare al lavoro. Qwen 3.5/3.8, Gemma 4 e Devstral sono distribuiti sotto licenza Apache 2.0. 💡 Va in crash per problemi di memoria? Tieni circa 1,5 GB di VRAM libera per il contesto, oppure scendi di un livello di quantizzazione.🔌 Per integrarlo in VS Code: Cline (agente che opera su più file), Aider (CLI) o Tabby/Twinny (autocompletamento FIM) — tutti si collegano a Ollama in locale. Il kit Copilota Locale — configurazioni pronte da incollare + setup testato — è disponibile: /copilote-local.
Filtro: modelli da 1 a 15B la cui versione Q4_K_M occupa meno di 14 GB (lasciando almeno 10 GB a macOS). Bonus per i modelli da 3 a 9B (ideali per evitare il throttling termico) e per i MoE con pochi parametri attivi (Qwen 3 30B-A3B funziona su Air con 32 GB).
Criteri presi in considerazione:
Il sistema di assegnazione dei punteggi è completamente trasparente: consulta la nostra metodologia per i dettagli sul calcolo della VRAM e dei token/sec.
MacBook Air M4 16 GB: quale LLM scegliere?
Mistral 7B Q4 (~4,5 GB) o Qwen 3 8B Q4 (~5 GB) sono la scelta ideale — 25-35 token/sec, con un'esperienza fluida in chat. Evita Gemma 4 27B anche in Q3: è troppo al limite senza ventola. Vedi la guida per MacBook Air M4.
Air M4 24 / 32 GB: è possibile arrivare a 13B?
Sì: Mistral Nemo 12B Q4 (~7 GB) o Qwen 3 14B Q4 (~8 GB) girano a 15-22 token/sec. Con 32 GB puoi provare Qwen 3 30B A3B (MoE, 3 GB attivi in VRAM) — sorprendentemente valido su Air.
MLX o Ollama su MacBook Air M4?
Ollama si avvia in 30 secondi. MLX offre il 15-25% di token/s in più, ma richiede la conversione dei pesi. Per un Air (autonomia + semplicità), Ollama rimane la scelta predefinita. LM Studio combina i due in un'interfaccia grafica.
L'Air M4 si scalda quando esegue un LLM 7B?
Sì, dopo 5–10 minuti di generazione continua: le prestazioni calano di ~10–15% per il throttling termico. Nelle chat occasionali non si nota. Per elaborazioni RAG in batch, passa a un MacBook Pro (con ventola) o a un Mac mini. Vedi anche MBP M4.