Granite 4 di IBM in locale: installazione e casi d'usage
IBM sviluppa senza clamore una delle famiglie di LLM a pesi aperti più interessanti per le aziende: Granite. Questa guida mostra come installare Granite 4 in locale con Ollama, spiega l'architettura ibrida Mamba che riduce la memoria necessaria, descrive in dettaglio la licenza Apache 2.0 senza clausole insidiose e si concentra sugli impieghi — RAG, function calling, attività aziendali — in cui Granite si distingue davvero dai modelli destinati al grande pubblico.
#Perché Granite 4 piuttosto che un altro modello
Granite non è progettato per primeggiare nelle classifiche dei chatbot. IBM punta a un obiettivo diverso: modelli affidabili, che consumano poca memoria e sono in regola dal punto di vista legale, pensati per essere integrati in applicazioni aziendali. Non si sceglie Granite per discutere di filosofia, ma per collegare un modello a una base documentale, fargli chiamare strumenti o eseguirlo a costi ridotti su hardware modesto.
Tre cose distinguono Granite 4 dal resto dei modelli open-weight. Prima di tutto un'architettura ibrida Mamba che riduce notevolmente la memoria consumata, soprattutto con contesti lunghi. Poi una licenza Apache 2.0 rigorosa, senza le restrizioni d'uso imposte da Llama o Gemma. Infine un lavoro di tracciabilità e governance — modelli firmati, dati di addestramento documentati, certificazione ISO 42001 — che i responsabili dei sistemi informativi e gli uffici legali sanno apprezzare. È un modello pensato per superare una verifica di conformità, non solo un benchmark.
#L'architettura ibrida Mamba e il risparmio di memoria che offre
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Il vero punto di forza tecnico di Granite 4 è la sua architettura. Un transformer classico si basa interamente sull'attenzione: a ogni nuovo token, il modello rilegge tutto il contesto e memorizza una «KV cache» che cresce linearmente con la lunghezza della conversazione. Più il contesto è lungo, più il consumo di VRAM esplode e più l'inferenza rallenta. È il ben noto limite dei contesti lunghi nell'esecuzione in locale.
Mamba appartiene a una famiglia diversa: i modelli a spazio di stato (state space models). Invece di rileggere tutto, uno strato Mamba mantiene uno stato ricorrente di dimensione fissa che riassume il passato. Di conseguenza, la memoria non aumenta con la lunghezza del contesto e il throughput rimane stabile anche su documenti molto lunghi. Il limite di Mamba usato da solo è una capacità meno precisa di richiamare dettagli lontani nel contesto.
Granite 4 combina i due. La maggior parte dei blocchi è costituita da strati Mamba-2 (parsimoniosi), intervallati da una minoranza di blocchi di attenzione (precisi) — un rapporto di circa nove strati Mamba per uno strato di attenzione. Si conserva così gran parte del risparmio di memoria, mantenendo al contempo la capacità dell'attenzione di ritrovare un dettaglio esatto. In pratica, Granite 4 funziona con molta meno RAM/VRAM rispetto a un transformer di dimensioni comparabili, soprattutto quando il contesto supera qualche migliaio di token.
#Micro, Tiny e Small: quale variante scegliere
Granite 4 è disponibile in diverse dimensioni, con suffissi che indicano la destinazione hardware. Le versioni contrassegnate « H » utilizzano l'architettura ibrida; una versione non ibrida è fornita per ambienti che non supportano ancora Mamba.
- Granite 4 Micro (~3B, denso)
- Il più piccolo, denso e ibrido. Ideale su CPU, con poca VRAM o in ambiente edge. Sta in circa 2 GB in Q4. Perfetto per estrazione, classificazione e RAG leggero.
- Granite 4 Tiny-H (~7B, MoE)
- Mixture of experts ibrida: molti parametri totali ma pochi attivi per ogni token, quindi veloce. Buon compromesso qualità/velocità su una scheda entry level.
- Granite 4 Small-H (~32B, MoE)
- Il top di gamma accessibile: qualità vicina a quella dei modelli più grandi per le attività professionali, mantenendo il ridotto utilizzo di memoria del modello ibrido. Pensato per workstation o server.
- Variante non ibrida
- Esiste una versione con architettura Transformer classica per i runtime che non supportano ancora Mamba. Da riservare ai casi in cui serve per la compatibilità: si perde il risparmio di memoria.
Per iniziare, Micro basta per validare i casi d'uso e funziona ovunque. Passa a Tiny-H o Small-H una volta che sai cosa vuoi industrializzare e hai misurato una carenza di qualità.
#Prerequisiti e VRAM
Il requisito software si limita a Ollama installato e aggiornato: il daemon è in ascolto per impostazione predefinita su http://localhost:11434. Assicurati di avere una versione recente: il supporto dei layer Mamba di Granite 4 richiede una versione di Ollama abbastanza recente, altrimenti il modello non si caricherà.
- Micro (3B) in Q4
- ≈ 2 GB di VRAM. Funziona anche su CPU con 8 GB di RAM, lentamente ma in modo affidabile. Una RTX 3060 12GB offre un ampio margine.
- Tiny-H (7B MoE) in Q4
- ≈ 5 GB di VRAM per i pesi, ma l'attivazione MoE parziale rende l'inferenza leggera. Una scheda da 8–12 GB basta ampiamente.
- Small-H (32B MoE) in Q4
- ≈ 19 GB di VRAM. RTX 4090 24GB o Mac con 32–48 GB di memoria unificata. L'approccio ibrido limita il forte aumento del consumo di memoria con contesti lunghi.
- Margine per il contesto
- Grazie a Mamba, la cache KV occupa molta meno memoria rispetto a quella di un transformer equivalente: puoi puntare a contesti ampi senza raddoppiare la VRAM.
#Installare Granite 4 tramite Ollama
L'installazione segue il flusso Ollama abituale. Il modello è pubblicato nella libreria ufficiale con il nome granite4; le varianti vengono selezionate tramite tag. Verifica il nome esatto dei tag su ollama.com/library prima di scaricare una versione di una dimensione specifica, poiché cambiano da una release all'altra.
- 01Verificare OllamaConferma che il daemon sia in esecuzione e aggiornato. Una versione vecchia non riconosce gli strati Mamba di Granite 4.
- 02Scaricare il modelloScarica la variante scelta con ollama pull. Inizia con Micro per testare velocemente senza saturare il disco né la scheda.
- 03Avviare una prima chatollama run apre una sessione interattiva. Poni una domanda di lavoro — riassunto di un testo, estrazione di campi — piuttosto che un indovinello generico.
- 04Collegare un'interfacciaIndirizza Open WebUI o LM Studio all'endpoint locale per un utilizzo comodo, o chiama direttamente l'API HTTP dalla tua applicazione.
Per l'uso nelle applicazioni, Ollama espone un'API compatibile con OpenAI sulla stessa porta. Puoi quindi riutilizzare qualsiasi client esistente semplicemente cambiando l'URL di base e il nome del modello.
#Apache 2.0, la licenza senza trappole per le aziende
È un punto che i team legali esaminano prima dei benchmark. Granite 4 è pubblicato con licenza Apache 2.0, una licenza open source permissiva e collaudata. Puoi usarlo commercialmente, modificarlo, redistribuirlo e integrarlo in un prodotto chiuso, senza soglie sul numero di utenti né clausole di uso accettabile da tenere sotto controllo.
Questa distinzione conta nel confronto con le alternative più diffuse. La « Llama Community License » di Meta non è una vera licenza open source: impone restrizioni oltre i 700 milioni di utenti mensili e vieta alcuni usi. Anche le condizioni di Gemma (Google) regolamentano l'uso attraverso una politica che definisce gli utilizzi vietati. Apache 2.0 non prevede nulla di tutto questo: è una licenza standard che gli uffici legali conoscono già e approvano senza negoziazioni.
- Uso commerciale
- Autorizzato senza condizioni relative alle dimensioni o al settore. Nessuna soglia di utenti da monitorare.
- Modifica e fine-tuning
- Puoi personalizzare il modello e conservare i tuoi pesi privati, senza obbligo di pubblicazione.
- Ridistribuzione
- Integrazione possibile in un prodotto proprietario, mantenendo la menzione della licenza.
- Governance IBM
- Modelli firmati in modo crittografico, dati documentati e certificazione ISO 42001 — argomenti concreti per una valutazione di conformità.
#RAG e function calling, i punti forti di Granite
È qui che Granite giustifica la propria esistenza. IBM ha addestrato questi modelli specificamente per due usi aziendali: il RAG (rispondere basandosi sui documenti forniti) e il function calling (chiamare strumenti in modo affidabile). Sono proprio queste le componenti necessarie per costruire un assistente aziendale utile, anziché un semplice chatbot.
Nel RAG, Granite segue attentamente il contesto fornito e limita le allucinazioni: tende a basarsi sui passaggi inseriti piuttosto che a inventare. Questa caratteristica, unita all'architettura ibrida che elabora documenti lunghi senza far esplodere l'uso della VRAM, ne fa un buon motore per interrogare una base documentale in locale. Spesso basta la versione Micro, il che rende il RAG accessibile su hardware modesto.
Sul fronte degli strumenti, Granite genera chiamate di funzione ben formate e rispetta gli schemi JSON attesi. È la base di un agente: il modello decide di chiamare una funzione, legge il risultato e prosegue. Combinando queste capacità con un contesto lungo a basso costo, si ottengono automazioni aziendali affidabili senza dipendere dal cloud.
- RAG documentale
- Un chiaro punto di forza: buona capacità di seguire il contesto, basso tasso di informazioni inventate, contesto lungo con un consumo di memoria contenuto. Ideale per una base di conoscenze interna.
- Chiamata di funzione
- Chiamate affidabili agli strumenti e JSON conforme — la componente di base degli agenti locali e delle integrazioni con un sistema esistente.
- Estrazione strutturata
- Trasformare un testo libero in campi puliti (date, importi, entità). La versione Micro se la cava già molto bene.
- Conversazione generale
- Dignitoso senza essere eccezionale. Non è qui che Granite cerca di vincere.
#Risoluzione dei problemi
- Il modello non si carica (errore di architettura)
- La tua versione di Ollama è troppo vecchia per i layer Mamba di Granite 4. Aggiorna Ollama a una versione recente, poi esegui nuovamente il pull.
- « model not found » durante il pull
- Il tag non esiste con questo nome. Verifica la grafia esatta su ollama.com/library — i tag delle varianti variano da una release all'altra.
- Risposte fuori tema in RAG
- Il contesto è formattato male o contiene troppo rumore. Struttura i passaggi inseriti, riducine il numero e chiedi esplicitamente di rispondere solo sulla base dei documenti forniti.
- Chiamate agli strumenti malformate
- Lo schema JSON è ambiguo. Semplifica la definizione, rendi espliciti i campi obbligatori e prova prima con un solo strumento, prima di combinarne diversi.
- Velocità crollata su Small-H
- Il modello viene caricato in parte nella RAM per mancanza di VRAM. «ollama ps» mostra la ripartizione tra GPU e CPU. Passa a Tiny-H o Micro, oppure scendi di un livello di quantizzazione.
- « Connection refused »
- Il daemon Ollama non è avviato. Verifica con « ollama ps » che sia effettivamente in ascolto su http://localhost:11434.
#Per approfondire
Granite si basa su componenti già trattati sul sito. Queste guide approfondiscono gli argomenti di questa guida:
- Installare Ollama su Linux
- Il prerequisito se il daemon non è ancora configurato: script di installazione, servizio systemd e configurazione della GPU NVIDIA/AMD.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Per bilanciare qualità e VRAM su Granite Small-H, dove ogni livello di quantizzazione cambia ciò che riesce a stare nella memoria della tua scheda.
- IA locale in azienda: GDPR, sovranità e deployment
- Il complemento naturale della licenza Apache 2.0: come distribuire Granite nel rispetto delle norme all'interno di un'organizzazione.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.