Phi-4 in locale: installare con Ollama, VRAM e velocità
Phi-4 è il piccolo modello di Microsoft che ha fatto molto parlare di sé alla fine del 2024: solo 14 miliardi di parametri, eppure punteggi in matematica e programmazione che si avvicinano a quelli di modelli tre volte più grandi. Questa guida mostra come installare Phi-4 con Ollama in locale, quanto vale davvero nella pratica e dove delude — soprattutto in francese.
#Perché Phi-4?
Phi-4 è la continuazione logica della famiglia Phi di Microsoft Research: modelli di piccole dimensioni, addestrati principalmente su dati sintetici molto curati, progettati per competere con modelli molto più grandi nelle attività di ragionamento. La versione 4, uscita alla fine del 2024, porta questo approccio a 14B di parametri e ottiene punteggi notevoli su GPQA, MATH e HumanEval — spesso superiori a quelli di Llama 3.3 70B su questi benchmark specifici.
In pratica, è un modello che rientra in 9 GB di VRAM in Q4_K_M, quindi utilizzabile su una GPU di fascia base da 12 GB come una RTX 3060 o una RTX 4070. E se la cava dignitosamente anche usando solo la CPU, se hai 16 GB di RAM. È questo equilibrio tra dimensioni e qualità a renderlo un ottimo candidato per il self-hosting su hardware modesto.
#Prerequisiti
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
- Ollama installato
- Windows, macOS o Linux. Se non hai ancora installato Ollama, con la guida all'installazione bastano 3 minuti.
- VRAM per la quantizzazione Q4_K_M
- ≈ 9 GB. Una RTX 3060 da 12 GB, una RTX 4070 da 12 GB o un Mac con 16 GB di memoria unificata sono sufficienti senza problemi.
- RAM CPU in assenza di GPU
- Almeno 16 GB per Q4. Considera da 4 a 8 token/sec su un Ryzen 5 o Core i5 recente — utilizzabile per i test, ma non per una chat fluida.
- 10 GB di spazio disco
- Il modello Q4_K_M pesa circa 9 GB. Prevedi di più se vuoi anche testare Phi-4-Mini in parallelo.
#1. Installare Ollama
Se Ollama è già installato, passa direttamente alla sezione successiva. Altrimenti, ecco come installarlo con un solo comando su Linux e macOS.
Su Windows, scarica il programma di installazione dal sito ufficiale.
Una volta installato, il daemon Ollama ascolta sulla porta 11434.
#2. Scaricare Phi-4
Phi-4 è disponibile nel catalogo ufficiale Ollama. Il tag predefinito scarica la quantizzazione Q4_K_M, che è il compromesso consigliato.
Il download è di circa 9 GB. Per scegliere esplicitamente un'altra quantizzazione, specifica il tag.
#3. Prime prove: matematica, codice, ragionamento
Avvia una sessione interattiva per verificare che il modello funzioni e testarne i punti di forza.
Dovresti vedere un prompt `>>>`. È lì che Phi-4 si distingue: gli esercizi logici e tecnici. Alcuni prompt rivelatori:
Phi-4 sviluppa il ragionamento passo dopo passo e arriva al risultato. Per il codice, gestisce senza problemi Python e JavaScript standard.
#4. Qualità del francese: i veri punti deboli
È qui che Phi-4 mostra i suoi limiti. Il modello è stato addestrato principalmente su testi in inglese (e su molti dati sintetici generati in inglese). Il francese è presente nel corpus, ma ha chiaramente un ruolo secondario.
- Grammatica e concordanze
- Buoni con frasi semplici, ma errori di concordanza, anglicismi e costruzioni pesanti non appena si richiede la stesura di testi lunghi.
- Terminologia tecnica FR
- Tendenza a usare termini in inglese ("endpoint", "deployment", "thread") anche quando esiste un equivalente francese comune.
- Comprensione
- Capisce molto bene un prompt in francese. Il problema è la produzione.
- Codice commentato in FR
- I commenti nel codice passano spesso all'inglese durante la generazione. Dai l'istruzione esplicitamente: aiuta, ma non risolve tutto.
- Cultura FR
- Scarsa. Conoscenza superficiale della giurisprudenza, della storia o delle istituzioni francesi. Tutt'altro che un modello per redigere una nota giuridica in francese.
Un accorgimento che aiuta un po': un prompt di sistema rigoroso costringe il modello a restare in francese, al prezzo di risposte talvolta più brevi.
#5. Phi-4-Mini: la versione 3.8B
Microsoft ha pubblicato contemporaneamente Phi-4-Mini, una variante da 3,8B destinata a configurazioni estremamente limitate: laptop senza GPU dedicata, Raspberry Pi 5, dispositivi edge. Con 2,5 GB in Q4, funziona su qualsiasi macchina moderna.
- VRAM/RAM necessaria
- ≈ 2,5 GB in Q4_K_M. Funziona su un MacBook Air M1 con 8 GB o su un PC con una GPU da 4 GB.
- Velocità
- Molto veloce. 80+ tok/sec sull'RTX 3060, 30+ tok/sec su CPU recente.
- Punti di forza
- Segue bene le istruzioni brevi, va bene per aiutare con i prompt, per la riformulazione semplice e per la classificazione.
- Debolezze
- Il ragionamento complesso e il codice lungo sono al di fuori delle sue capacità. È un modello di supporto, non un sostituto della versione 14B.
#6. Phi-4 vs Qwen 3.5 9B
Nel 2026, il concorrente diretto più rilevante è Qwen 3.5 9B di Alibaba. Un po' più compatto (6,6 GB in Q4 contro 9 GB per Phi-4), rientra nella memoria della stessa GPU da 12 GB e si rivolge alla stessa categoria di utenti. Ciò che li distingue:
- Ragionamento e matematica
- Phi-4 ha un vantaggio nei benchmark formali (GPQA, MATH). Nell'uso pratico su problemi comuni, il divario è minore di quanto si creda.
- Codice
- Qwen 3.5 9B è in generale migliore nei linguaggi meno comuni (Rust, Go, SQL avanzato). Phi-4 rimane competitivo in Python e JS.
- Francese
- Qwen 3.5 è nettamente migliore. Molti più dati multilingui nell’addestramento, vocabolario più ricco, meno passaggi all’inglese. Vantaggio netto per Qwen su questo criterio.
- Contesto
- Qwen 3.5 9B accetta fino a 256k token di contesto, Phi-4 si ferma a 16k. Se lavori su documenti lunghi, Qwen è molto più adatto.
- Rispetto delle istruzioni
- Phi-4 segue con maggiore precisione le istruzioni strutturate (formato JSON, vincoli rigorosi). Qwen è un po' più "creativo" e può prendersi delle libertà.
#Risoluzione dei problemi
- "Out of memory" al caricamento
- La tua VRAM non è sufficiente per la quantizzazione scelta. Passa a Q4_K_M (la quantizzazione più leggera tra quelle utili), oppure lascia che Ollama esegua l'offload parziale sulla CPU con `ollama run phi4 --num-gpu N`, dove N è il numero di strati da caricare sulla GPU.
- Generazione a 1–2 token/sec su una macchina dotata di GPU
- Il modello è probabilmente in esecuzione sulla CPU. Controlla la colonna "PROCESSOR" con `ollama ps`. Se indica 100% CPU, libera VRAM (Chrome, giochi, altri modelli caricati) e rilancia il modello.
- Risposte che passano all'inglese durante la generazione
- Comportamento atteso con Phi-4 in francese. Rafforzare il prompt di sistema aiuta in parte. Per un uso ricorrente in lingua francese, cambia modello anziché continuare a far fatica.
- Contesto troncato a 4096 token
- Ollama carica di default un contesto breve. Estendilo esplicitamente: `/set parameter num_ctx 16384`. Al di là, Phi-4 è stato addestrato fino a 16k soltanto — non ha senso spingere oltre.
- Il modello inventa fatti recenti
- Le conoscenze di Phi-4 sono ferme alla data del suo addestramento (fine 2024) e la sua cultura generale è meno ampia rispetto a quella di modelli più grandi. Per informazioni fattuali aggiornate, serve una pipeline RAG, non il modello da solo.
#Per approfondire
Phi-4 è un buon punto di partenza per i LLM 14B in locale. Alcuni spunti per sfruttare ulteriormente la tua installazione:
- Provare un concorrente diretto
- La guida ai test di Qwen 3 presenta benchmark comparabili su hardware di fascia consumer, utili per fare un confronto con i tuoi prompt.
- Scegliere la quantizzazione giusta
- La guida "Scegliere la quantizzazione (Q4, Q5, Q8, FP16)" spiega i compromessi qualità/memoria che si applicano anche a Phi-4.
- Eseguire Phi-4 senza GPU
- Se usi solo la CPU, la guida "Eseguire un LLM localmente senza GPU" integra quanto descritto qui con ottimizzazioni specifiche.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.