Principiante 8 minOllama

Phi-4 in locale: installare con Ollama, VRAM e velocità

Phi-4 è il piccolo modello di Microsoft che ha fatto molto parlare di sé alla fine del 2024: solo 14 miliardi di parametri, eppure punteggi in matematica e programmazione che si avvicinano a quelli di modelli tre volte più grandi. Questa guida mostra come installare Phi-4 con Ollama in locale, quanto vale davvero nella pratica e dove delude — soprattutto in francese.

Di Mohamed Meguedmi·Agg. 2026-08-27·Testato su Windows, macOS e Linux
i
In breve
Phi-4 è un modello Microsoft da 14 miliardi di parametri, valido in matematica e nella programmazione (GPQA, MATH, HumanEval), con licenza MIT. · Sta in circa 9 GB di VRAM in Q4_K_M: basta una RTX 3060 o una RTX 4070 da 12 GB, oppure può funzionare usando solo la CPU (16 GB di RAM, circa 5 tok/s). · Per installarlo basta un solo comando: ollama pull phi4. · Il suo punto debole è il francese, con errori di concordanza e passaggi all'inglese — preferisci Mistral Small o Qwen 3.5 9B per scrivere in francese.

#Perché Phi-4?

Phi-4 è la continuazione logica della famiglia Phi di Microsoft Research: modelli di piccole dimensioni, addestrati principalmente su dati sintetici molto curati, progettati per competere con modelli molto più grandi nelle attività di ragionamento. La versione 4, uscita alla fine del 2024, porta questo approccio a 14B di parametri e ottiene punteggi notevoli su GPQA, MATH e HumanEval — spesso superiori a quelli di Llama 3.3 70B su questi benchmark specifici.

In pratica, è un modello che rientra in 9 GB di VRAM in Q4_K_M, quindi utilizzabile su una GPU di fascia base da 12 GB come una RTX 3060 o una RTX 4070. E se la cava dignitosamente anche usando solo la CPU, se hai 16 GB di RAM. È questo equilibrio tra dimensioni e qualità a renderlo un ottimo candidato per il self-hosting su hardware modesto.

i
In due parole
Phi-4 = 14B, forte in matematica e programmazione, debole in cultura generale e in francese, licenza MIT. Ideale se vuoi un "piccolo ma potente" per compiti tecnici su una GPU da 12 GB.

#Prerequisiti

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita
Ollama installato
Windows, macOS o Linux. Se non hai ancora installato Ollama, con la guida all'installazione bastano 3 minuti.
VRAM per la quantizzazione Q4_K_M
≈ 9 GB. Una RTX 3060 da 12 GB, una RTX 4070 da 12 GB o un Mac con 16 GB di memoria unificata sono sufficienti senza problemi.
RAM CPU in assenza di GPU
Almeno 16 GB per Q4. Considera da 4 a 8 token/sec su un Ryzen 5 o Core i5 recente — utilizzabile per i test, ma non per una chat fluida.
10 GB di spazio disco
Il modello Q4_K_M pesa circa 9 GB. Prevedi di più se vuoi anche testare Phi-4-Mini in parallelo.
→
Caso CPU-only
Phi-4 è uno dei pochi modelli 14B davvero utilizzabili senza GPU. Su un Ryzen 7 5800X o un Intel i7-12700, si raggiungono circa 5 tok/sec in Q4: lento, ma accettabile per una domanda alla volta. Per un uso interattivo, punta comunque su una GPU.

#1. Installare Ollama

Se Ollama è già installato, passa direttamente alla sezione successiva. Altrimenti, ecco come installarlo con un solo comando su Linux e macOS.

Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

Su Windows, scarica il programma di installazione dal sito ufficiale.

Link ufficiale Windows
https://ollama.com/download/windows

Una volta installato, il daemon Ollama ascolta sulla porta 11434.

Verifica
ollama --version
curl http://localhost:11434/api/tags

#2. Scaricare Phi-4

Phi-4 è disponibile nel catalogo ufficiale Ollama. Il tag predefinito scarica la quantizzazione Q4_K_M, che è il compromesso consigliato.

Terminale
ollama pull phi4

Il download è di circa 9 GB. Per scegliere esplicitamente un'altra quantizzazione, specifica il tag.

Varianti
ollama pull phi4:14b-q4_K_M    # ≈ 9 Go  (défaut)
ollama pull phi4:14b-q5_K_M    # ≈ 10 Go
ollama pull phi4:14b-q8_0      # ≈ 15 Go
ollama pull phi4:14b-fp16      # ≈ 29 Go (sans quantization)
→
Quale quantizzazione scegliere
Per Phi-4, Q4_K_M resta il miglior compromesso su hardware di uso comune. La differenza rispetto a Q5_K_M è marginale in pratica su questo modello, e Q8_0 richiede 15 GB di VRAM per un guadagno qualitativo difficile da percepire fuori dai benchmark.

#3. Prime prove: matematica, codice, ragionamento

Avvia una sessione interattiva per verificare che il modello funzioni e testarne i punti di forza.

Sessione
ollama run phi4

Dovresti vedere un prompt `>>>`. È lì che Phi-4 si distingue: gli esercizi logici e tecnici. Alcuni prompt rivelatori:

Test di matematica
>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?

Phi-4 sviluppa il ragionamento passo dopo passo e arriva al risultato. Per il codice, gestisce senza problemi Python e JavaScript standard.

Codice di test
>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.
i
Velocità prevista
Su RTX 4070 (12 GB) in Q4_K_M, aspettati 45–60 tok/sec. Su RTX 3060 (12 GB), 25–35 tok/sec. Su Mac M2 24 GB, 20–30 tok/sec. Su CPU Ryzen 5 5600X, 4–6 tok/sec.

#4. Qualità del francese: i veri punti deboli

È qui che Phi-4 mostra i suoi limiti. Il modello è stato addestrato principalmente su testi in inglese (e su molti dati sintetici generati in inglese). Il francese è presente nel corpus, ma ha chiaramente un ruolo secondario.

Grammatica e concordanze
Buoni con frasi semplici, ma errori di concordanza, anglicismi e costruzioni pesanti non appena si richiede la stesura di testi lunghi.
Terminologia tecnica FR
Tendenza a usare termini in inglese ("endpoint", "deployment", "thread") anche quando esiste un equivalente francese comune.
Comprensione
Capisce molto bene un prompt in francese. Il problema è la produzione.
Codice commentato in FR
I commenti nel codice passano spesso all'inglese durante la generazione. Dai l'istruzione esplicitamente: aiuta, ma non risolve tutto.
Cultura FR
Scarsa. Conoscenza superficiale della giurisprudenza, della storia o delle istituzioni francesi. Tutt'altro che un modello per redigere una nota giuridica in francese.
!
Il verdetto per il francese
Per scrivere testi corretti in francese, preferisci Mistral Small 24B (generalista, valido in francese) o, su una macchina più modesta, Qwen 3.5 9B — nettamente più a suo agio in francese rispetto a Phi-4. Phi-4 rimane eccellente per compiti in cui l'output è codice o ragionamento strutturato — e in cui la lingua di interazione conta poco.

Un accorgimento che aiuta un po': un prompt di sistema rigoroso costringe il modello a restare in francese, al prezzo di risposte talvolta più brevi.

Prompt di sistema FR
>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."

#5. Phi-4-Mini: la versione 3.8B

Microsoft ha pubblicato contemporaneamente Phi-4-Mini, una variante da 3,8B destinata a configurazioni estremamente limitate: laptop senza GPU dedicata, Raspberry Pi 5, dispositivi edge. Con 2,5 GB in Q4, funziona su qualsiasi macchina moderna.

Installazione
ollama pull phi4-mini
VRAM/RAM necessaria
≈ 2,5 GB in Q4_K_M. Funziona su un MacBook Air M1 con 8 GB o su un PC con una GPU da 4 GB.
Velocità
Molto veloce. 80+ tok/sec sull'RTX 3060, 30+ tok/sec su CPU recente.
Punti di forza
Segue bene le istruzioni brevi, va bene per aiutare con i prompt, per la riformulazione semplice e per la classificazione.
Debolezze
Il ragionamento complesso e il codice lungo sono al di fuori delle sue capacità. È un modello di supporto, non un sostituto della versione 14B.
→
Casi d'uso di Phi-4-Mini
Eccellente da collegare a valle di un workflow n8n locale, per classificare le e-mail o integrare un LLM in uno script Python che deve essere veloce e leggero. Non consigliato per la chat generalista.

#6. Phi-4 vs Qwen 3.5 9B

Nel 2026, il concorrente diretto più rilevante è Qwen 3.5 9B di Alibaba. Un po' più compatto (6,6 GB in Q4 contro 9 GB per Phi-4), rientra nella memoria della stessa GPU da 12 GB e si rivolge alla stessa categoria di utenti. Ciò che li distingue:

Ragionamento e matematica
Phi-4 ha un vantaggio nei benchmark formali (GPQA, MATH). Nell'uso pratico su problemi comuni, il divario è minore di quanto si creda.
Codice
Qwen 3.5 9B è in generale migliore nei linguaggi meno comuni (Rust, Go, SQL avanzato). Phi-4 rimane competitivo in Python e JS.
Francese
Qwen 3.5 è nettamente migliore. Molti più dati multilingui nell’addestramento, vocabolario più ricco, meno passaggi all’inglese. Vantaggio netto per Qwen su questo criterio.
Contesto
Qwen 3.5 9B accetta fino a 256k token di contesto, Phi-4 si ferma a 16k. Se lavori su documenti lunghi, Qwen è molto più adatto.
Rispetto delle istruzioni
Phi-4 segue con maggiore precisione le istruzioni strutturate (formato JSON, vincoli rigorosi). Qwen è un po' più "creativo" e può prendersi delle libertà.
→
Come scegliere
Lavoro in inglese su ragionamento, codice Python, output strutturato: Phi-4. Lavoro in francese, contesto lungo, codice in più linguaggi: Qwen 3.5 9B. Su una GPU da 12 GB puoi comunque installarli entrambi e passare dall'uno all'altro in base all'attività.

#Risoluzione dei problemi

"Out of memory" al caricamento
La tua VRAM non è sufficiente per la quantizzazione scelta. Passa a Q4_K_M (la quantizzazione più leggera tra quelle utili), oppure lascia che Ollama esegua l'offload parziale sulla CPU con `ollama run phi4 --num-gpu N`, dove N è il numero di strati da caricare sulla GPU.
Generazione a 1–2 token/sec su una macchina dotata di GPU
Il modello è probabilmente in esecuzione sulla CPU. Controlla la colonna "PROCESSOR" con `ollama ps`. Se indica 100% CPU, libera VRAM (Chrome, giochi, altri modelli caricati) e rilancia il modello.
Risposte che passano all'inglese durante la generazione
Comportamento atteso con Phi-4 in francese. Rafforzare il prompt di sistema aiuta in parte. Per un uso ricorrente in lingua francese, cambia modello anziché continuare a far fatica.
Contesto troncato a 4096 token
Ollama carica di default un contesto breve. Estendilo esplicitamente: `/set parameter num_ctx 16384`. Al di là, Phi-4 è stato addestrato fino a 16k soltanto — non ha senso spingere oltre.
Il modello inventa fatti recenti
Le conoscenze di Phi-4 sono ferme alla data del suo addestramento (fine 2024) e la sua cultura generale è meno ampia rispetto a quella di modelli più grandi. Per informazioni fattuali aggiornate, serve una pipeline RAG, non il modello da solo.

#Per approfondire

Phi-4 è un buon punto di partenza per i LLM 14B in locale. Alcuni spunti per sfruttare ulteriormente la tua installazione:

Provare un concorrente diretto
La guida ai test di Qwen 3 presenta benchmark comparabili su hardware di fascia consumer, utili per fare un confronto con i tuoi prompt.
Scegliere la quantizzazione giusta
La guida "Scegliere la quantizzazione (Q4, Q5, Q8, FP16)" spiega i compromessi qualità/memoria che si applicano anche a Phi-4.
Eseguire Phi-4 senza GPU
Se usi solo la CPU, la guida "Eseguire un LLM localmente senza GPU" integra quanto descritto qui con ottimizzazioni specifiche.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.