Principiante 10 minMobile

LLM in locale su iPhone e iPad: app e modelli che funzionano vraiment

Eseguire un LLM locale su iPhone è possibile e funziona davvero: i chip Apple Silicon (serie A e M) e il framework MLX permettono di eseguire modelli da 1 a 8 miliardi di parametri offline, direttamente sul dispositivo. Questa guida individua le app che mantengono le promesse, spiega quale differenza faccia davvero la RAM a seconda del tuo iPhone o iPad e fornisce riferimenti concreti sulle prestazioni, senza marketing.

Di Clara M.·Agg. 2026-08-27·Testato su macOS 14+

#Perché eseguire un LLM locale su iPhone

Un LLM locale su iOS esegue tutti i calcoli sul tuo dispositivo: nessun server, nessun abbonamento, nessun dato che lascia il telefono. È l'opposto di un'app come ChatGPT, che invia ogni messaggio al cloud. I motivi per desiderare questa soluzione sono concreti: privacy totale (note mediche, bozze, codice), funzionamento in aereo o senza rete e zero costi ricorrenti una volta scaricato il modello.

Il compromesso è reale: un iPhone non ha né la memoria né la potenza di un PC dotato di RTX 4070. Non si può eseguire un modello da 70B in tasca. Ma un modello da 3B correttamente quantizzato basta ampiamente per riassumere un testo, riformulare un'email, rispondere a domande semplici o tradurre — tutto offline e immediatamente accessibile.

i
Ciò che è realistico sui dispositivi mobili
Punta su modelli da 1B a 8B con quantizzazione Q4. Al di sotto di 1B, la qualità crolla; al di sopra di 8B, solo gli iPad Pro e gli iPhone recenti di fascia alta riescono a reggere, e comunque lentamente.

#Apple Silicon, MLX e Neural Engine

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Gli iPhone e gli iPad moderni condividono l'architettura Apple Silicon con i Mac: un chip di sistema (serie A su iPhone, serie M su iPad Pro) e soprattutto una memoria unificata condivisa tra CPU, GPU e Neural Engine. È questo pool di RAM comune che rende possibile l'inferenza LLM sui dispositivi mobili — il modello viene caricato una sola volta ed è accessibile da tutti i core senza copie.

MLX è il framework di machine learning di Apple, progettato per questa memoria unificata. Le app iOS serie lo usano (oppure usano llama.cpp compilato con Metal) per sfruttare la GPU del chip. È lì che viene eseguita la maggior parte dei calcoli di inferenza: sulla GPU tramite Metal, non sulla sola CPU.

!
Cosa non fa (ancora) il Neural Engine
Spesso si crede che la Neural Engine (ANE) acceleri i LLM. In pratica, oggi la generazione di testo token per token avviene soprattutto sulla GPU tramite Metal, con MLX o llama.cpp. L'ANE eccelle nei modelli a grafo fisso (visione, Face ID), meno nella generazione autoregressiva. Non contarci per i tuoi token/sec.
Memoria unificata
CPU, GPU e ANE condividono la stessa RAM. È il fattore limitante numero 1 per la dimensione del modello che puoi caricare.
GPU Metal
Esegue l'inferenza tramite MLX o llama.cpp. È ciò che determina quanti token al secondo ottieni.
Neural Engine (ANE)
Potente ma specializzato. Ancora poco utilizzato per la generazione di testo LLM.

#Prerequisiti e RAM per dispositivo

Su iOS, la RAM è il solo valore che conta davvero, e Apple non la mette in evidenza. Tuttavia, è proprio essa che decide se un modello si carica o causa il crash dell'app. Ecco i riferimenti per i dispositivi recenti.

iPhone 15 / 15 Plus
6 GB di RAM. Una dotazione adeguata per modelli da 1B a 3B in Q4. Un 3B funziona, un 7B è al limite e lascia poco margine al sistema.
iPhone 15 Pro / 16 / 16 Pro
8 GB. Il punto ottimale per i dispositivi mobili: 3B fluido, 7B–8B utilizzabile in Q4 con un contesto moderato.
iPhone 17 Pro
12 GB (gamma Pro recente). Margine concreto per usare comodamente un modello 7B–8B e contesti più lunghi.
iPad Pro M4
16 GB o più a seconda della configurazione. La scelta migliore per iOS: un 8B gira fluidamente e diventano praticabili anche modelli più grandi.
→
Regola pratica per la memoria
iOS non permette a un'app di monopolizzare tutta la RAM. Considera che un'app di terze parti dispone all'incirca di una quota compresa tra metà e due terzi della RAM fisica. Su un iPhone con 8 GB di RAM, prevedi realisticamente circa 4–5 GB per il modello — un 7B in Q4 ci sta a fatica, mentre un 3B ci sta con ampio margine.

Gli ordini di grandezza della memoria necessaria per un modello quantizzato Q4 sono gli stessi che su un computer desktop: un 3B pesa circa 2 GB, un 7B circa 5 GB, un 8B un po' di più. Aggiungi la memoria del contesto (KV cache), che aumenta con la lunghezza della conversazione. Ecco perché un contesto lungo può far arrestare un'app che inizialmente si avviava senza problemi.

#Le app iOS che funzionano

L'App Store è pieno di app «IA» che sono solo interfacce verso il cloud. Per un vero utilizzo locale, serve un'app che scarichi il modello sul dispositivo e lo esegua con MLX o llama.cpp. Ecco le opzioni affidabili.

PocketPal AI
Gratuita e open source. Scarica modelli GGUF da Hugging Face e li esegue tramite llama.cpp. Interfaccia chat semplice, impostazioni di contesto e temperatura. Il punto di partenza raccomandato.
LLM Farm
Open source, altamente configurabile. Supporta numerosi formati e permette di regolare con precisione l'inferenza. Più tecnica, ideale per testare diversi modelli.
Enclave / app basate su MLX
Applicazioni basate su MLX, il framework Apple. Buone prestazioni sui chip Apple Silicon recenti, spesso orientate alla privacy.
Private LLM
App a pagamento, offre modelli quantizzati ottimizzati e un'esperienza pronta all'uso. Nessuna configurazione da fare, tutto è già incluso nel pacchetto.
i
GGUF, il formato di file dei modelli
La maggior parte di queste app carica file GGUF — il formato di llama.cpp. Scegli la quantizzazione all'atto del download: Q4_K_M è il migliore compromesso tra dimensione e qualità, esattamente come su PC. Evita il FP16 su mobile, troppo pesante.

#Installare e avviare un modello: passo dopo passo

L'esempio qui sotto utilizza PocketPal AI, un'app gratuita e rappresentativa del flusso generale. La logica è la stessa nelle altre app.

  1. 01
    Installare l'app
    Scarica PocketPal AI dall'App Store. Nessun account richiesto, nessuna connessione a un server.
  2. 02
    Scegliere un modello
    Apri la libreria dei modelli integrata. L'app propone modelli adatti ai dispositivi mobili (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Inizia con un modello piccolo: un 2B o 3B in Q4.
  3. 03
    Scaricare
    Avvia il download (da qualche centinaio di MB a circa 2 GB, a seconda delle dimensioni). Fallo tramite Wi-Fi. Il file rimane memorizzato localmente sul dispositivo.
  4. 04
    Caricare il modello
    Seleziona il modello scaricato per caricarlo in memoria. Se l'app si chiude a questo punto, la RAM è insufficiente: scegli un modello più piccolo o chiudi le altre app.
  5. 05
    Discutere offline
    Apri una chat e fai una domanda. Attiva la modalità aereo per verificare: tutto continua a funzionare, la prova che nulla esce dal dispositivo.

Per i curiosi che vogliono l'approccio più spartano, è anche possibile compilare llama.cpp autonomamente, ma iOS non permette di eseguire codice arbitrario al di fuori di un'app firmata: in pratica, passare per un'app dedicata è l'unica strada realistica per la grande maggioranza degli utenti.

#Quali modelli scegliere in base alla RAM

Il modello giusto dipende innanzitutto dal tuo dispositivo. Ecco alcune raccomandazioni concrete, dal modello più modesto al più potente, tutti con quantizzazione Q4.

iPhone 15 / 15 Plus (6 GB)
Qwen 3.5 2B (1,9 GB) o Granite 4.2 3B (2,2 GB) per la fluidità; Qwen 3.5 4B (3,4 GB) per una qualità maggiore. Mantieni contesti brevi.
iPhone 16 / 16 Pro (8 GB)
Un modello da 3B–4B per un uso quotidiano fluido. Un modello da 8B–9B (Granite 4.2 8B a 5,3 GB, Qwen 3.5 9B a 6,6 GB, 256k ctx e visione) funziona in Q4 con un contesto moderato — più lento ma decisamente più capace.
iPhone 17 Pro (12 GB)
Modelli da 8B–9B utilizzabili comodamente, contesti più lunghi e Qwen 3.5 9B in Q8 (11 GB) per la massima qualità nella fascia.
iPad Pro M4 (16 GB+)
Qwen 3.5 9B è fluido nell'uso reale; si possono provare modelli fino a ~12B (Gemma 4 12B, multimodale, 7,6 GB), con una velocità che resta discreta grazie alla GPU M4.
→
Piccolo e recente batte grande e vecchio
Un modello 3B recente (Granite 4.2 3B, Qwen 3.5 2B/4B, Gemma 4 E2B) risponde spesso meglio di un 7B più vecchio, consumando al contempo la metà della RAM. Su mobile, dai priorità alla generazione del modello rispetto alla sua dimensione pura.

In francese, Gemma 4 e i modelli Qwen 3.5 se la cavano bene per le loro dimensioni. Per riassunti, riformulazioni e risposte brevi basta un modello 3B. Per attività di ragionamento o programmazione più impegnative, i limiti dei dispositivi mobili si fanno sentire presto: è il momento di passare a un computer a casa.

#Confidenzialità totale: nulla esce dall'apparecchio

È l'argomento decisivo a favore dell'IA locale sui dispositivi mobili. Una volta scaricato il modello, non è necessaria alcuna richiesta di rete per conversare. I tuoi prompt, i tuoi documenti e le tue bozze restano sull'iPhone. Nessuna telemetria delle conversazioni, nessun addestramento sui tuoi dati, nessun rischio di fuga di dati dal server.

Verifica in modalità aereo
Il test più semplice: disattiva tutte le connessioni di rete e verifica che la chat funzioni ancora. Se funziona offline, non viene trasmesso nulla.
Attenzione alle app ibride
Alcune app «IA» passano al cloud senza segnalarlo quando il modello locale fallisce. Preferisci app locali al 100% e open source per eliminare ogni dubbio.
Dati sensibili
Appunti sulla salute, documenti professionali soggetti a NDA, informazioni personali: l'elaborazione locale è l'unico modo per essere certo che non lascino mai il tuo dispositivo.
i
Locale non vuol dire infallibile
Il modello non divulga i tuoi dati, ma può sbagliare (allucinazioni). Per decisioni importanti, mantieni uno sguardo critico — la riservatezza non è la stessa cosa dell'affidabilità.

#Risoluzione dei problemi e consigli

L'app va in crash durante il caricamento del modello
RAM insufficiente. Chiudi tutte le altre app, scegli un modello più piccolo (3B invece di 7B) o una quantizzazione più leggera (Q4 invece di Q5/Q8).
Risposte molto lente
Riduci la lunghezza del contesto e il numero di token generati. Controlla anche la temperatura: un iPhone caldo entra in throttling termico e rallenta l'inferenza.
L'iPhone si scalda e la batteria si scarica rapidamente
L'inferenza sfrutta la GPU a pieno regime. È normale durante le sessioni lunghe. Fai delle pause, evita di generare continuamente e tieni il dispositivo collegato all'alimentazione durante l'uso intensivo.
Il modello dà risposte fuori tema
È normale per un modello molto piccolo alle prese con un compito complesso. Semplifica la richiesta o passa a un modello di una taglia superiore se la tua RAM lo permette.
Download bloccato
I file GGUF sono voluminosi. Mantieni la connessione Wi-Fi ed evita di mettere l'app in background durante il download.

#Per approfondire

Un dispositivo mobile è perfetto per l'uso in mobilità e per tutelare la riservatezza, ma per i compiti più pesanti vorrai una vera macchina. Queste guide del sito approfondiscono gli argomenti di questa guida:

Eseguire un LLM localmente su Android
L'equivalente su Android: PocketPal, MLC Chat e llama.cpp tramite Termux, con gli stessi vincoli di RAM.
Installare Ollama su macOS (Apple Silicon)
Per passare dal telefono al Mac: la memoria unificata degli M1/M2/M3/M4 permette di spingersi molto oltre, fino ai modelli 32B e oltre.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Capire perché Q4_K_M è il compromesso consigliato sia su mobile che su PC, e in quali casi passare a Q5 o Q8.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.