LLM in locale su iPhone e iPad: app e modelli che funzionano vraiment
Eseguire un LLM locale su iPhone è possibile e funziona davvero: i chip Apple Silicon (serie A e M) e il framework MLX permettono di eseguire modelli da 1 a 8 miliardi di parametri offline, direttamente sul dispositivo. Questa guida individua le app che mantengono le promesse, spiega quale differenza faccia davvero la RAM a seconda del tuo iPhone o iPad e fornisce riferimenti concreti sulle prestazioni, senza marketing.
#Perché eseguire un LLM locale su iPhone
Un LLM locale su iOS esegue tutti i calcoli sul tuo dispositivo: nessun server, nessun abbonamento, nessun dato che lascia il telefono. È l'opposto di un'app come ChatGPT, che invia ogni messaggio al cloud. I motivi per desiderare questa soluzione sono concreti: privacy totale (note mediche, bozze, codice), funzionamento in aereo o senza rete e zero costi ricorrenti una volta scaricato il modello.
Il compromesso è reale: un iPhone non ha né la memoria né la potenza di un PC dotato di RTX 4070. Non si può eseguire un modello da 70B in tasca. Ma un modello da 3B correttamente quantizzato basta ampiamente per riassumere un testo, riformulare un'email, rispondere a domande semplici o tradurre — tutto offline e immediatamente accessibile.
#Apple Silicon, MLX e Neural Engine
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Gli iPhone e gli iPad moderni condividono l'architettura Apple Silicon con i Mac: un chip di sistema (serie A su iPhone, serie M su iPad Pro) e soprattutto una memoria unificata condivisa tra CPU, GPU e Neural Engine. È questo pool di RAM comune che rende possibile l'inferenza LLM sui dispositivi mobili — il modello viene caricato una sola volta ed è accessibile da tutti i core senza copie.
MLX è il framework di machine learning di Apple, progettato per questa memoria unificata. Le app iOS serie lo usano (oppure usano llama.cpp compilato con Metal) per sfruttare la GPU del chip. È lì che viene eseguita la maggior parte dei calcoli di inferenza: sulla GPU tramite Metal, non sulla sola CPU.
- Memoria unificata
- CPU, GPU e ANE condividono la stessa RAM. È il fattore limitante numero 1 per la dimensione del modello che puoi caricare.
- GPU Metal
- Esegue l'inferenza tramite MLX o llama.cpp. È ciò che determina quanti token al secondo ottieni.
- Neural Engine (ANE)
- Potente ma specializzato. Ancora poco utilizzato per la generazione di testo LLM.
#Prerequisiti e RAM per dispositivo
Su iOS, la RAM è il solo valore che conta davvero, e Apple non la mette in evidenza. Tuttavia, è proprio essa che decide se un modello si carica o causa il crash dell'app. Ecco i riferimenti per i dispositivi recenti.
- iPhone 15 / 15 Plus
- 6 GB di RAM. Una dotazione adeguata per modelli da 1B a 3B in Q4. Un 3B funziona, un 7B è al limite e lascia poco margine al sistema.
- iPhone 15 Pro / 16 / 16 Pro
- 8 GB. Il punto ottimale per i dispositivi mobili: 3B fluido, 7B–8B utilizzabile in Q4 con un contesto moderato.
- iPhone 17 Pro
- 12 GB (gamma Pro recente). Margine concreto per usare comodamente un modello 7B–8B e contesti più lunghi.
- iPad Pro M4
- 16 GB o più a seconda della configurazione. La scelta migliore per iOS: un 8B gira fluidamente e diventano praticabili anche modelli più grandi.
Gli ordini di grandezza della memoria necessaria per un modello quantizzato Q4 sono gli stessi che su un computer desktop: un 3B pesa circa 2 GB, un 7B circa 5 GB, un 8B un po' di più. Aggiungi la memoria del contesto (KV cache), che aumenta con la lunghezza della conversazione. Ecco perché un contesto lungo può far arrestare un'app che inizialmente si avviava senza problemi.
#Le app iOS che funzionano
L'App Store è pieno di app «IA» che sono solo interfacce verso il cloud. Per un vero utilizzo locale, serve un'app che scarichi il modello sul dispositivo e lo esegua con MLX o llama.cpp. Ecco le opzioni affidabili.
- PocketPal AI
- Gratuita e open source. Scarica modelli GGUF da Hugging Face e li esegue tramite llama.cpp. Interfaccia chat semplice, impostazioni di contesto e temperatura. Il punto di partenza raccomandato.
- LLM Farm
- Open source, altamente configurabile. Supporta numerosi formati e permette di regolare con precisione l'inferenza. Più tecnica, ideale per testare diversi modelli.
- Enclave / app basate su MLX
- Applicazioni basate su MLX, il framework Apple. Buone prestazioni sui chip Apple Silicon recenti, spesso orientate alla privacy.
- Private LLM
- App a pagamento, offre modelli quantizzati ottimizzati e un'esperienza pronta all'uso. Nessuna configurazione da fare, tutto è già incluso nel pacchetto.
#Installare e avviare un modello: passo dopo passo
L'esempio qui sotto utilizza PocketPal AI, un'app gratuita e rappresentativa del flusso generale. La logica è la stessa nelle altre app.
- 01Installare l'appScarica PocketPal AI dall'App Store. Nessun account richiesto, nessuna connessione a un server.
- 02Scegliere un modelloApri la libreria dei modelli integrata. L'app propone modelli adatti ai dispositivi mobili (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Inizia con un modello piccolo: un 2B o 3B in Q4.
- 03ScaricareAvvia il download (da qualche centinaio di MB a circa 2 GB, a seconda delle dimensioni). Fallo tramite Wi-Fi. Il file rimane memorizzato localmente sul dispositivo.
- 04Caricare il modelloSeleziona il modello scaricato per caricarlo in memoria. Se l'app si chiude a questo punto, la RAM è insufficiente: scegli un modello più piccolo o chiudi le altre app.
- 05Discutere offlineApri una chat e fai una domanda. Attiva la modalità aereo per verificare: tutto continua a funzionare, la prova che nulla esce dal dispositivo.
Per i curiosi che vogliono l'approccio più spartano, è anche possibile compilare llama.cpp autonomamente, ma iOS non permette di eseguire codice arbitrario al di fuori di un'app firmata: in pratica, passare per un'app dedicata è l'unica strada realistica per la grande maggioranza degli utenti.
#Quali modelli scegliere in base alla RAM
Il modello giusto dipende innanzitutto dal tuo dispositivo. Ecco alcune raccomandazioni concrete, dal modello più modesto al più potente, tutti con quantizzazione Q4.
- iPhone 15 / 15 Plus (6 GB)
- Qwen 3.5 2B (1,9 GB) o Granite 4.2 3B (2,2 GB) per la fluidità; Qwen 3.5 4B (3,4 GB) per una qualità maggiore. Mantieni contesti brevi.
- iPhone 16 / 16 Pro (8 GB)
- Un modello da 3B–4B per un uso quotidiano fluido. Un modello da 8B–9B (Granite 4.2 8B a 5,3 GB, Qwen 3.5 9B a 6,6 GB, 256k ctx e visione) funziona in Q4 con un contesto moderato — più lento ma decisamente più capace.
- iPhone 17 Pro (12 GB)
- Modelli da 8B–9B utilizzabili comodamente, contesti più lunghi e Qwen 3.5 9B in Q8 (11 GB) per la massima qualità nella fascia.
- iPad Pro M4 (16 GB+)
- Qwen 3.5 9B è fluido nell'uso reale; si possono provare modelli fino a ~12B (Gemma 4 12B, multimodale, 7,6 GB), con una velocità che resta discreta grazie alla GPU M4.
In francese, Gemma 4 e i modelli Qwen 3.5 se la cavano bene per le loro dimensioni. Per riassunti, riformulazioni e risposte brevi basta un modello 3B. Per attività di ragionamento o programmazione più impegnative, i limiti dei dispositivi mobili si fanno sentire presto: è il momento di passare a un computer a casa.
#Confidenzialità totale: nulla esce dall'apparecchio
È l'argomento decisivo a favore dell'IA locale sui dispositivi mobili. Una volta scaricato il modello, non è necessaria alcuna richiesta di rete per conversare. I tuoi prompt, i tuoi documenti e le tue bozze restano sull'iPhone. Nessuna telemetria delle conversazioni, nessun addestramento sui tuoi dati, nessun rischio di fuga di dati dal server.
- Verifica in modalità aereo
- Il test più semplice: disattiva tutte le connessioni di rete e verifica che la chat funzioni ancora. Se funziona offline, non viene trasmesso nulla.
- Attenzione alle app ibride
- Alcune app «IA» passano al cloud senza segnalarlo quando il modello locale fallisce. Preferisci app locali al 100% e open source per eliminare ogni dubbio.
- Dati sensibili
- Appunti sulla salute, documenti professionali soggetti a NDA, informazioni personali: l'elaborazione locale è l'unico modo per essere certo che non lascino mai il tuo dispositivo.
#Risoluzione dei problemi e consigli
- L'app va in crash durante il caricamento del modello
- RAM insufficiente. Chiudi tutte le altre app, scegli un modello più piccolo (3B invece di 7B) o una quantizzazione più leggera (Q4 invece di Q5/Q8).
- Risposte molto lente
- Riduci la lunghezza del contesto e il numero di token generati. Controlla anche la temperatura: un iPhone caldo entra in throttling termico e rallenta l'inferenza.
- L'iPhone si scalda e la batteria si scarica rapidamente
- L'inferenza sfrutta la GPU a pieno regime. È normale durante le sessioni lunghe. Fai delle pause, evita di generare continuamente e tieni il dispositivo collegato all'alimentazione durante l'uso intensivo.
- Il modello dà risposte fuori tema
- È normale per un modello molto piccolo alle prese con un compito complesso. Semplifica la richiesta o passa a un modello di una taglia superiore se la tua RAM lo permette.
- Download bloccato
- I file GGUF sono voluminosi. Mantieni la connessione Wi-Fi ed evita di mettere l'app in background durante il download.
#Per approfondire
Un dispositivo mobile è perfetto per l'uso in mobilità e per tutelare la riservatezza, ma per i compiti più pesanti vorrai una vera macchina. Queste guide del sito approfondiscono gli argomenti di questa guida:
- Eseguire un LLM localmente su Android
- L'equivalente su Android: PocketPal, MLC Chat e llama.cpp tramite Termux, con gli stessi vincoli di RAM.
- Installare Ollama su macOS (Apple Silicon)
- Per passare dal telefono al Mac: la memoria unificata degli M1/M2/M3/M4 permette di spingersi molto oltre, fino ai modelli 32B e oltre.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Capire perché Q4_K_M è il compromesso consigliato sia su mobile che su PC, e in quali casi passare a Q5 o Q8.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.