LLM in locale su Android: PocketPal, MLC Chat (2026)
Un LLM locale su Android è un assistente che risponde offline, senza cloud, direttamente sul processore del tuo telefono. I modelli quantizzati da 1 a 4 miliardi di parametri oggi entrano nella RAM di uno smartphone di fascia media e rispondono a una velocità adeguata all'uso. Questa guida presenta tre approcci — PocketPal e MLC Chat per iniziare senza riga di comando, llama.cpp tramite Termux per andare oltre — con i vincoli reali in termini di velocità, riscaldamento e autonomia.
#Perché eseguire un LLM locale su Android
Eseguire un LLM in locale su Android risponde a tre esigenze concrete: la riservatezza totale (i tuoi prompt non lasciano mai il dispositivo), il funzionamento offline (in aereo, in zone senza copertura, quando il roaming è costoso) e la gratuità d'uso (nessun abbonamento né fatturazione per token). Il compromesso riguarda le dimensioni: un telefono esegue modelli molto più piccoli rispetto a un PC, quindi meno capaci. Ma per riassunti, riformulazioni, traduzioni o una semplice conversazione, un modello da 3B è più che sufficiente.
- Privacy
- Il modello viene eseguito sul SoC del telefono. Nessun dato viene inviato su Internet, cosa verificabile disattivando il Wi-Fi e i dati mobili.
- Offline
- Una volta scaricato il modello, tutto funziona in modalità aereo. Pratico in viaggio o in aree senza rete.
- Gratuito da usare
- Nessun account, nessuna quota di utilizzo, nessun costo per token. Paghi solo la batteria consumata.
- Limite da conoscere
- In pratica, uno smartphone arriva al massimo a circa 4 miliardi di parametri. Per ragionamenti complessi o per il codice, un LLM locale su PC resta nettamente superiore.
#Quale telefono serve
Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
Il fattore determinante è la RAM, esattamente come sui PC dove è la VRAM a limitare la dimensione del modello. Un modello quantizzato Q4 da 3B occupa circa 2 GB, ai quali si aggiunge la memoria del sistema e dell'applicazione. In pratica, serve un margine perché Android chiude aggressivamente le applicazioni che consumano troppo.
- RAM 6 GB
- Il minimo indispensabile. Modelli da 1B a 3B in Q4. Chiudi le altre applicazioni prima di avviare un'inferenza.
- RAM 8 GB
- Un uso agevole con modelli da 3B, possibile con modelli da 4B. Il punto di equilibrio ideale per gli smartphone recenti di fascia media.
- RAM 12 GB e oltre
- Smartphone recenti di fascia alta. Consentono di eseguire senza problemi modelli da 4B, o persino modelli da 7B con quantizzazione aggressiva, ma lentamente.
- Archiviazione
- Prevedi da 2 a 5 GB liberi per ogni modello scaricato. I file GGUF sono voluminosi.
- SoC
- Uno Snapdragon della serie 8 o un equivalente recente accelera notevolmente l'esecuzione. I chip di fascia bassa funzionano, ma restano lenti.
#PocketPal: un LLM locale in 5 minuti
PocketPal AI è l'applicazione più semplice per iniziare. È un progetto open source disponibile su Play Store che integra llama.cpp e un catalogo di modelli scaricabili direttamente da Hugging Face, senza alcuna riga di comando.
- 01Installare l'applicazioneCerca « PocketPal AI » sul Google Play Store e installala. L'app è gratuita e open source (codice disponibile su GitHub).
- 02Aprire il catalogo dei modelliNella scheda Models, scorri la lista dei modelli consigliati. PocketPal indica la dimensione del file e segnala quelli adatti alla tua RAM.
- 03Scaricare un modello da 1 a 4BScegli un modello piccolo per iniziare, ad esempio un Qwen 3.5 2B (~1,9 GB) o un Granite 4.2 3B (~2,2 GB) con quantizzazione Q4. Il download avviene tramite la rete, una sola volta.
- 04Caricare e chattarePremi Load accanto al modello scaricato, attendi il caricamento in memoria, poi apri la chat. La prima risposta inizia dopo alcuni secondi di riscaldamento.
PocketPal permette anche di regolare i parametri di inferenza (temperatura, dimensione del contesto, numero di thread CPU) e di importare i tuoi file GGUF se vuoi un modello non presente nel catalogo. Per la prima esperienza con un LLM locale su Android, è il percorso più breve.
#MLC Chat e l'accelerazione GPU
MLC Chat è l'applicazione dimostrativa del progetto MLC LLM, che compila i modelli per sfruttare la GPU mobile tramite l'API Vulkan/OpenCL anziché eseguire tutto sulla CPU. Su un SoC recente, questo può aumentare la velocità e ridurre un po' il consumo rispetto a un'esecuzione esclusivamente sulla CPU.
- 01Recuperare l'APKMLC Chat non è sempre disponibile sul Play Store. Scarica l'APK ufficiale dal sito del progetto MLC LLM (llm.mlc.ai) e autorizza l'installazione da una fonte esterna.
- 02Scarica un modello compilatoL'app offre modelli già convertiti nel formato MLC (Gemma, Qwen, Granite in versioni ridotte). Scegliene uno adatto alla tua RAM.
- 03Avviare la chatSeleziona il modello, attendi l'inizializzazione, poi avvia la conversazione. MLC mostra la velocità in token al secondo nella parte inferiore dello schermo.
#llama.cpp tramite Termux per approfondire
Per un controllo totale — scegliere con precisione il modello e la quantizzazione, esporre un server locale — il percorso avanzato passa attraverso Termux, un emulatore di terminale Android che dà accesso a un ambiente Linux senza root. Al suo interno si compila llama.cpp e si avvia l'inferenza dalla riga di comando, come su un PC Linux.
- 01Installare e preparare TermuxInstalla Termux da F-Droid, apri il programma e aggiorna i pacchetti di base.
- 02Installare gli strumenti di buildRecupera il compilatore, git e cmake necessari per compilare llama.cpp.
- 03Compilare llama.cppClona il repository ufficiale e compilalo. Sui dispositivi mobili, la build per CPU (ARM NEON) è la più affidabile.
- 04Scaricare un modello GGUFScarica un file .gguf di piccole dimensioni (1–3B in Q4) da Hugging Face con curl o wget.
- 05Avviare l'inferenzaUsa llama-cli per parlare, o llama-server per esporre un'API compatibile con OpenAI su localhost accessibile da un browser.
La modalità server è interessante: espone un endpoint compatibile con OpenAI su localhost, che puoi interrogare dal browser del telefono o da un'altra app. È la stessa logica del server di Ollama su PC (che ascolta per impostazione predefinita sulla porta 11434), trasferita nella tua tasca.
#Quali modelli da 1 a 4B funzionano davvero
Tutto si gioca nella fascia da 1 a 4 miliardi di parametri, con quantizzazione Q4_K_M (il miglior compromesso tra qualità e dimensioni, come su PC). Oltre i 4B, un telefono diventa lento o non ha abbastanza RAM. Ecco le famiglie che danno i migliori risultati in francese.
- Qwen 3.5 2B
- Il piccolo modello di riferimento del 2026 (~1,9 GB in Q4). Eccellente nell'uso multilingue e in francese, contesto esteso, licenza Apache 2.0. Il miglior punto di partenza se cerchi velocità su un telefono da 6 GB.
- Qwen 3.5 4B
- Aumento della qualità (~3,4 GB in Q4) senza uscire dalla fascia mobile. Coerente e performante in Q4 se il tuo telefono ha 8 GB o più. Apache 2.0.
- Granite 4.2 3B
- Il piccolo modello di IBM (~2,2 GB in Q4), con un consumo di memoria molto contenuto ed efficiente nell'uso dei token. Un solido modello generalista offline quando la RAM è limitata. Apache 2.0.
- Gemma 4 E2B
- La versione compatta di Google (~4,3 GB), multimodale e tornata sotto licenza Apache 2.0 da aprile 2026. Da riservare ai telefoni con almeno 8 GB.
#Velocità, calore e batteria: cosa bisogna sapere
L'inferenza LLM sfrutta al massimo la CPU (o la GPU), con tre conseguenze molto concrete su un telefono: la velocità resta modesta, il dispositivo si scalda e la batteria si scarica rapidamente durante la generazione. Nulla che ne impedisca l'uso, ma occorre tenere presenti gli ordini di grandezza.
- Velocità
- Aspettati circa 5–15 token al secondo per un modello 3B Q4 su un SoC di fascia medio-alta. Il testo si può leggere in tempo reale, ma le prestazioni restano lontane da quelle di una GPU per PC. Un modello 1B è nettamente più veloce.
- Aumento della temperatura e throttling
- Dopo una lunga generazione, il SoC si riscalda e limita le proprie prestazioni (throttling), rallentando le risposte successive. Lascialo raffreddare tra due richieste lunghe.
- Batteria
- Una sessione intensa può far scendere il livello della batteria di diversi punti percentuali in pochi minuti. Per un uso occasionale non è un problema; per un uso intensivo, collega il caricatore.
- Contesto
- Più è grande la finestra di contesto, più aumentano la memoria necessaria e il tempo di elaborazione. Su mobile, mantieni un contesto ragionevole (2k-4k token) per mantenere un funzionamento fluido.
#Risoluzione dei problemi
- L'app si chiude durante il caricamento del modello
- RAM insufficiente. Chiudi tutte le altre applicazioni, scegli un modello più piccolo (1B invece di 3B) o una quantizzazione più leggera.
- Risposte molto lente
- Riduci la dimensione del contesto, diminuisci il numero di token generati oppure passa a un modello più piccolo. Verifica anche che il telefono non stia riducendo le prestazioni a causa del calore.
- Termux: comando non trovato dopo la compilazione
- La build è fallita senza segnalare errori. Rilancia la compilazione e leggi gli errori. Verifica che git, cmake e clang siano correttamente installati.
- Termux abbandonato / pacchetti obsoleti
- Hai installato la versione Play Store. Disinstallala e reinstalla Termux da F-Droid o GitHub.
- Risposte incoerenti
- È normale per un modello molto piccolo alle prese con un compito complesso. Semplifica la richiesta, oppure accetta che un modello da 1-3B abbia dei limiti di ragionamento.
#Per approfondire
Una volta che avrai preso confidenza con l'uso su smartphone, probabilmente vorrai una macchina più potente a casa per le attività più impegnative. Queste guide del sito completano questa guida:
- Eseguire un LLM in locale senza GPU (solo CPU)
- La stessa logica dei dispositivi mobili, ma su PC: modelli consigliati in base alla RAM e trucchi per velocizzare l'esecuzione usando solo la CPU.
- Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
- Capire perché Q4_K_M è il compromesso consigliato, sia su telefono che su PC.
- Installare Ollama
- Per un vero server LLM a casa, interrogabile dal tuo telefono tramite rete locale.
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.