Principiante 10 minMobile

LLM in locale su Android: PocketPal, MLC Chat (2026)

Un LLM locale su Android è un assistente che risponde offline, senza cloud, direttamente sul processore del tuo telefono. I modelli quantizzati da 1 a 4 miliardi di parametri oggi entrano nella RAM di uno smartphone di fascia media e rispondono a una velocità adeguata all'uso. Questa guida presenta tre approcci — PocketPal e MLC Chat per iniziare senza riga di comando, llama.cpp tramite Termux per andare oltre — con i vincoli reali in termini di velocità, riscaldamento e autonomia.

Di Léa B.·Agg. 2026-08-27·Testato su Windows, macOS e Linux

#Perché eseguire un LLM locale su Android

Eseguire un LLM in locale su Android risponde a tre esigenze concrete: la riservatezza totale (i tuoi prompt non lasciano mai il dispositivo), il funzionamento offline (in aereo, in zone senza copertura, quando il roaming è costoso) e la gratuità d'uso (nessun abbonamento né fatturazione per token). Il compromesso riguarda le dimensioni: un telefono esegue modelli molto più piccoli rispetto a un PC, quindi meno capaci. Ma per riassunti, riformulazioni, traduzioni o una semplice conversazione, un modello da 3B è più che sufficiente.

Privacy
Il modello viene eseguito sul SoC del telefono. Nessun dato viene inviato su Internet, cosa verificabile disattivando il Wi-Fi e i dati mobili.
Offline
Una volta scaricato il modello, tutto funziona in modalità aereo. Pratico in viaggio o in aree senza rete.
Gratuito da usare
Nessun account, nessuna quota di utilizzo, nessun costo per token. Paghi solo la batteria consumata.
Limite da conoscere
In pratica, uno smartphone arriva al massimo a circa 4 miliardi di parametri. Per ragionamenti complessi o per il codice, un LLM locale su PC resta nettamente superiore.
i
Locale sul telefono ≠ locale sul PC
Non confrontare un modello 3B su smartphone con GPT-4. Confrontalo con ciò che un assistente offline può fare: riformulare un messaggio, riassumere un testo incollato, rispondere a una domanda di cultura generale. In questo contesto, è sorprendente. Oltre questi usi, mostra rapidamente i suoi limiti.

#Quale telefono serve

Il kit IA Locale

Il tuo ChatGPT privato e gratuito sulla tua macchina in 1 ora — LM Studio, Ollama, Open WebUI, i tuoi documenti, senza cloud.

  • Spazio online a vita
  • PDF + file
  • Aggiornamenti a vita

Il fattore determinante è la RAM, esattamente come sui PC dove è la VRAM a limitare la dimensione del modello. Un modello quantizzato Q4 da 3B occupa circa 2 GB, ai quali si aggiunge la memoria del sistema e dell'applicazione. In pratica, serve un margine perché Android chiude aggressivamente le applicazioni che consumano troppo.

RAM 6 GB
Il minimo indispensabile. Modelli da 1B a 3B in Q4. Chiudi le altre applicazioni prima di avviare un'inferenza.
RAM 8 GB
Un uso agevole con modelli da 3B, possibile con modelli da 4B. Il punto di equilibrio ideale per gli smartphone recenti di fascia media.
RAM 12 GB e oltre
Smartphone recenti di fascia alta. Consentono di eseguire senza problemi modelli da 4B, o persino modelli da 7B con quantizzazione aggressiva, ma lentamente.
Archiviazione
Prevedi da 2 a 5 GB liberi per ogni modello scaricato. I file GGUF sono voluminosi.
SoC
Uno Snapdragon della serie 8 o un equivalente recente accelera notevolmente l'esecuzione. I chip di fascia bassa funzionano, ma restano lenti.
→
Verifica la tua RAM effettiva
La RAM dichiarata non è tutta disponibile: il sistema ne riserva una parte. Su un telefono da 8 GB, considera da 5 a 6 GB realmente allocabili a un'applicazione. È il margine utile per caricare un modello.

#PocketPal: un LLM locale in 5 minuti

PocketPal AI è l'applicazione più semplice per iniziare. È un progetto open source disponibile su Play Store che integra llama.cpp e un catalogo di modelli scaricabili direttamente da Hugging Face, senza alcuna riga di comando.

  1. 01
    Installare l'applicazione
    Cerca « PocketPal AI » sul Google Play Store e installala. L'app è gratuita e open source (codice disponibile su GitHub).
  2. 02
    Aprire il catalogo dei modelli
    Nella scheda Models, scorri la lista dei modelli consigliati. PocketPal indica la dimensione del file e segnala quelli adatti alla tua RAM.
  3. 03
    Scaricare un modello da 1 a 4B
    Scegli un modello piccolo per iniziare, ad esempio un Qwen 3.5 2B (~1,9 GB) o un Granite 4.2 3B (~2,2 GB) con quantizzazione Q4. Il download avviene tramite la rete, una sola volta.
  4. 04
    Caricare e chattare
    Premi Load accanto al modello scaricato, attendi il caricamento in memoria, poi apri la chat. La prima risposta inizia dopo alcuni secondi di riscaldamento.

PocketPal permette anche di regolare i parametri di inferenza (temperatura, dimensione del contesto, numero di thread CPU) e di importare i tuoi file GGUF se vuoi un modello non presente nel catalogo. Per la prima esperienza con un LLM locale su Android, è il percorso più breve.

→
Disattiva la connessione di rete per fare una prova
Una volta caricato il modello, attiva la modalità aereo e avvia una conversazione. Funziona: è la prova concreta che l'inferenza è locale al 100 %, senza alcuna chiamata di rete.

#MLC Chat e l'accelerazione GPU

MLC Chat è l'applicazione dimostrativa del progetto MLC LLM, che compila i modelli per sfruttare la GPU mobile tramite l'API Vulkan/OpenCL anziché eseguire tutto sulla CPU. Su un SoC recente, questo può aumentare la velocità e ridurre un po' il consumo rispetto a un'esecuzione esclusivamente sulla CPU.

  1. 01
    Recuperare l'APK
    MLC Chat non è sempre disponibile sul Play Store. Scarica l'APK ufficiale dal sito del progetto MLC LLM (llm.mlc.ai) e autorizza l'installazione da una fonte esterna.
  2. 02
    Scarica un modello compilato
    L'app offre modelli già convertiti nel formato MLC (Gemma, Qwen, Granite in versioni ridotte). Scegliene uno adatto alla tua RAM.
  3. 03
    Avviare la chat
    Seleziona il modello, attendi l'inizializzazione, poi avvia la conversazione. MLC mostra la velocità in token al secondo nella parte inferiore dello schermo.
i
GPU mobile: il guadagno non è garantito
L'accelerazione GPU dipende molto dal SoC e dai driver. Su alcuni telefoni MLC è più veloce di llama.cpp su CPU, su altri è l'inverso a causa del calore e del throttling. Provali entrambi sul tuo dispositivo prima di trarre conclusioni.

#llama.cpp tramite Termux per approfondire

Per un controllo totale — scegliere con precisione il modello e la quantizzazione, esporre un server locale — il percorso avanzato passa attraverso Termux, un emulatore di terminale Android che dà accesso a un ambiente Linux senza root. Al suo interno si compila llama.cpp e si avvia l'inferenza dalla riga di comando, come su un PC Linux.

!
Installa Termux da F-Droid, non dal Play Store
La versione del Play Store è obsoleta e abbandonata. Installa Termux da F-Droid o GitHub per avere i pacchetti aggiornati. È la fonte di errori più frequente tra i principianti.
  1. 01
    Installare e preparare Termux
    Installa Termux da F-Droid, apri il programma e aggiorna i pacchetti di base.
  2. 02
    Installare gli strumenti di build
    Recupera il compilatore, git e cmake necessari per compilare llama.cpp.
  3. 03
    Compilare llama.cpp
    Clona il repository ufficiale e compilalo. Sui dispositivi mobili, la build per CPU (ARM NEON) è la più affidabile.
  4. 04
    Scaricare un modello GGUF
    Scarica un file .gguf di piccole dimensioni (1–3B in Q4) da Hugging Face con curl o wget.
  5. 05
    Avviare l'inferenza
    Usa llama-cli per parlare, o llama-server per esporre un'API compatibile con OpenAI su localhost accessibile da un browser.
Termux — preparazione
# Mettre à jour les paquets
pkg update && pkg upgrade -y

# Outils de compilation
pkg install -y git cmake clang wget
Termux — compilare llama.cpp
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
Termux — scaricare un modello e conversare
# Exemple : un petit modèle Q4 depuis Hugging Face
wget -O qwen3.5-2b-q4.gguf "<URL_DU_FICHIER_GGUF>"

# Discuter en ligne de commande
./build/bin/llama-cli -m qwen3.5-2b-q4.gguf -p "Résume ce texte : ..." -n 256
Termux — server locale compatibile con OpenAI
# Expose une API sur http://localhost:8080
./build/bin/llama-server -m qwen3.5-2b-q4.gguf --port 8080

La modalità server è interessante: espone un endpoint compatibile con OpenAI su localhost, che puoi interrogare dal browser del telefono o da un'altra app. È la stessa logica del server di Ollama su PC (che ascolta per impostazione predefinita sulla porta 11434), trasferita nella tua tasca.

#Quali modelli da 1 a 4B funzionano davvero

Tutto si gioca nella fascia da 1 a 4 miliardi di parametri, con quantizzazione Q4_K_M (il miglior compromesso tra qualità e dimensioni, come su PC). Oltre i 4B, un telefono diventa lento o non ha abbastanza RAM. Ecco le famiglie che danno i migliori risultati in francese.

Qwen 3.5 2B
Il piccolo modello di riferimento del 2026 (~1,9 GB in Q4). Eccellente nell'uso multilingue e in francese, contesto esteso, licenza Apache 2.0. Il miglior punto di partenza se cerchi velocità su un telefono da 6 GB.
Qwen 3.5 4B
Aumento della qualità (~3,4 GB in Q4) senza uscire dalla fascia mobile. Coerente e performante in Q4 se il tuo telefono ha 8 GB o più. Apache 2.0.
Granite 4.2 3B
Il piccolo modello di IBM (~2,2 GB in Q4), con un consumo di memoria molto contenuto ed efficiente nell'uso dei token. Un solido modello generalista offline quando la RAM è limitata. Apache 2.0.
Gemma 4 E2B
La versione compatta di Google (~4,3 GB), multimodale e tornata sotto licenza Apache 2.0 da aprile 2026. Da riservare ai telefoni con almeno 8 GB.
→
Occupazione di memoria in Q4
Come riferimento: un modello da 1B sta in circa 1 GB, uno da 3B in circa 2 GB e uno da 4B in circa 3 GB in Q4. Aggiungi la memoria occupata dal sistema e dall'app: ecco perché un telefono con 8 GB punta a modelli da 3-4B e non oltre.

#Velocità, calore e batteria: cosa bisogna sapere

L'inferenza LLM sfrutta al massimo la CPU (o la GPU), con tre conseguenze molto concrete su un telefono: la velocità resta modesta, il dispositivo si scalda e la batteria si scarica rapidamente durante la generazione. Nulla che ne impedisca l'uso, ma occorre tenere presenti gli ordini di grandezza.

Velocità
Aspettati circa 5–15 token al secondo per un modello 3B Q4 su un SoC di fascia medio-alta. Il testo si può leggere in tempo reale, ma le prestazioni restano lontane da quelle di una GPU per PC. Un modello 1B è nettamente più veloce.
Aumento della temperatura e throttling
Dopo una lunga generazione, il SoC si riscalda e limita le proprie prestazioni (throttling), rallentando le risposte successive. Lascialo raffreddare tra due richieste lunghe.
Batteria
Una sessione intensa può far scendere il livello della batteria di diversi punti percentuali in pochi minuti. Per un uso occasionale non è un problema; per un uso intensivo, collega il caricatore.
Contesto
Più è grande la finestra di contesto, più aumentano la memoria necessaria e il tempo di elaborazione. Su mobile, mantieni un contesto ragionevole (2k-4k token) per mantenere un funzionamento fluido.
!
Non caricare in modalità rapida
Eseguire un LLM durante la ricarica rapida combina due fonti di calore. Nel tempo, il calore ripetuto provoca l'usura della batteria. Per un uso intensivo, preferisci una ricarica lenta o fai delle pause.

#Risoluzione dei problemi

L'app si chiude durante il caricamento del modello
RAM insufficiente. Chiudi tutte le altre applicazioni, scegli un modello più piccolo (1B invece di 3B) o una quantizzazione più leggera.
Risposte molto lente
Riduci la dimensione del contesto, diminuisci il numero di token generati oppure passa a un modello più piccolo. Verifica anche che il telefono non stia riducendo le prestazioni a causa del calore.
Termux: comando non trovato dopo la compilazione
La build è fallita senza segnalare errori. Rilancia la compilazione e leggi gli errori. Verifica che git, cmake e clang siano correttamente installati.
Termux abbandonato / pacchetti obsoleti
Hai installato la versione Play Store. Disinstallala e reinstalla Termux da F-Droid o GitHub.
Risposte incoerenti
È normale per un modello molto piccolo alle prese con un compito complesso. Semplifica la richiesta, oppure accetta che un modello da 1-3B abbia dei limiti di ragionamento.

#Per approfondire

Una volta che avrai preso confidenza con l'uso su smartphone, probabilmente vorrai una macchina più potente a casa per le attività più impegnative. Queste guide del sito completano questa guida:

Eseguire un LLM in locale senza GPU (solo CPU)
La stessa logica dei dispositivi mobili, ma su PC: modelli consigliati in base alla RAM e trucchi per velocizzare l'esecuzione usando solo la CPU.
Scegliere la quantizzazione (Q4, Q5, Q8, FP16)
Capire perché Q4_K_M è il compromesso consigliato, sia su telefono che su PC.
Installare Ollama
Per un vero server LLM a casa, interrogabile dal tuo telefono tramite rete locale.
Questa guida ti è stata utile?

Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.