Tutti i modelli · 100% locale, 100% privato

Quale LLM puoi eseguire sulla
tua macchina

Dicci che hardware hai. Ti indichiamo quali modelli funzionano, quale velocità aspettarti e come installarli passo dopo passo in italiano.

Non hai ancora il computer? Quale PC per l’IA locale è adatto al tuo budget? →
Mini PC da 128 GB · NVIDIA DGX Spark · Tutto l’hardware per l’IA

~/configurateur —— ● pronto
Il calcolo rimane nel tuo browser. Il sito utilizza anche un sistema di misurazione del pubblico.
Gratis
Nessuna iscrizione
Nella tua lingua
Guide didattiche
Open source
Dati pubblici
Calcolo locale
Misurazione dell'audience
◆ I kit QuelLLM — il manuale di riferimento per uso · 24 € per kit · 49 € per tutti i kit, a vita →

Il mercato in sintesi

Tutte le novità →
1 oct.NVIDIA Kumo Tabular: un modello di predizione tabellare più preciso e più efficiente30 sept.GLM-5.3 supera una soglia nello sfruttamento di vulnerabilità nei binari, secondo il red team di Anthropic30 sept.Claude Sonnet 5.5 : più veloce e meno costoso da usare, allo stesso prezzo di Sonnet 5
Catalogo · 250 modelli

Il catalogo degli LLM open-weights
che girano localmente.

Tutti i modelli pertinenti, con VRAM richiesta per ciascuna quantizzazione, velocità stimata e casi d'uso. I modelli francesi sono evidenziati.

🇫🇷
Focus sulla sovranità

I 26 modelli prodotti in Francia

Mistral, Lucie (OpenLLM-France), CroissantLLM — addestrati su corpus in francese, licenze permissive, eccellenti nel francese formale.

★Il meglio della selezione editorialeVedi tutte le classifiche →
250 modelli
Modello↕
Params↕
VRAM Q4↕
Contesto↕
Funziona su
tok/s↕
Data di uscita↕
Pleias-RAG 1B★ FRchatfr
🇫🇷 PleIAs · Specializzato nel RAG, 1.2B. Citazione e grounding integrati. Supera la maggior parte degli SLM ≤4B su HotPotQA.
1.2B
0.8 GB
2k
8121624
150
avr. 2025
CroissantLLM 1.3B★ FRchatfr
🇫🇷 CroissantLLM · Piccolo modello bilingue FR/EN. Funziona ovunque, anche su CPU.
1.3B
1 GB
2k
8121624
120
janv. 2024
SmolLM2 1.7B Instruct★ FRchatgeneral
🇫🇷 HuggingFace · Modello 1.7B con licenza Apache 2.0, molto scaricato. Supera Qwen2.5-1.5B di ~6 punti su MMLU-Pro. Function calling su BFCL: 27%.
1.7B
1.2 GB
8k
8121624
120
nov. 2024
Helium 1 2B★ FRchatgeneral
🇫🇷 Kyutai · Modello base multilingue per 24 lingue dell'UE (Kyutai FR). Distillato da Gemma 2 → si applicano anche i Gemma Terms.
2B
1.5 GB
4k
8121624
100
avr. 2025
SmolVLM2 2.2B Instruct★ FRvisionchat
🇫🇷 HuggingFace · VLM 2.2B: immagine+video+testo. 5.2 GB VRAM per l'inferenza video. Base SmolLM2-1.7B.
2.2B
1.6 GB
8k
8121624
90
févr. 2025
Pleias 3B Preview★ FRchatmultilingual
🇫🇷 PleIAs · Francese. Addestrato al 100% su Common Corpus (dati aperti). Conforme all'AI Act dell'UE fin dalla progettazione.
3B
2 GB
2k
8121624
70
déc. 2024
SmolLM3 3B★ FRchatgeneral
🇫🇷 HuggingFace · 3B a doppia modalità (think/no-think). 6 lingue. MMLU 59.7, GSM8K 70.9. Completamente aperto (dati+procedura di addestramento).
3B
2 GB
125k
8121624
70
juil. 2025
Shieldstral 3B★ FRgeneralsmall
🇫🇷 Mistral AI · Modello di protezione Mistral 3B (moderazione dei contenuti), contesto 32k, circa 1,7 GB di VRAM in Q4. Self-hosted, licenza Apache 2.0.
3B
1.7 GB
32k
8121624
85
—
Voxtral-4B-TTS★ FRaudiomultilingual
🇫🇷 Mistral AI · TTS aperto di frontiera, 9 lingue tra cui FR. Rivaleggia con ElevenLabs. ⚠ Solo per uso non commerciale.
4B
3 GB
4k
8121624
65
mars 2026
Mistral 7B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · Il classico francese. Veloce, versatile, ottima base per iniziare.
7B
5 GB
32k
8121624
35
sept. 2023
Lucie 7B★ FRchatfr
🇫🇷 OpenLLM-France · LLM sovrano francofono, addestrato su corpus FR.
7B
5 GB
4k
8121624
35
janv. 2025
Codestral Mamba 7B★ FRcodicefr
🇫🇷 Mistral AI · Mamba SSM puro per il codice. Inferenza lineare, ctx 256k. Non supportato da Ollama (supporto parziale in llama.cpp).
7B
5 GB
250k
8121624
40
juil. 2024
Claire 7B 0.1★ FRchatfr
🇫🇷 LINAGORA · Fine-tuning LoRA di Falcon-7B su dialoghi spontanei in francese. ⚠ Licenza NC-SA. Variante Apache separata.
7B
5 GB
2k
8121624
35
nov. 2023
Moshi 7B★ FRaudiofr
🇫🇷 Kyutai · Primo modello vocale open full-duplex. Latenza ~200ms. Voci Moshiko/Moshika. Kyutai (laboratorio francese).
7.6B
5 GB
4k
8121624
25
sept. 2024
Mistral Nemo 12B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · Sviluppato congiuntamente con NVIDIA. Contesto di 128k token, tokenizer Tekken, ottime capacità multilingue nelle lingue europee.
12B
7 GB
125k
8121624
25
juil. 2024
Codestral 22B v0.1★ FRcodicefr
🇫🇷 Mistral AI · Modello Mistral da 22B per il codice, oltre 80 linguaggi. ⚠ Licenza MNPL non per uso in produzione — uso personale/ricerca.
22B
13 GB
31.25k
8121624
16
mai 2024
Mistral Small 3★ FRchatgeneral
🇫🇷 Mistral AI · Eccellente rapporto qualità/dimensione al lancio (inizio 2025). Compete con i 70B.
24B
14 GB
32k
8121624
15
janv. 2025
Mistral Small 3.1 24B★ FRchatgeneral
🇫🇷 Mistral AI · Small 3 arricchito con capacità visive. 128k ctx, Apache 2.0. Sostituito da Small 3.2 da giugno 2025.
24B
14 GB
125k
8121624
15
mars 2025
Devstral Small 2 24B★ FRcodicefr
🇫🇷 Mistral AI · Specialista in programmazione 24B, Apache 2.0. 72.2% su SWE-Bench. 256k ctx, laboratorio francese.
24B
14 GB
250k
8121624
15
déc. 2025
Mistral Small 3.2 24B★ FRchatgeneral
🇫🇷 Mistral AI · Aggiornamento di giugno 2025 di Small 3.1. Generazioni infinite dimezzate, function calling migliorato.
24B
14 GB
125k
8121624
15
juin 2025
Magistral Small 24B★ FRreasoningfr
🇫🇷 Mistral AI · Primo modello di ragionamento open di Mistral. AIME24 70.7%. Base Small 3.1 + addestramento CoT.
24B
14 GB
125k
8121624
15
juin 2025
Mixtral 8x7B★ FRchatgeneral
🇫🇷 Mistral AI · MoE con 8 esperti. Qualità elevata, ma richiede molta VRAM.
47B
26 GB
32k
8121624
12
déc. 2023
Mistral Small 4★ FRchatgeneral
🇫🇷 Mistral AI · MoE 119B/6.5B attivi unifica chat+ragionamento+visione+codice. Il modello di punta francese del 2026.
119B
72 GB
250k
8121624
12
mars 2026
Mistral Medium 3.5 128B★ FRchatgeneral
🇫🇷 Mistral AI · Modello denso da 128B + visione, 256k ctx, ragionamento configurabile. SWE-Bench 77.6%. Sostituisce Medium 3.1 e Magistral. Uscita il 29 aprile 2026.
128B
74 GB
250k
8121624
4
avr. 2026
Mixtral 8x22B Instruct★ FRchatgeneral
🇫🇷 Mistral AI · MoE Apache 2.0 141B/39B attivi. MMLU 77.8, HumanEval 45.1. 80 GB in Q4.
141B
82 GB
62.5k
8121624
8
avr. 2024
Mistral Large 3 675B★ FRchatgeneral
🇫🇷 Mistral AI · MoE 675B/41B attivi + encoder visivo 2.5B, Apache 2.0. #2 OSS non-reasoning LMArena. Addestrato su 3000 H200.
675B
405 GB
250k
8121624
5
déc. 2025
Granite Time Series PatchTST R2generalsmall
🇺🇸 IBM · Modello fondazionale IBM per serie temporali (~385M, PatchTST), previsione multivariata, ~0,2 GB di VRAM in Q4. Ultraleggero, gira su CPU. Licenza Apache 2.0.
0.4B
0.2 GB
8k
8121624
170
août 2026
Activity Generation 0.5B (Qwen)chatgeneral
🇨🇳 mjpsm · Qwen 0.5B fine-tuned per generare attività, contesto 32k, circa 0,3 GB di VRAM in Q4. Ultra-leggero, funziona anche su CPU. Licenza Apache 2.0.
0.5B
0.3 GB
32k
8121624
170
sept. 2026
S1-miniaudiosmall
🇺🇸 superwhisper · S1-mini (superwhisper): riconoscimento vocale da 0,6B basato su Qwen3-0.6B, contesto di 40k, ~0,3 GB di VRAM in Q4. Trascrizione locale ultraleggera.
0.6B
0.3 GB
40k
8121624
170
août 2026
Qwen 3.5 0.8Bchatgeneral
🇨🇳 Alibaba · Denso, 0.8B, Apache 2.0, contesto di 256k. Memoria trascurabile, ideale per edge, mobile e Raspberry Pi. Uscita il 13 aprile 2026.
0.8B
0.5 GB
250k
8121624
170
avr. 2026
Centro di apprendimento

La documentazione QuelLLM.

339+ Guide in italiano per Windows, macOS e Linux. I test eseguiti sono indicati in ogni guida. Dalla prima installazione alle tecniche avanzate di RAG e fine-tuning.

⌘ K

In evidenza

— le nostre guide essenziali
★ In evidenza
Azienda · Deployment

IA per il codice in azienda: proteggere il codice proprietario, NDA e segreto industriale

Distribuire un'IA per la programmazione 100% locale (Ollama + Cline + Aider + Tabby) per un team di sviluppo vincolato da NDA e segreto industriale: perché Copilot e Cursor espongono il tuo codice proprietario, cosa richiedono il GDPR e l'AI Act, l'architettura su postazione rispetto a quella su server GPU Tabby e l'audit per verificare l'assenza di esfiltrazione.

Avanzato·16 min·Mohamed Meguedmi
★ In evidenza
Primi passi · Gratis

Migliore IA locale gratuita: top 2026, anche senza GPU

IA locale: definizione e le migliori IA gratuite nel 2026, da installare su PC o Mac, anche senza GPU dedicata. Confronto degli strumenti e guida passo-passo.

Principiante·14 min·Mohamed Meguedmi
★ In evidenza
Installazione · Ollama

Installare Ollama su Windows 11: guida completa (2026)

Scaricare Ollama per Windows 11, installarlo, abilitare la GPU (CUDA) e avviare un primo modello: la guida passo dopo passo 2026, con gli errori comuni.

Principiante·3 min·Mohamed Meguedmi
339 risultatos
Principiante 3 min

Installare Ollama su Windows 11: guida completa (2026)

Scaricare Ollama per Windows 11, installarlo, abilitare la GPU (CUDA) e avviare un primo modello: la guida passo dopo passo 2026, con gli errori comuni.

OllamaLeggi →
Intermedio 12 min

Quale LLM usare su una RTX 4090 (24 GB)?

RTX 4090 24 GB, il riferimento per l'IA locale per il grande pubblico nel 2026. Qwen 3.8 27B, Devstral 24B, gpt-oss 20B, GLM 4.7 Flash, benchmark token/sec, ottimizzazioni CUDA Ada.

RTX 40Leggi →
Intermedio 11 min

Quale LLM usare su una RTX 5090 (32 GB)?

RTX 5090 2025: 32 GB di VRAM GDDR7, banda passante 1792 GB/s. Far girare in locale i grandi MoE 2026 (Qwen 3.6 35B-A3B, Nemotron 3.5 Lightning) e Qwen 3.8 27B a contesto lungo, benchmark, configurazioni ideali.

RTX 50Leggi →
Avanzato 16 min

DeepSeek V4 Pro in locale: VRAM, hardware, installazione

Quale macchina per DeepSeek V4 Pro (1.6T MoE, 49B attivi, MIT)? VRAM/RAM richieste, installazione locale, benchmark rispetto a GPT-5 e limiti reali.

DeepSeekLeggi →
Principiante 5 min

LM Studio per principianti: prima chat locale in 10 minuti

Il tuo primo LLM locale con LM Studio: installazione, download di un modello e chat in 10 minuti. Zero righe di comando, ideale per principianti.

LM StudioLeggi →
Principiante 14 min

Quale LLM su RTX 3060 12 GB?

RTX 3060 12 GB: l'iconica GPU economica per gli LLM. 12 GB per 250 € sul mercato dell'usato, Gemma 4 12B, Qwen 3.5 9B, Granite 4.2 8B, benchmark dettagliati.

RTX 30Leggi →
Intermedio 14 min

DeepSeek V4 Flash 284B: il primo frontier che gira su Mac Studio

DeepSeek V4 Flash 284B MoE (13B attivi, MIT, 1M ctx): il primo modello di frontiera eseguibile su workstation. Installazione su Mac Studio Ultra, benchmark, confronto con Pro.

DeepSeekLeggi →
Principiante 3 min

Installare Ollama su macOS (Apple Silicon): guida 2026

Sfruttare Metal e la memoria unificata M1/M2/M3/M4.

OllamaLeggi →
Principiante 14 min

Quale LLM su Mac mini M4 / M4 Pro (16–64 GB)?

Mac mini M4: il miglior rapporto prestazioni/prezzo per l'IA locale nel 2026. Benchmark, configurazione consigliata, uso come server domestico.

Mac miniLeggi →
Intermedio 13 min

Quale LLM usare su una RTX 3090 / 3090 Ti (24 GB)?

RTX 3090 e 3090 Ti 24 GB usate: ancora eccellenti per gli LLM nel 2026. Qwen 3.8 27B, Qwen3-Coder 30B, benchmark, verdetto sul rapporto prestazioni/prezzo, raffreddamento.

RTX 30Leggi →
Principiante 11 min

Quale LLM per 12 GB di VRAM?

12 GB VRAM (RTX 3060 12GB, 4070, 5070): sweet spot 2026. Qwen 3.5 9B in Q8, Gemma 4 12B, RAG multi-stage. La guida definitiva.

Per VRAMLeggi →
Intermedio 14 min

Qwen 3.8 27B in locale: installazione Ollama e VRAM

Eseguire Qwen3.8-27B in locale: comando Ollama esatto, VRAM per quantizzazione, variante MLX su Mac, trappola del contesto 256k, modalità thinking e benchmark ufficiali.

OllamaLeggi →
Principiante 10 min

La tua prima conversazione locale

Avviare Ollama, caricare Mistral, dialogare. Il tutorial del giorno 1.

PromptingLeggi →
Intermedio 11 min

Quale LLM usare su una RTX 5070 Ti (16 GB)?

RTX 5070 Ti 16 GB: il punto di equilibrio 2025 per l'IA locale. Benchmark Ollama, modelli 14B/24B eseguibili senza difficoltà, confronto con 4070 Ti Super.

RTX 50Leggi →
Intermedio 11 min

Quale LLM su MacBook Pro M4 Pro / Max (24–128 GB)?

MacBook Pro M4 Pro / Max 2025: banda passante 546 GB/s, quali modelli sfruttano davvero il chip, quali sono i limiti pratici.

MacBook ProLeggi →
Intermedio 14 min

Quale LLM usare su una RTX 4070 / 4070 Super / 4070 Ti (12 GB)?

RTX 4070, 4070 Super e 4070 Ti 12 GB: confronto LLM, modelli 13B eseguibili senza difficoltà, limiti dei 12 GB, benchmark misurati.

RTX 40Leggi →
Principiante 11 min

Ollama vs LM Studio vs Jan vs GPT4All

Tabella riepilogativa per scegliere lo strumento adatto al tuo profilo.

StrumentiLeggi →
Principiante 11 min

Quale LLM usare con 8 GB di VRAM?

La guida completa per 8 GB di VRAM (RTX 3050/3060 8GB, 4060, 5050, 5060): Qwen 3.5 9B, Granite 4.2 8B, trucchi per sfruttare al meglio la VRAM.

Per VRAMLeggi →
Avanzato 16 min

IA per il codice in azienda: proteggere il codice proprietario, NDA e segreto industriale

Distribuire un'IA per la programmazione 100% locale (Ollama + Cline + Aider + Tabby) per un team di sviluppo vincolato da NDA e segreto industriale: perché Copilot e Cursor espongono il tuo codice proprietario, cosa richiedono il GDPR e l'AI Act, l'architettura su postazione rispetto a quella su server GPU Tabby e l'audit per verificare l'assenza di esfiltrazione.

DeploymentLeggi →
Principiante 11 min

Installare Ollama in 5 minuti (Windows, macOS, Linux)

Come installare Ollama in 5 minuti su Windows, macOS e Linux: requisiti di RAM/GPU, comandi essenziali e primo modello locale da avviare subito dopo.

OllamaLeggi →
Principiante 11 min

Le basi del prompting

Strutturare le richieste per ottenere risposte utili.

PromptingLeggi →
Intermedio 12 min

Quale LLM su MacBook Pro M3 Pro / Max (18–128 GB)?

MacBook Pro M3 Pro / Max: il miglior laptop per l'IA locale nel 2026. Qwen 3.6 35B-A3B, contesto 128k, Flash Attention.

MacBook ProLeggi →
Intermedio 11 min

Quale LLM usare su una RTX 5080 (16 GB)?

RTX 5080 Blackwell: 16 GB GDDR7 a 960 GB/s. Benchmark Qwen 3.5, Granite 4.2, Gemma 4, gpt-oss, Devstral in Q4. Configurazione Ollama ottimale.

RTX 50Leggi →
Intermedio 11 min

Quale LLM usare con 16 GB di VRAM?

16 GB VRAM (RTX 4070 Ti Super, 5070 Ti, 5080, 4060 Ti 16GB): Mistral Small 24B, Devstral 24B, gpt-oss 20B, il livello pro 2026.

Per VRAMLeggi →
Principiante 12 min

Quale GPU per un LLM locale? Dalla RTX 4070 alla 5090, Mac (2026)

RTX 4070 vs 4090 vs Mac M-Max: guida all'acquisto 2026.

GPULeggi →
Principiante 11 min

RAG locale: introduzione

Comprendere il Retrieval-Augmented Generation per chattare con i propri documenti.

ConcettiLeggi →
Avanzato 13 min

Quale LLM usare su Mac Studio (M2 / M3 / M4 Ultra, 64–512 GB)?

Mac Studio Ultra: fino a 512 GB di memoria unificata. Far girare Llama 4 Maverick 402B, Qwen3-235B, DeepSeek 671B in locale. La guida per power user.

Mac StudioLeggi →
Intermedio 11 min

Quale LLM su RTX 4080 / 4080 Super (16 GB)?

RTX 4080 e 4080 Super 16 GB per gli LLM locali: tutti i modelli che ci stanno, benchmark, confronto 4080 vs 4080 Super, verdetto d'acquisto.

RTX 40Leggi →
Intermedio 11 min

Quale LLM usare su una Radeon RX 7900 XTX (24 GB)?

Radeon RX 7900 XTX 24 GB: alternativa AMD alla RTX 4090 per LLM. ROCm 6.x, Qwen 3.8 27B, benchmark token/sec, verdetto 2026.

Radeon RX 7000Leggi →
Intermedio 11 min

Quale LLM per 24 GB di VRAM?

24 GB di VRAM (RTX 3090, 4090, RX 7900 XTX): Qwen 3.8 27B interamente in VRAM, MoE di grandi dimensioni 35B-A3B, fine-tuning LoRA. La fascia per un uso serio.

Per VRAMLeggi →
…
1–30 su 339 guide
Percorsi guidati

Tre percorsi,
a seconda di chi sei.

Ogni percorso è una sequenza di guide pensata per un profilo preciso. Dal primo download fino a una configurazione operativa.

01
Percorsi curioso

« Voglio solo provare, senza problemi. »

Hai sentito parlare dei LLM locali e vuoi vedere come funzionano sul tuo dispositivo. Nessun codice, nessuna configurazione del sistema — in 10 minuti chatti con il tuo primo modello.

Durata totale
~15 min
Prerequisiti
Nessuna
Cosa avrai alla fine
Ollama installato
Mistral 7B lanciato
Primo prompt riuscito
Inizia il percorso→