MCP: cos'è? Il Model Context Protocol spiegato
MCP (Model Context Protocol) è lo standard aperto, pubblicato da Anthropic nel novembre 2024 e poi affidato all'Agentic AI Foundation (Linux Foundation) nel dicembre 2025, che permette a un'IA di utilizzare strumenti e dati esterni attraverso un host, un client e un server comuni a tutte le applicazioni compatibili.
MCP, acronimo di Model Context Protocol, è uno standard aperto che consente a un'applicazione di IA di utilizzare strumenti e dati esterni: leggere un file, interrogare un database, cercare sul web. Anthropic lo ha pubblicato a novembre 2024; OpenAI, Google e Microsoft lo hanno adottato nel 2025. Al 20 settembre 2026, è il modo normale per collegare un assistente al resto del tuo sistema, anche con un modello che gira in locale. Questa pagina spiega il principio, il vocabolario e quanto MCP costa realmente su hardware locale.
#MCP in un paragrafo
Un modello di linguaggio, da solo, sa produrre soltanto testo a partire da ciò che ha appreso e dal contenuto del prompt. Per consultare il tuo calendario, interrogare il database aziendale o aprire un documento, ha bisogno di un ponte verso l'esterno. Prima di MCP, ogni applicazione costruiva i propri ponti: un formato di plugin per ogni assistente, un altro per ogni editor di codice, un altro per ogni framework di agenti. MCP sostituisce tutto questo con una sola specifica. L'autore di uno strumento scrive un server MCP e qualsiasi applicazione compatibile può usarlo. L'analogia abituale è quella dell'USB-C: un connettore, molti dispositivi.
A dicembre 2025, Anthropic ha affidato il protocollo all'Agentic AI Foundation, ospitata dalla Linux Foundation. MCP non appartiene quindi più a un fornitore di software, il che spiega in parte la rapidità della sua adozione.
#Host, client, server: chi fa cosa
Agenti che agiscono sulla tua macchina: Cline agentico, MCP, n8n + Ollama, automazioni locali.
- Spazio online a vita
- PDF + file
- Aggiornamenti a vita
| Elemento | Cos'è | Esempi |
|---|---|---|
| Host | L'applicazione di IA con cui parli | Claude Desktop, un assistente per l'editor di codice, Open WebUI, LM Studio |
| Client | Il connettore interno all'host, uno per server connesso | Integrato nell'host, invisibile all'utente |
| Server | Un piccolo programma che espone funzionalità nel formato MCP | File system, GitHub, PostgreSQL, ricerca web, la tua API interna |
I messaggi scambiati sono in JSON-RPC 2.0. Al lancio, ogni client chiede al proprio server cosa sa fare. Il server risponde con un elenco di capacità, ciascuna con un nome, una descrizione in linguaggio comune e uno schema JSON che descrive i suoi parametri. L'host trasmette queste descrizioni al modello. Quando il modello ritiene che uno strumento sia utile, produce un'invocazione strutturata; il client la trasmette al server, che la esegue e restituisce il risultato nella conversazione.
#Cosa può offrire un server MCP
| Primitive | Guidata da | Ruolo | Esempio |
|---|---|---|---|
| Strumenti (tools) | Il modello | Azioni e ricerche in tempo reale | creer_ticket, executer_requete, chercher_web |
| Risorse (resources) | L'application | Dati da leggere e caricare nel contesto | Un file, uno schema base, una pagina di wiki |
| Prompts | L'utilisateur | Modelli di istruzioni riutilizzabili | « Rileggere questa pull request » con parametri |
In pratica, la maggior parte dei server offre solo strumenti, ed è questo che si intende comunemente per «MCP». Il protocollo prevede anche funzioni nella direzione opposta: il sampling, in cui un server chiede all'host di far generare testo al proprio modello, e l'elicitation, in cui un server chiede all'utente un'informazione mancante durante l'esecuzione anziché fallire o tirare a indovinare.
#Adozione e governance, un anno dopo
Il cambiamento è avvenuto nel giro di pochi mesi. Nel marzo 2025, Sam Altman ha scritto che gli utenti adoravano MCP e che OpenAI stava aggiungendo il supporto nei suoi prodotti; ChatGPT, l'SDK Agents e l'API Responses l'hanno poi integrato. Nell'aprile 2025, Demis Hassabis ha confermato che Gemini e gli strumenti di Google DeepMind avrebbero supportato MCP, definendo il protocollo uno standard emergente per l'era degli agenti. Microsoft ha seguito con l'integrazione in Copilot Studio, poi con l'annuncio di un supporto nativo e sicuro in Windows 11.
Il 9 dicembre 2025, la Linux Foundation ha creato l'Agentic AI Foundation (AAIF): Anthropic, Block e OpenAI ne sono i membri fondatori; AWS, Bloomberg, Cloudflare e Google vi hanno aderito. MCP, il protocollo A2A di Google e un progetto di Block vi sono ospitati fianco a fianco, sotto la stessa governance neutrale di Kubernetes o PyTorch. Questo passaggio risponde a una critica frequente nel 2025: uno standard «aperto» su cui un unico fornitore manteneva il controllo delle decisioni. Per un lettore che mette insieme uno stack locale, la conseguenza concreta è duplice: un rischio minore che una scelta unilaterale di Anthropic comprometta il funzionamento di un server esistente e più collaboratori attivi per mantenere i kit di sviluppo (SDK) ufficiali Python, TypeScript, Java, C# e Rust utilizzati dai server della comunità.
#Locale o remoto: i due tipi di trasporto
- stdio
- L'host avvia il server come sottoprocesso locale e comunica con esso tramite l'input e l'output standard. Nulla passa attraverso la rete. È la modalità usata nella maggior parte delle installazioni desktop e la scelta naturale per una configurazione privata.
- Streamable HTTP
- Il server funziona come un servizio web, eventualmente su un'altra macchina, con un'autenticazione convenzionale. Questo trasporto ha sostituito la precedente combinazione di HTTP e SSE nelle revisioni del 2025 della specifica.
#MCP, chiamata di funzioni, API: le differenze
| Cos'è | Chi lo definisce | |
|---|---|---|
| API REST | Il modo in cui un servizio espone le sue funzioni ai programmi | Ogni servizio, in modo diverso |
| Chiamata di funzione | La capacità, acquisita durante l'addestramento, di generare una chiamata strutturata anziché testo | Ogni produttore di modelli, con formati simili ma distinti |
| MCP | Un modo standard per scoprire, descrivere e chiamare gli strumenti di un'applicazione da un'altra | Una sola specifica aperta |
MCP non sostituisce il function calling, si basa su di esso. Il modello deve comunque saper produrre una chiamata corretta a uno strumento. MCP standardizza tutto ciò che ruota attorno a quel momento: come gli strumenti vengono elencati, descritti, autorizzati ed eseguiti. Un server MCP è molto spesso uno strato sottile sovrapposto a un'API esistente.
#MCP con un modello locale: il vero costo
MCP non dipende dal modello. Con un host compatibile e un modello locale addestrato a chiamare strumenti, l'intero ciclo viene eseguito sulla tua macchina. Due vincoli pesano allora molto di più rispetto al cloud.
Primo vincolo: le descrizioni degli strumenti consumano contesto, e il contesto consuma VRAM. Ogni strumento connesso inserisce il proprio nome, la propria descrizione e il proprio schema nel prompt, a ogni turno. Calcola da 100 a 300 token per strumento e da 10 a 30 strumenti per ogni server diffuso. Con qualche server, vengono consumate diverse migliaia di token prima ancora che tu abbia digitato una parola. Con un fornitore cloud, è una voce in fattura. Sulla tua GPU, è cache KV che occupa parte di una VRAM la cui capacità non aumenta.
| Configurazione | Token di definizione | Cache KV, Qwen 3 8B | Cache KV, Qwen 3 32B |
|---|---|---|---|
| 1 server, 8 strumenti | ≈ 1 600 | ≈ 0,2 GB | ≈ 0,4 GB |
| 3 server, 30 strumenti | ≈ 6 000 | ≈ 0,9 GB | ≈ 1,6 GB |
| 6 server, 80 strumenti | ≈ 16 000 | ≈ 2,4 GB | ≈ 4,2 GB |
Su una scheda da 16 GB che esegue un modello da 13 GB, 2,4 GB di descrizioni degli strumenti fanno la differenza tra una sessione funzionante e un errore di memoria. La regola pratica per l'uso in locale: collega solo i server utili all'attività del momento e preferisci quelli che espongono pochi strumenti ben descritti a quelli che pubblicano tutta la loro API.
Secondo vincolo: i modelli piccoli scelgono peggio. Selezionare lo strumento giusto tra trenta e compilare correttamente il relativo schema è una competenza che dipende dalle dimensioni del modello e dall'addestramento. Al di sotto di circa 8 miliardi di parametri, gli errori nella scelta degli strumenti e i parametri inventati diventano frequenti.
- Tutorial: collegare server MCP a Ollama
- MCP e plugin in LM Studio
- I migliori LLM locali per gli agenti e l'invocazione di strumenti
- Ridurre il costo del contesto: quantizzare la cache KV
#Sicurezza: ciò che i tutorial dimenticano
Un server MCP è un programma che gira con i tuoi stessi permessi, alimentato da testo prodotto da un modello. Tre rischi meritano di essere compresi prima di installare qualsiasi cosa.
- Iniezione di prompt
- Se uno strumento restituisce contenuto proveniente dall'esterno (una pagina web, un'email, un commento), tale contenuto può contenere istruzioni destinate al modello. Un modello che legge testi non affidabili e può agire è un bersaglio.
- Avvelenamento degli strumenti
- Un server malevolo può nascondere istruzioni nella descrizione dei propri strumenti, che il modello legge e che l'utente generalmente non vede mai.
- Permessi troppo ampi
- Un file server configurato per accedere alla tua cartella personale dà al modello accesso alla tua cartella personale.
Le contromisure non sono spettacolari: installare server di provenienza nota, limitare ciascuno all'ambito più ristretto possibile, mantenere la richiesta di conferma per tutto ciò che scrive o invia ed evitare di mescolare, nella stessa sessione, l'accesso a dati privati e la lettura di contenuti non affidabili.
#Ne hai bisogno?
| La tua situazione | Verdetto |
|---|---|
| Parli con un modello e incolli ciò di cui ha bisogno | No. MCP aggiunge componenti che non utilizzerai, rendendo il sistema più complesso. |
| Vuoi che l'assistente legga file, interroghi un database o cerchi sul web | Sì. È il modo standard di farlo nel 2026. |
| Stai sviluppando uno strumento interno utilizzabile da qualsiasi applicazione IA | Sì. Un server MCP anziché un'integrazione per ogni applicazione. |
| Eseguisci un modello piccolo su 8 GB di VRAM | Con cautela: al massimo un o due server leggeri. |
Esempio concreto: il catalogo QuelLLM stesso è disponibile tramite un server MCP open source. Un assistente collegato a quel server risponde a «quale modello entra nella memoria di una scheda da 16 GB» basandosi su dati aggiornati, e non sulla propria memoria.
- API pubblica e server MCP di QuelLLM
- Il kit degli agenti locali: costruire un agente con strumenti dall'inizio alla fine
#FAQ
Che cosa significa MCP?+
Che cos'è un server MCP?+
MCP è riservato a Claude?+
MCP funziona con Ollama o LM Studio?+
MCP è pericoloso?+
Chi governa MCP oggi?+
Un feedback, un errore, una precisazione? Facci sapere, così la guida migliora per tutti.