Misurato da QuelLLM

Tre modelli, una macchina, prove

Test pilota del 12 settembre 2026 su RTX 5070 Ti Laptop: 12 227 MiB rilevati, Ollama, contesto 4096, una richiesta alla volta. Nessuna estrapolazione alla versione desktop, a una RTX 5090 o a un Mac.

Le vecchie matrici relative a più macchine sono state ritirate per mancanza di artefatti che ne consentissero la verifica. Questo dossier pubblica soltanto le misurazioni di questo test pilota, con un riscaldamento seguito da cinque ripetizioni per modello.

ModelloQuantizzazioneMediana dei tok/sMin–maxCodice FRDocumenti FR
qwen3:8bQ4_K_M59.7159.45–59.96RiuscitoFatti e formato: esito positivo
hermes3:8bQ4_071.9771.79–72.15FallimentoFatti riusciti, chiavi diverse
mistral-nemo:12bQ4_047.4447.37–47.56RiuscitoFatti e formato: esito positivo

Ciò che questo test permette di dire

Hermes3 genera più velocemente in questo test, ma la sua funzione non elimina correttamente i duplicati e ordina i valori. Qwen3 e Mistral Nemo superano questo esercizio. La velocità di elaborazione non dimostra quindi la qualità. Un compito di programmazione e un'estrazione sintetica non bastano a classificare i modelli per tutti gli usi; anche l'output di Hermes3 raggiunge il limite di 256 token.

Riprodurre e analizzare i dati

L'elaborazione del prompt e la generazione sono separate nei dati grezzi. La cache del prefisso può influenzare la prima; la velocità mostrata riguarda soltanto la generazione. Non si tratta né di una misura dell'energia né della latenza totale dell'applicazione.

Tre tipi di dati

«Misurato da QuelLLM» indica un esperimento collegato ai relativi artefatti. «Misurazione esterna» deve identificare l'autore e il suo protocollo. «Stima» indica in particolare le velocità euristiche e i budget di memoria del configuratore; questi valori non provengono da questo nuovo test.

Metodologia · Scegli in base alla mia macchina · Installa un'IA locale gratuitamente