Tre modelli, una macchina, prove
Test pilota del 12 settembre 2026 su RTX 5070 Ti Laptop: 12 227 MiB rilevati, Ollama, contesto 4096, una richiesta alla volta. Nessuna estrapolazione alla versione desktop, a una RTX 5090 o a un Mac.
Le vecchie matrici relative a più macchine sono state ritirate per mancanza di artefatti che ne consentissero la verifica. Questo dossier pubblica soltanto le misurazioni di questo test pilota, con un riscaldamento seguito da cinque ripetizioni per modello.
| Modello | Quantizzazione | Mediana dei tok/s | Min–max | Codice FR | Documenti FR |
|---|---|---|---|---|---|
| qwen3:8b | Q4_K_M | 59.71 | 59.45–59.96 | Riuscito | Fatti e formato: esito positivo |
| hermes3:8b | Q4_0 | 71.97 | 71.79–72.15 | Fallimento | Fatti riusciti, chiavi diverse |
| mistral-nemo:12b | Q4_0 | 47.44 | 47.37–47.56 | Riuscito | Fatti e formato: esito positivo |
Ciò che questo test permette di dire
Hermes3 genera più velocemente in questo test, ma la sua funzione non elimina correttamente i duplicati e ordina i valori. Qwen3 e Mistral Nemo superano questo esercizio. La velocità di elaborazione non dimostra quindi la qualità. Un compito di programmazione e un'estrazione sintetica non bastano a classificare i modelli per tutti gli usi; anche l'output di Hermes3 raggiunge il limite di 256 token.
Riprodurre e analizzare i dati
- Protocollo, parametri e limiti
- Risposte complete e posizionamenti sulla GPU — JSON grezzo
- Tutte le ripetizioni — CSV
- Risultati, identificatori e quantizzazioni
- Hardware, versioni e stato iniziale
- Script riproducibile
- Cartella completa, input e output inclusi
L'elaborazione del prompt e la generazione sono separate nei dati grezzi. La cache del prefisso può influenzare la prima; la velocità mostrata riguarda soltanto la generazione. Non si tratta né di una misura dell'energia né della latenza totale dell'applicazione.
Tre tipi di dati
«Misurato da QuelLLM» indica un esperimento collegato ai relativi artefatti. «Misurazione esterna» deve identificare l'autore e il suo protocollo. «Stima» indica in particolare le velocità euristiche e i budget di memoria del configuratore; questi valori non provengono da questo nuovo test.
Metodologia · Scegli in base alla mia macchina · Installa un'IA locale gratuitamente