Come misuriamo

I numeri verificabili

Questo sito mostra numeri. Le stime del configuratore, i giudizi del catalogo, i benchmark misurati. Ecco esattamente da dove provengono e come li calcoliamo.

Vedi le misurazioni del progetto pilota e i suoi limiti · Protocollo riproducibile · Motore pubblico

Tre principi

  1. 01

    Si distingue tra ciò che è stimato e ciò che è misurato

    Il configuratore fornisce stime di token/sec in base a una formula. La pagina Benchmarks mostra i token/sec misurati. I due valori sono etichettati diversamente per non confonderli.

  2. 02

    Mostriamo il margine di errore

    Non disponiamo di un intervallo di errore calibrato per tutte le stime. Per il test pilota misurato vengono pubblicati la mediana, il minimo e il massimo delle cinque ripetizioni.

  3. 03

    Tutto viene datato

    Ogni guida, ogni scheda modello riporta una data di ultima verifica. Ciò che era vero 6 mesi fa su Ollama spesso non lo è più oggi.

Formule utilizzate

Regole del motore pubblico di compatibilità. Valutano la memoria e una velocità indicativa; non costituiscono una classifica di qualità.

01
Budget di memoria dei pesi
budget ≥ soglia di catalogo per la quantizzazione

Le soglie Q4/Q5/Q8/FP16 sono approssimazioni del catalogo. Il motore non calcola la cache KV del contesto richiesto: mantenere un margine.

02
Velocità GPU stimata
tok/s = valore low, mid o high del modello in base alla classe della GPU

Euristica: nessuna misurazione sulla tua macchina. I profili Apple usano il loro budget di memoria unificata.

03
Ripiego sulla CPU
≤3B : mid × 0,3 ; ≤8B : low × 0,4 ; altrimenti max(1, low × 0,15)

Arrotondato in token/s. Questo ramo viene utilizzato anche quando la GPU è presente ma non contiene i pesi.

Da dove provengono i dati

Tutto è supportato da fonti. Nulla è inventato. Se un'informazione è falsa o non è più aggiornata, signalez-la.

Hugging Face
Schede dei modelli, dimensioni, architetture
huggingface.co
Libreria Ollama
Quantizzazioni disponibili e pesi
ollama.com/library
llama.cpp
Benchmarks PPL, architetture supportate
github.com/ggerganov/llama.cpp
TechPowerUp
Specifiche GPU (VRAM, banda passante)
techpowerup.com/gpu-specs
Il nostro banco di prova
Tre modelli, una RTX 5070 Ti Laptop, dati grezzi pubblicati
vedi Benchmarks

Bias noti

!
Cosa bisogna sapere prima di leggere i nostri numeri
  • I token/s stimati presuppongono una macchina a riposo, senza Chrome con 40 schede.
  • Il test pilota del 12 settembre 2026 viene eseguito con Ollama 0.30.6; le relative opzioni e versioni sono archiviate.
  • Il configuratore non modella in modo preciso i Mac — l'Apple Silicon ha comportamenti non lineari sui modelli molto grandi.
  • Il motore seleziona la quantizzazione più alta che rientra nel budget di memoria destinato ai pesi. Questa scelta non garantisce né il caricamento con un contesto lungo né la qualità per il tuo utilizzo.