🔒 Calcolo sul tuo dispositivo · nessun dato inviato o salvato

Come si stima la velocità

Mentre genera, un LLM deve leggere tutti i pesi attivi dalla memoria per ogni token. Il collo di bottiglia è quasi sempre la banda di memoria, non la potenza di calcolo:

token/s ≈ banda di memoria × efficienza ÷ byte letti per token

  • Byte per token = pesi attivi quantizzati + cache KV già occupata.
  • Efficienza: nella pratica i motori sfruttano il 55–80% della banda teorica, da qui l'intervallo.
  • Modelli MoE (Qwen3 30B-A3B, gpt-oss): tutti i parametri stanno in memoria, ma per ogni token se ne legge solo una parte. Per questo vanno molto più veloci di un modello denso della stessa taglia.
  • Più GPU: sommano la memoria, ma con lo split a layer la velocità resta circa quella di una GPU sola.

È la velocità di generazione. La lettura del prompt iniziale (prompt processing) dipende dalla potenza di calcolo ed è di solito molto più rapida sulle GPU dedicate che sui Mac.

🍺 Buy me a beer