🔒 Calcolo sul tuo dispositivo · nessun dato inviato o salvato
Li trovi nel config.json del modello su Hugging Face: num_hidden_layers, num_key_value_heads e head_dim (oppure hidden_size ÷ num_attention_heads).
Come si stima la velocità
Mentre genera, un LLM deve leggere tutti i pesi attivi dalla memoria per ogni token. Il collo di bottiglia è quasi sempre la banda di memoria, non la potenza di calcolo:
token/s ≈ banda di memoria × efficienza ÷ byte letti per token
- Byte per token = pesi attivi quantizzati + cache KV già occupata.
- Efficienza: nella pratica i motori sfruttano il 55–80% della banda teorica, da qui l'intervallo.
- Modelli MoE (Qwen3 30B-A3B, gpt-oss): tutti i parametri stanno in memoria, ma per ogni token se ne legge solo una parte. Per questo vanno molto più veloci di un modello denso della stessa taglia.
- Più GPU: sommano la memoria, ma con lo split a layer la velocità resta circa quella di una GPU sola.
È la velocità di generazione. La lettura del prompt iniziale (prompt processing) dipende dalla potenza di calcolo ed è di solito molto più rapida sulle GPU dedicate che sui Mac.