Skip to content

Tokens per second

Tokens per second measures how fast a model generates output during inference. It's the standard throughput metric for LLM serving.

  • tok/s
  • TPS
  • inference throughput
  • decode speed
  • prefill speed
  • generation speed
  • LLM benchmarking
  • tokens/sec
  • latency vs throughput