Skip to content

Tensor parallelism

Tensor parallelism splits individual weight matrices across multiple GPUs, so each one computes a slice of every layer in a model.

  • model parallelism
  • NVLink
  • multi-GPU training
  • pipeline parallelism
  • distributed inference
  • interconnect bandwidth
  • Megatron-LM
  • GPU cluster
  • all-reduce