1. Kvantizace modelů (Quantization)
Přechod z 32-bitové plovoucí řádové čárky (FP32) na 8-bitové (INT8) nebo dokonce 4-bitové formáty radikálně snižuje nároky na paměťovou propustnost a energetickou spotřebu ALU jednotek. Moderní frameworky umožňují kvantizaci s minimální ztrátou perplexiity modelu.