A hardware-aware, system-level analysis of key optimization techniques, including pruning, quantization, knowledge distillation, Low-Rank Adaptation (LoRA), and Neural Architecture Search (NAS), shows that quantization consistently achieves the highest inference speedups and memory efficiency.
A. Hamza, Amel Tuama, Asraf Mohamed Moubark· NTU Journal of Engineering a...· 0 citations