https://arxiv.org/abs/2307.03738
[2307.03738] QIGen: Generating Efficient Kernels for Quantized Inference on Large Language Models
Abstract page for arXiv paper 2307.03738: QIGen: Generating Efficient Kernels for Quantized Inference on Large Language Models