Robuta

https://arxiv.org/abs/2307.03738 [2307.03738] QIGen: Generating Efficient Kernels for Quantized Inference on Large Language Models Abstract page for arXiv paper 2307.03738: QIGen: Generating Efficient Kernels for Quantized Inference on Large Language Models