Overview of Brevitas quantization modeling
masterBrevitas is a platform for modeling reduced precision hardware data-paths during training. It provides building blocks at various abstraction levels to support both research into new quantization-aware training (QAT) techniques and the practical application of existing techniques to models.
Key features include:
- Unified API: Supports a super-set of quantization schemes across different frameworks and compilers.
- Inference Acceleration: Supports exporting to FINN, onnxruntime, or PyTorch's native quantized operators for specific layer and quantization combinations.
- Quantization Style: Primarily implements affine quantization with a focus on uniform quantization. Note that non-uniform quantization is not supported out-of-the-box.