Overview of KTransformers
mainKTransformers is a research project designed for efficient inference and fine-tuning of Large Language Models (LLMs) using CPU-GPU heterogeneous computing. It optimizes performance for large Mixture-of-Experts (MoE) models by leveraging hybrid hardware resources.
The project provides two primary user-facing capabilities:
- Inference: High-performance serving via
kt-kernelusing CPU-optimized kernel operations. - SFT (Supervised Fine-Tuning): Integration with LLaMA-Factory for fine-tuning ultra-large MoE models on limited GPU memory.