Core Features of Candle-vLLM
masterCandle-vLLM is a high-performance LLM inference and serving platform with the following capabilities:
- API Compatibility: Provides an OpenAI-compatible API service.
- Inference Optimizations: Supports PagedAttention, Continuous Batching, Prefix Caching, and CUDA Graphs.
- Quantization Support: Supports In-situ quantization (including Marlin format), GPTQ, AWQ, Marlin (4-bit), and hardware-specific FP8 (SM90+).
- KV Cache Compression: Features TurboQuant (
turbo8,turbo4,turbo3) for high-ratio KV cache compression using native Flash Attention kernels. - Multi-Device Support: Supports multi-GPU (multi-process and multi-thread tensor parallelism) and multi-node (TCP-based) inference.
- Platform Support: Works on CUDA (Linux) and Metal (macOS).
- Advanced Features: Supports Model Context Protocol (MCP), tool calling, speculative decoding (via
--mtp), and chunked prefilling (default block size 8K).