Overview of Bespoke Curator
mainBespoke Curator is a Python library designed for creating scalable synthetic data pipelines. It is used for generating and curating high-quality data for model training (finetuning/distillation) or structured data extraction.
Key features include:
- Synthetic Data Generation: Rich Python-based library for generating and curating data.
- Monitoring: A built-in viewer to monitor data generation in real-time.
- Structured Outputs: First-class support for ensuring LLM outputs follow specific schemas.
- Performance & Reliability: Built-in optimizations for asynchronous operations, caching, and fault recovery.
- Flexible Inference: Supports various inference backends via LiteLLM, vLLM, and popular batch APIs (including OpenAI, Anthropic, and Gemini).