Overview of 🐸TTS Features and Model Types
dev🐸TTS is a library for advanced Text-to-Speech generation, supporting over 1100 languages. It provides tools for training, fine-tuning, and dataset curation.
Core Capabilities
- High-performance Deep Learning models: Includes Text2Spec models, Speaker Encoders, and Vocoders.
- Training Utilities: Fast model training with detailed logs via terminal and Tensorboard.
- Multi-speaker Support: Capability to handle multiple voices.
- Trainer API: An efficient, flexible, and lightweight API for model training.
- Dataset Tools: Utilities under
dataset_analysisfor curating Text2Speech datasets.
Model Implementations
- Spectrogram Models: Tacotron, Tacotron2, Glow-TTS, FastSpeech, etc.
- End-to-End Models: XTTS, VITS, YourTTS, Tortoise, and Bark.
- Vocoders: MelGAN, HiFiGAN, WaveGrad, etc.
- Voice Conversion: FreeVC.