Overview of Supported Models in TTS WebUI
mainTTS WebUI supports a wide range of models categorized into Text-to-speech, Audio/Music Generation, and Audio Conversion/Tools. Note that models marked with an asterisk (*) are not installed by default and must be added via the Extensions system.
Text-to-speech
- Bark, Tortoise, Maha TTS, MMS, Vall-E X, StyleTTS2, SeamlessM4T, XTTSv2*, MARS5*, F5-TTS*, Parler TTS*, OpenVoice*, OpenVoice V2*, Kokoro TTS*, DIA*, CosyVoice*, GPT-SoVITS*, Piper TTS*, Kimi Audio 7B Instruct*, Chatterbox*, VibeVoice*, Kitten TTS*, Index-TTS2*, VoxCPM*, FireRedTTS2*, MegaTTS3*
- MiniMax Cloud TTS (built-in)
Audio/Music Generation
- MusicGen, MAGNeT, Stable Audio, Riffusion*, AudioCraft Mac*, AudioCraft Plus*, ACE-Step*, Song Bloom*
Audio Conversion/Tools
- RVC, Demucs, Vocos, Whisper, AP BWE, Resemble Enhance, Audio Separator, PyRNNoise*, MiMo Audio*