Overview of TTS Audio Suite
mainTTS Audio Suite is a universal multi-engine Text-to-Speech (TTS) extension for ComfyUI. It provides a unified interface for various audio tasks including:
- Text-to-Speech (TTS): Support for numerous engines (e.g., F5-TTS, ChatterBox, Higgs Audio, MOSS-TTS, Fish Audio S2 Pro).
- Voice Conversion (VC): Real-time voice conversion and integrated RVC (Real-time Voice Conversion) model training.
- Audio Editing: Tools for speech editing, emotion control, and sound effect generation.
- Subtitle Workflows: Capabilities to transcribe to SRT, rebuild subtitles from edited transcripts, or estimate SRT timing from plain text using advanced readability rules.
- ASR (Automatic Speech Recognition): Integrated ASR capabilities (e.g., Qwen3-TTS, Granite ASR) for transcription and speaker attribution.
The suite features a modular architecture designed for extensibility and runtime isolation to support diverse and potentially conflicting engine requirements.