Core Features and Capabilities
mainThe Fast-Powerful-Whisper-AI-Services-API is a high-performance, asynchronous speech recognition service built on OpenAI Whisper and Faster Whisper.
Key Capabilities:
- Asynchronous Model Pool: Supports multi-instance concurrent processing. In multi-GPU environments, it dynamically assigns models to GPUs to balance load. (Note: Concurrency is not available on single-GPU setups).
- Task Management: Supports creating tasks via media file upload (
file_upload) or media links (file_url). - Task Types: Supports
transcribe(transcription) andtranslate(automatic translation). - Priority Levels: Tasks can be assigned
high,normal, orlowpriority. - Web Crawlers: Built-in support for processing videos from
DouyinandTikTokvia links. - Callbacks: Supports
callback_urlto receive an HTTP POST request upon task completion. - Subtitle Generation: Can generate
.srtor.vttsubtitle files from atask_id. - ChatGPT Integration: Allows using task data to interact with ChatGPT for summarization and analysis.