Overview of DiffSinger and DiffSpeech Pipelines
masterDiffSinger provides several Mel pipelines depending on the task (SVS vs TTS), dataset, and input type (MIDI vs Lyric).
| Pipeline | Task | Dataset | Pitch Input | F0 Prediction | Acceleration | Vocoder |
|---|---|---|---|---|---|---|
| DiffSpeech | TTS | Ljspeech | None | Explicit | Shallow Diffusion | HiFiGAN |
| DiffSinger | SVS | PopCS | Ground-Truth F0 | None | Shallow Diffusion | NSF-HiFiGAN |
| DiffSinger | SVS | OpenCpop | MIDI | Explicit | Shallow Diffusion | NSF-HiFiGAN |
| FFT-Singer | SVS | OpenCpop | MIDI | Explicit | Invalid | NSF-HiFiGAN |
| DiffSinger | SVS | OpenCpop | MIDI | Implicit | None | Pitch-Extractor + NSF-HiFiGAN |
| DiffSinger+PNDM | SVS | OpenCpop | MIDI | Implicit | PLMS | Pitch-Extractor + NSF-HiFiGAN |
| DiffSpeech+PNDM | TTS | Ljspeech | None | Implicit | PLMS | HiFiGAN |