FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis

Benchmark Model Rank Results
text-to-speech-synthesis-on-ljspeechFastDiff (4 steps)#7Audio Quality MOS: 4.28
text-to-speech-synthesis-on-ljspeechFastDiff-TTS#8Audio Quality MOS: 4.03