fish-speech
Fish-Speech是由Fish Audio团队开发的一款开源文本转语音(TTS)模型,它基于VQ-GAN、Llama和VITS等技术开发,采用了Transformer架构,这是一种在自然语言处理任务中表现卓越的神经网络结构。同时,它还使用了多任务学习方法和先进的神经网络声码器,以实现高质量的语音合成。Fish-Speech支持包括中文在内的多种主流语言,使得用户在跨文化交流中能够自如地表达自己。仅需15秒的音频样本,Fish-Speech便能迅速实现声音克隆,生成与目标声音高度相似的语音。
支持自启动
0GB
73
推荐显存: 24G
上传时间:2025/01/14