| 开源协议 | MIT(模型)/ Apache 2.0(部分组件) |
| GitHub | https://github.com/RVC-Boss/GPT-SoVITS |
| 核心特点 | 低资源语音克隆TTS系统,5秒零样本/1分钟少样本即可训练 |
| 架构 | 双模型协同:GPT模块(文本语义理解+韵律预测)+ SoVITS模块(声码器转换) |
| 语言支持 | |
| v4版本突破 | 48KHz高清音质、三重降噪消除金属音、推理速度提升300%、显存占用降低50% |
| 性能 | RTX 4090上RTF 0.014(400词/秒);4GB显存可运行 |
| 部署 | WebUI(Gradio)+ GUI(PyQt6)+ API服务器 |
| 优势 | 声音克隆还原度极高(99.8%官方数据);本地运行无限制;中文适配强 |
| 短板 | 需技术能力部署;训练需GPU;WebUI界面不够精致 |
| 适合人群 | 喜欢折腾的技术用户、想要免费无限制配音、自制专属音色、隐私敏感场景 |