FishTTS克隆开源 多模态模型
Fish Speech(开源 TTS) Fish Speech 1.5
Fish Speech系列 · Fish Audio · 2023-11发布
模型介绍
Fish Speech 开源多语言 TTS,15 秒音频即可克隆音色,中文效果好,社区热度高。
模型基础信息
模型系列Fish Speech系列
开发机构Fish Audio
发布时间2023-11
参数规模1B
上下文窗口文本转语音
模型类型文本转语音
中文能力优秀
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源(非商业)
免费规则详情
CC-BY-NC 非商业;商业需授权。
收费标准简介
本地免费(非商业)。
模型能力介绍
✅ 核心优势
- 克隆音色快
- 中文好
- 多语�
- 社区热
⚠️ 短板与局限
- 非商业许可
- 情感一般
- 需显卡
🎯 适用场景
- 配音
- 游戏角色
- 有声内容
- 研究
模型使用教程
本章节整理 Fish Speech(开源 TTS) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
输入文本或音频生成语音 / 音乐。
示例:为文案生成配音「欢迎使用 AI 语音合成」
注册 Fish Audio 账号获取 API Key。
export API_KEY=sk-xxxx
上传音频或文本,返回合成结果。示例见 Fish Audio 官方文档。
Fish Speech 支持本地运行,1B 模型约 8GB 显存即可合成。
- 克隆仓库:
git clone https://github.com/fishaudio/fish-speech && cd fish-speech - 安装依赖:
pip install -e .(Python 3.10+ / PyTorch 2.1+)。 - 下载权重:checkpoints/fish-speech-1.5(约 1.5GB,hf-mirror 可下),另需 VQGAN 权重。
- 用参考音频克隆音色:
python tools/vqgan/inference.py -i reference.wav -o output.wav 先转语音 token,
再 python tools/llama/generate.py -t 5s.wav -p "你好,这是一段本地合成的声音。" 合成。
- 也提供 webui:
python tools/webui/app.py打开本地界面直接操作。
Tips:参考音频建议 5-15 秒、无背景噪音,克隆效果更好。
💡 使用小技巧
15 秒音频即可克隆。
❓ 常见问题 FAQ
Q1:Fish Speech 特色?\nA1:快速音色克隆。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com