TTS开源语音阿里 多模态模型
CosyVoice(阿里开源 TTS) CosyVoice 2
CosyVoice系列 · 阿里(FunAudioLLM) · 2024-04发布
模型介绍
阿里开源语音生成模型 CosyVoice,零样本语音克隆、多语种支持,音色自然,Apache-2.0 可商用。
模型基础信息
模型系列CosyVoice系列
开发机构阿里(FunAudioLLM)
发布时间2024-04
参数规模约 2B
上下文窗口文本转语音
模型类型文本转语音
中文能力优秀
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源免费
免费规则详情
Apache-2.0 可商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 零样本克隆
- 多语种
- 自然度高
- pache
⚠️ 短板与局限
- 需一定显卡
- 情感控制有限
- 长音频一般
🎯 适用场景
- 语音合成
- 有声书
- 语音克隆
- 配音
模型使用教程
本章节整理 CosyVoice(阿里开源 TTS) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
输入文本或音频生成语音 / 音乐。
示例:为文案生成配音「欢迎使用 AI 语音合成」
注册 阿里(FunAudioLLM) 账号获取 API Key。
export API_KEY=sk-xxxx
上传音频或文本,返回合成结果。示例见 阿里(FunAudioLLM) 官方文档。
CosyVoice 是阿里开源的 TTS 模型,CosyVoice2(0.5B)约 6-8GB 显存即可运行。
- 克隆仓库:
git clone --recursive https://github.com/FunAudioLLM/CosyVoice && cd CosyVoice - 安装依赖:
pip install -r requirements.txt(建议 Python 3.10 + CUDA)。 - 将权重放到 pretrained_models/(用 hf-mirror 下载 CosyVoice2-0.5B,约 2GB)。
- 零样本克隆合成(中文女声):
python cosyvoice/run.py --mode sft --llm CosyVoice2-0.5B --text "你好,欢迎使用 CosyVoice" --spk bailing
- 试听与更多音色:项目 examples 目录带示例音频,可直接替换参考音频做克隆。
Tips:js/trt 加速可选,一般 CPU/单卡即可稳定合成。
💡 使用小技巧
中文音色效果好。
❓ 常见问题 FAQ
Q1:CosyVoice 能克隆声音吗?\nA1:支持零样本克隆。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com