update:修改音色克隆教程

This commit is contained in:
hrz
2025-10-19 13:10:07 +08:00
parent e753c242ad
commit 48e2369964
4 changed files with 46 additions and 29 deletions
+46 -29
View File
@@ -1,39 +1,56 @@
# 火山双流式语音合成+音色克隆配置教程
使用火山引擎双向流式语音合成服务的同时进行声音克隆,支持WebSocket协议流式调用。
## 1.开通火山引擎服务
访问 https://console.volcengine.com/speech/app 在应用管理创建应用,勾选语音合成大模型和声音复刻大模型,左边列表点击声音复刻大模型后下滑获得App IdAccess TokenCluster ID以及声音ID(S_xxxxx)
# 智控台 火山双流式语音合成+音色克隆配置教程
### 2.全模块部署
1.填写配置。
如果你是全模块部署,请在智控台页面模型配置的语音合成页面,找到“火山双流式语音合成”,点击修改,将你火山引擎的App Id,Access Token以及声音ID(S_xxxxx)填进去。
#####注意:把资源idResource-Id)改成```volc.megatts.defaul```或```seed-icl-1.0```
本教程分为3个阶段:准备阶段、配置阶段、克隆阶段、使用阶段。主要是介绍通过智控台配置火山双流式语音合成+音色克隆的过程。
2.音色克隆。
准备一段8-60之间的音频文件,点击音色克隆菜单的音色资源,新增音色资源。回到音色克隆页面,点击上传音频。上传好音频之后点击复刻,等1~2秒会返回结果
复刻成功后,在“火山双流式语音合成”的“音色资源”里可以看到你复刻好的声音,也可以在配置角色使用“火山双流式语音合成”时选择复刻的音色了。
## 第一阶段:准备阶段
超级管理员先预先把火山引擎服务开通好,获取到App Id,Access Token。默认火上引擎会赠送一个音色资源。这个音色资源需要把它复制到本项目里
### 3.单模块部署
克隆音色请参照教程 https://github.com/104gogo/huoshan-voice-copy
如果你想克隆多个音色,需要购买开通多个音色资源。只要把每个音色资源的声音ID(S_xxxxx)复制到本项目。然后分配给系统的账号使用即可。以下是详细步骤:
1.音色克隆。
准备一段 10-30 秒的音频文件(.wav格式)添加到克隆的项目中,将平台获得的密钥填入```uploadAndStatus.py```和```tts_http_demo.py```
### 1.开通火山引擎服务
访问 https://console.volcengine.com/speech/app 在应用管理创建应用,勾选语音合成大模型和声音复刻大模型。
在uploadAndStatus.py中,将 audio_path=修改成自己的.wav文件名称
```python
train(appid=appid, token=token, audio_path=r".\audios\xiaohe.wav", spk_id=spk_id)
```
### 2.获取音色资源ID
访问 https://console.volcengine.com/speech/service/9999 复制三项内容,分别是App IdAccess Token以及声音ID(S_xxxxx)。如图
运行以下命令生成test_submit.mp3,点击播放试听克隆效果
![获取音色资源](images/image-clone-integration-01.png)
```python
python uploadAndStatus.py
python tts_http_demo.py
```
回到火山引擎控制台页面,刷新可以看到声音复刻详情的状态是复刻成功。
## 第二阶段:配置火山引擎服务
2.填写配置文件。(.config.yaml
### 1.填写火山引擎配置
注意:修改 resource_id的参数为``` volc.megatts.default```
speaker的参数填入声音ID(S_xxxxx)
使用超级管理员账号登录智控台,点击顶部【模型配置】,再点击模型配置页面左侧的【语音合成】,搜索找到“火山双流式语音合成”,点击修改,将你火山引擎的`App Id`填入到【应用ID】字段里,将`Access Token`填入到【访问令牌】字段里。然后保存。
启动服务,唤醒小智发出的声音是克隆的音色即成功。
### 2.将音色资源ID分配给系统账号
使用超级管理员账号登录智控台,点击顶部【音色克隆】、【音色资源】。
点击新增按钮,在【平台名称】选择“火山双流式语音合成”;
在【音色资源ID】填入你火山引擎的声音资源ID(S_xxxxx),填入后按回车;
在【归属账号】选择你要分配给的系统账号,你可以分配给你自己。然后点击保存
## 第三阶段:克隆阶段
如果登录后,点击顶部【音色克隆】》【音色克隆】,显示【您的账号暂无音色资源请联系管理员分配音色资源】,说明你在第二阶段还没有把音色资源ID分配给这个账号。那就是回到第二阶段,分配音色资源给对应的账号。
如果登录后,点击顶部【音色克隆】》【音色克隆】,能看到对应的音色列表。请继续。
在列表里会看到对应的音色列表。选择其中一个音色资源,点击【上传音频】按钮。上传后,可以试听一下声音或者截取某段声音。确认后点击【上传音频】按钮。
![上传音频](images/image-clone-integration-02.png)
上传音频后,在列表里会看到对应的音色会变成“待复刻”状态。点击【立即复刻】按钮。等1~2秒会返回结果。
如果复刻失败,请将鼠标放到“错误信息”图标上,会显示失败的原因。
如果复刻成功,在列表里会看到对应的音色会变成“训练成功”状态。此时你可以点击【声音名称】栏的修改按钮,修改音色资源的名称,方便后期选择使用。
## 第三阶段:使用阶段
点击顶部【智能体管理】,选择任意一个智能体,点击【配置角色】按钮。
语音合成(TTS)选择“火山双流式语音合成”。在列表里,找到名字带有“克隆音色”的音色资源(如图),选择它,点击保存。
![选择音色](images/image-clone-integration-03.png)
接下来,可以唤醒小智和它对话。
Binary file not shown.

After

Width:  |  Height:  |  Size: 143 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 96 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 129 KiB