音色创建
更新时间:2026-09-02
接口描述
通过上传训练音频来创建音色,支持音频链接与音频内容两种音频上传方式。若您希望快速体验相关功能,请点击链接进入大模型声音复刻体验专区。
POST
https://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/clone/create
权限说明
调用本能力需要使用API Key进行鉴权认证。获取及使用API Key的流程请参考:APIKey鉴权说明文档
请求参数
Headers 参数
除公共头域外,还包含以下特殊头域
Content-Type
string
application/json(业务JSON体)
必选
Query 参数
Body 参数
voice_name
string
音色名称,同一个用户下面,音色名称不能重复
必选
voice_desc
string
音色说明
可选
lang
string
创建的音色语种,目前支持的语种:
- 中英语:zh;
- 日语:ja;
若创建音色阶段未填写lang参数,默认为zh(中英语)。
若希望音色用于日语合成,建议选择ja参数,并使用10秒至30秒长度的日语音频作为注册音频。
若希望合成方言或控制语音情感,合成语种必须选择zh参数。
可选
audio_url
string
音频链接。支持:wav、mp3、m4a、ogg、aac。音频大小5M以内。
复刻中英音色,时长建议在5~20秒;复刻日语音色,时长建议在10~30秒。
两个参考同时传:以 audio_file 为准
可选
audio_file
string
音频内容base64
复刻中英音色,时长建议在5~20秒;复刻日语音色,时长建议在10~30秒。
可选
text_id
string
音频文本ID
可选
请求结构
POST https://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/clone/text
Authorization: API Key String
Content-Type: application/json
{
"voice_name":"音色名称",
"lang": "zh",
"audio_url": "音频链接",
"audio_file":f"{base64_audio}"
# 音频链接和音频内容二选一
}
示例代码
通过音频URL创建音色
curl --silent --location --request POST 'https://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/clone/create?access_token=XXXX' \
--header 'Content-Type: application/json' \
--data '{
"voice_name": "example",
"voice_desc": "温柔细腻的音色",
"audio_url": "https://bj.bcebos.com/example.wav",
"text_id": "text_5692181d-8825-40ec-b80f-87b79e3a9345"
}'
通过音频base64 编码创建音色
curl --silent --location --request POST 'https://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/clone/create?access_token=XXX' \
--header 'Content-Type: application/json' \
--data '{
"voice_name": "example",
"voice_desc": "温柔细腻的音色",
"audio_file": "音频 Base64 编码",
"text_id": "text_5692181d-8825-40ec-b80f-87b79e3a9345"
}'
返回响应
Headers 参数
除公共头域外,无其它特殊头域
返回参数
status
integer
错误状态。0创建成功,其他为异常
可选
message
string
错误信息
可选
data
string
对应发音人ID
可选
voice_id
integer
音色ID。唯一id
可选
音色创建注意事项:
大模型声音复刻的音色创建说明:
通过以上接口创建的音色,若在1年内没有调用合成记录,该音色将被删除,后续将无法使用。
大模型声音复刻和迁移能力说明:
大模型声音复刻分为复刻和迁移两种能力。复刻指保留声音语种/方言等特征的能力,迁移指保持音色特征的同时增加语种/方言等特征的能力。例如:
- 创建音色时输入普通话,合成普通话=复刻
- 创建音色时输入河南话,合成河南话=复刻
- 创建音色时输入普通话,合成河南话=迁移
大模型语种方言复刻说明:
- 目前支持河南话、上海话、四川话、贵州话、湖南话五种方言的复刻及迁移。为确保方言复刻迁移效果,建议您使用普通话或对应方言进行音色创建。
- 目前支持日语语种的复刻。为确保日语复刻效果,建议您使用10-30秒的日语内容进行音色创建。
- 为保证不同语种合成效果,建议您避免在音色创建和语音合成时选择不一致的lang参数,或者使用中日文混合的文本。
大模型情感迁移说明:
- emotion参数和合成文本的隐含情感不能相差太大,如果冲突以emotion参数为准。
- emotion参数和复刻音频情感理论上不能相差太大,如果冲突以emotion参数为准。合成语音会受到复刻音频声音特质的影响,请您结合实际效果选择emotion参数。
- 日语音色暂不支持语音情绪迁移。
返回码
| 返回码 | 提示信息 | 备注说明 |
|---|---|---|
| 0 | success | 处理成功 |
| 10014 | user concurrency limit exceeded | 用户的并发超限,如有高并发需求,请先提交合作咨询,或者提交工单 |
| 10015 | user usage limit reached | 用户的配额超限,如有高额度需求,请先提交合作咨询,或者提交工单 |
| 10020 | temporary service err, please try again | 服务临时错误,请稍候再试 |
| 10021 | voiceprint detection failed | 音频与文本匹配校验失败,请按照返回text进行朗读 |
| 10022 | text id not exists or text id already expire | text_id 不存在或者 text_id 已经超过 24 小时,请重新调用获取训练文本接口 |
| 10023 | download failed or audio file size exceeded limit | 音频URL不可访问或上传文件超过5M,请确保音频URL可访问并且上传文件小于等于5M |
| 10025 | the data has been deleted or does not have permission | 该音色不存在,或者该音色已经被开发者删除 |
| 10026 | invalid audio content | 文件内容无效,请提供格式正确的音频,避免修改音频后缀 |
| 10027 | voiceprint detection failed | 音频可能涉及敏感人物,请重新上传音频或尝试指定文本复刻 |
| 11000 | Synthesis exception | 合成异常,请检查音色和合成语音的语种是否一致 |
| 11002 | 限流无额度 | 用户的配额超限,如有高额度需求,请先提交合作咨询,或者提交工单 |
| 11003 | 限流并发超限 | 用户的并发超限,如有高并发需求,请先提交合作咨询,或者提交工单 |
| 11004 | text exceeded the limit | 文本超长,请缩短文本重试 |
| 11006 | No access permission for this voice_id | 当前voice_id 错误,请检查 voice_id 是否正确 |
| 11007 | token information or iam information must exist | 未传递有效的鉴权信息,请正确输入 access_token 鉴权信息或者 Iam鉴权信息 |
| 11008 | temporary service err, please try again | 服务临时异常,请稍候重试 |
| 11009 | required parameters are missing | 参数缺失,请检查输入参数 |
| 11010 | parameters are invalid | 参数无效,请检查输入参数 |
| 11011 | voice_id not exists | 当前的 voice_id 不存在,请检查 voice_id 是否正确 |
| 11012 | invalid page parameter, must be at least 1 | page 参数无效,请确保page参数大于等于 1 |
| 11013 | invalid base64-encoded audio content | 音频内容无效,请使用有效的 base64编码音频 |
| 11014 | this token/iam information invalid or has no access data permission | 用户没有访问该数据的权限,请检查账号权限 |
| 11015 | the text contains memorable vocabulary | 文本包含敏感信息,请去掉敏感信息后重试 |
| 12001 | the audio file is too short | 音频内容太短,请更换音频 |
| 12000 | download file failed | 文件下载失败,请检查音频下载链接 |
| 12002 | wer check failed | 未检测到有效音频,请根据返回text 进行朗读 |
| 12003 | audio detect snr failed | 未检测到有效音频,请根据返回text 进行朗读 |
| 12004 | recognition failed | 无有效的人声,请更换音频 |
| 12005 | detect audio level failed | 无有效的人声,请调整音量后重新复刻 |
| 12006 | detect audio speed failed | 无有效的人声,请调整语速后重新复刻 |
| 12007 | qualiry failed | 音频质量较差,请更换音频 |
评价此篇文章
