智能语音质检-任务创建
将大批量的音频文件异步转写为文字。适合音视频字幕生产、批量录音质检、会议内容总结、录音内容分析等场景,一般12小时内返回识别结果。
语音质检接口可以通过声道进行说话人区分,或者通过模型(8953)对单声道音频进行说话人区分。并且支持创建质检规则,对符合质检规则的ASR文本进行标记。
调用分为两个步骤:
- 根据音频url/base64编码、音频格式、语言id、采样率、session_id等参数,创建质检任务。
- 根据task_id的数组批量查询音频转写任务结果。
本文档以下内容主要介绍如何创建任务,查询结果请参考智能语音质检-查询结果
权限说明
调用本能力需要使用API Key进行鉴权认证。获取及使用API Key的流程请参考:APIKey鉴权说明文档
请求参数
application/json
使用API Key鉴权方式时,将API Key或短期API Key放在此处。注意需要在API Key信息前加上 Bearer 。示例: Bearer bce-v3/ALTAK-xxxxxx/614fbxxxxxx
可外网访问的音频文件url链接,可使用对象存储进行音频存储,生成可访问的url链接,音频大小不超过500MB,url长度不超过2048字节(与speech_data二选一)
音频文件base64结果(与speech_url二选一)
音频质检任务唯一标识
音频采样率可选择8000或16000,默认8000
音频识别模型id,可选择80006
质检后结果回调路径
pid为80006时,由声道区分说话人数,只允许1/2,默认为1 pid为8953时由算法自动判断说话人,本参数无需填写
是否进行质检,默认false
是否返回质检结果详情,默认false
是否进行左右声道拆分,默认false 当开启为true时,计费时长=左声道有效时长(不含静音)+右声道有效时长(不含静音)(pid使用8953时参数传false)
应用到质检的规则,不填写默认全部
示例代码
curl --location 'http://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/detection' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer bce-v3/ALTAK-xxxxxx/614fbxxxxxx' \
--data '{
"speech_url": "https://XXXXX", //(与speech_data二选一)
"speech_data": "base64", //(与speech_url二选一)
"session_id": "test20260812",
"sample_rate":8000,
"pid": 8953,
"role_num": 1,
"callback_url": "",
"enable_detection_detail": true,
"enable_detection": true ,
"is_split_channel": false
}'
返回响应
请求状态码
请求状态
显示子属性
隐藏子属性
音频质检任务唯一标识
{
"error_code": 0,
"error_message": "请求成功",
"result": {
"session_id": "test20240220"
}
}
评价此篇文章
