智能语音质检-任务创建
更新时间:2026-09-02
将大批量的音频文件异步转写为文字。适合音视频字幕生产、批量录音质检、会议内容总结、录音内容分析等场景,一般12小时内返回识别结果。
语音质检接口可以通过声道进行说话人区分,或者通过模型(8953)对单声道音频进行说话人区分。并且支持创建质检规则,对符合质检规则的ASR文本进行标记。
POST
http://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/detection
调用分为两个步骤:
- 根据音频url/base64编码、音频格式、语言id、采样率、session_id等参数,创建质检任务。
- 根据task_id的数组批量查询音频转写任务结果。
本文档以下内容主要介绍如何创建任务,查询结果请参考智能语音质检-查询结果
权限说明
调用本能力需要使用API Key进行鉴权认证。获取及使用API Key的流程请参考:APIKey鉴权说明文档
请求参数
Headers 参数
除公共头域外,还包含以下特殊头域
Content-Type
string
application/json
可选
Authorization
string
使用API Key鉴权方式时,将API Key或短期API Key放在此处。注意需要在API Key信息前加上 Bearer 。示例: Bearer bce-v3/ALTAK-xxxxxx/614fbxxxxxx
必选
Body 参数
speech_url
string
可外网访问的音频文件url链接(与speech_data二选一)
必选
speech_data
string
音频文件base64结果(与speech_url二选一)
必选
session_id
string
音频质检任务唯一标识
必选
sample_rate
integer
音频采样率可选择8000或16000,默认8000
可选
pid
integer
音频识别模型id,可选择80006
必选
callback_url
string
质检后结果回调路径
可选
role_num
integer
pid为80006时,由声道区分说话人数,只允许1/2,默认为1 pid为8953时由算法自动判断说话人,本参数无需填写
可选
enable_detection
boolean
是否进行质检,默认false
可选
enable_detection_detail
boolean
是否返回质检结果详情,默认false
可选
is_split_channel
boolean
是否进行左右声道拆分,默认false 当开启为true时,计费时长=左声道有效时长(不含静音)+右声道有效时长(不含静音)(pid使用8953时参数传false)
可选
categories
string
应用到质检的规则,不填写默认全部
可选
示例代码
cURL
curl --location 'http://aip.baidubce.com/rest/2.0/speech/publiccloudspeech/v1/voice/detection' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer bce-v3/ALTAK-xxxxxx/614fbxxxxxx' \
--data '{
"speech_url": "https://XXXXX",
"speech_data": "base64",
"session_id": "test20260812",
"sample_rate":8000,
"pid": 8953,
"role_num": 1,
"callback_url": "",
"enable_detection_detail": true,
"enable_detection": true ,
"is_split_channel": false
}'
返回响应
Headers 参数
除公共头域外,无其它特殊头域
返回参数
error_code
integer
请求状态码
可选
error_message
string
请求状态
可选
result
object {1}
可选
显示子属性
隐藏子属性
session_id
string
音频质检任务唯一标识
可选
JSON
{
"error_code": 0,
"error_message": "请求成功",
"result": {
"session_id": "test20240220"
}
}
评价此篇文章
