会议等场景 了解详情 音频文件转写 将批量上传的音频文件识别为文字,12小时内返回识别结果。
ID;全局唯一 可选 url string 续写前视频的URL,注意:为保障信息安全,生成的图片/视频会在30天后被清理,请及时转存 可选 duration string 续写前的视频总时长,单位s 可选 task_result object {1} 返回结果 可选 显示子属性 隐藏子属性 videos array 视频信息 可选 显示子属性 隐藏子属性 items object {3} 显示子属性
该URL必须支持直接下载视频文件,而非在线播放链接,以确保能够正常获取并处理视频内容。\n\n1. 视频时长应不低于15s,且视频画面中要有人物发言声音,否则不支持生产\n2.
包含生成视频的下载url 可选 显示子属性 隐藏子属性 video_url string 视频生成的url 可选 height string 生成视频的高度 可选 width string 生成视频的宽度 可选 duration integer 生成视频的时长(单位:秒) 可选 响应示例 复制 { id : 271****794 , total : 1 , items : [ {
生成视频中的人物动作与参考视频一致。
例如,输入源1处于PVW,则播放的也是输入源1的音频;如布局1(由输入源2和3组成)处于PVW,则播放的是布局1(输入源2和输入源3混合)的音频。 同步切换音轨处于非勾选状态时,可以将音频和视频分离。例如,输入源1处于PVW中,可以选择播放任何输入源的音频。
支持 .mp3 / .wav / .mp4 / .mov 格式的音视频文件。 音频中人声需干净无杂音,有且只能有一种人声。 时长不短于 5 秒且不长于 30 秒。 可选 video_id string 历史作品 ID,可通过引用历史作品提供音频素材。 仅满足以下条件的视频可以用于定制音色: 使用 K2.6 版本模型生成且开启 sound 参数值为 on 的视频。 通过数字人 API 生成的视频。
通过采集5-20s的清晰音频,即可获取情感语调与教学风格高度还原的复刻发音人。 同时,复刻语音可无缝对接制课平台,直接合成课程文本,输出讲解音频。轻量化语音复刻,无需专业录音设备与流程,彻底替代传统录音环节,让用户可以一键生成高保真、个性化教学语音,大幅提升制课效率与课程真实感。
使用产品 智能对话定制与服务平台UNIT 对话情绪识别 词义相似度 短文本相似度 音频文件转写 支持与交流 AI社区 教学视频 文档中心 SDK下载 百度大脑助力打造车企高质量电销语音质检平台 价值成果 慧逊科技使用百度语音识别技术、智能对话定制与服务平台UNIT,为汽车企业成功打造电话销售语音质检平台,提供多维度的质检报告让汽车厂商全面掌控电销业务质量。
支持 .mp3 / .wav / .mp4 / .mov 格式的音视频文件。 音频中人声需干净无杂音,有且只能有一种人声。 时长不短于 5 秒且不长于 30 秒。 可选 video_id string 历史作品 ID,可通过引用历史作品提供音频素材。 仅满足以下条件的视频可以用于定制音色: 使用 K2.6 版本模型生成且开启 sound 参数值为 on 的视频。 通过数字人 API 生成的视频。