互动直播 音视频连麦 支持视频和音频连麦互动、视频连麦时的画中画交互、布局可自定义。 旁路直播 支持服务端合流后,转直播推流。 美颜特效 美颜滤镜 支持美白磨皮和大眼瘦脸等美颜效果,支持多种实时滤镜效果。 Avatar虚拟形象 支持人脸表情实时驱动虚拟主播,亦可定制专属形象。 基础拍摄 基础拍摄 支持拍摄时的前后摄像头切换、闪光灯的关闭,IOS支持拍摄时防抖。
200 /次起 立即购买 语音转文字服务 语音转文字服务按照音频总时长定价,分为10小时、50小时、100小时三种规格。 ¥ 200 /次起 立即购买 文字转语音服务 文字转语音服务按照字符数量定价,每次服务10万字以内。 ¥ 500 /次起 立即购买 服务流程 相关产品 重大活动保障服务 针对不同保障目标和保障级别要求,专项定制化实施保障,协助确保客户活动期间业务稳定。
立即咨询 低至1.3s 端到端音频延时 小于0.8s 语音打断延时 低至2.0s 端到端视觉延时 适用客户群体 科技创新企业 以AI眼镜为主业的科创公司 智能化基础架构层资源 一站式训推一体平台 互联网公司 基于AI眼镜重构业务的企业 垂类场景的模型效果优化 即插即用的AI交互能力 传统企业 依托AI眼镜战略转型的企业 智能交互的端到端交付 快速整合助推产品迭代 零部件厂商 眼镜零部件厂商+模组厂商
长文本合成 可以将10万字以内文本一次性合成,异步返回音频。支持多种优质音库,将超长文本快速转换成稳定流畅、饱满真实的音频。 https://aip.baidubce.com/rpc/2.0/tts/v1/create 适用于阅读听书、视频配音等文字量大、时效性要求低的场景。 快速开始 使用前请参考 API Key认证鉴权 获取 API Key ,用于语音合成服务的认证鉴权。
输入:将用户的输入指令转为Inference的输入数据,包括加载并读取本地音频、在线音频,调用TTS获取文本转语音的音频等。 输出:将Inference的输出给到用户,由用户自己处理。
媒体 短文本语音合成 高拟人短句朗读 单句或短文本发音 英语单词学习、会议提醒 @短文本语音合成 生成短语音 教育、办公 短语音识别 60秒语音转文字 短语音输入、语音指令 语音输入、语音搜索 @短语音识别 转文字输入 智能助手、工具类
AI成片 AI成片-图文转视频 各接口用途说明 AI 成片,输入图文视频素材,一键生成短视频,自动实现配音、加字幕、素材匹配等环节。适用于企业宣传、营销推广、知识科普等场景,帮助创作者实现精美视频的快速产出。AI 成片涉及2个接口,分别为:AI 成片-图文转视频、AI 成片-查询结果。 AI 成片-图文转视频 :支持传入文本、图片、视频、背景音乐等参数,创建 AI 成片任务,获得任务ID。
例如:店铺自播、广告营销短视频等。 ● 训练视频需闭口录制,视频的音频可有可无,30分钟即可完成训练。
文件区支持: 功能 说明 文件上传 支持上传任意格式文件 文件预览 支持预览文档、表格、PPT、图片、视频、音频等内容 文件下载 支持下载生成内容 产物流转 支持基于已有文件继续执行新任务 当前支持预览的文件类型包括: 文档:doc、docx、pdf、txt、md 表格:xls、xlsx、csv 图片:jpg、png、gif、webp 等 视频:mp4、mov、webm 等 音频:mp3、wav 等
解决方案 面对政务舆情具有监测范围广、数据量级大、信息内容杂和准确率要求高等特点,贝赛科技推出的 火蓝大数据舆情服务平台 深度集成了百度AI的技术,同时利用自主知识产权CST智能采集技术,全面覆盖监测视频、音频、图片等多媒体文件,对电视台、广播台、网络传播的图片进行有效监测。 此外,还利用文字识别、语音识别技术,有效拓宽了舆情监测范围。