采用国际领先的流式端到端语音语言一体化建模算法,将语音快速准确识别为文字 了解详情 通用场景文字识别 覆盖多种通用场景、20+种语言的高精度整图文字检测和识别服务 了解详情 卡证文字识别 识别身份证、银行卡、营业执照等常用卡片及证照,支持营业执照信息的准确性核验 了解详情 图像识别 精准识别超过十万种物体和场景,包含10余项高精度的识图能力 了解详情 机器翻译 支持多达200+个语种高质量互译,覆盖
合大语言模型,可应用于看图问答、视觉推理等场景 物体和场景全识别 识别动物、植物、商品、建筑、风景、动漫、食材、公众人物等10万个常见物体及场景,支持拼接返回大类及细分类名称 图片文字全识别 检测并识别图片内的全部文字信息
采用国际领先的流式端到端语音语言一体化建模算法,将语音快速准确识别为文字 通用场景文字识别 覆盖多种通用场景、20+种语言的高精度整图文字检测和识别服务 卡证文字识别 识别身份证、银行卡、营业执照等常用卡片及证照,支持营业执照信息的准确性核验 图像识别 精准识别超过十万种物体和场景,包含10余项高精度的识图能力 机器翻译 支持多达200+个语种高质量互译,覆盖4万多个语言方向,日均响应千亿字符翻译请求
同一个API Key可同时调用AI开放能力( 文字识别 、 人脸识别 、 语音技术 等)、大模型服务与开发平台 ModelBuilder 、大模型应用开发平台 AppBuilder 的接口服务,降低您接入AI服务的成本。 简化调用步骤 。API Key既可直接使用明文调用接口进行鉴权,也可以换成 短期APIkey 后再进行鉴权。
模糊词识别:支持用户表述中左右,大约,上下等表述的识别,以表格场景为单位,支持用户对数值类型属性模糊区间进行限制,比如:+-10%。 在表格知识管理页面点击“管理”按钮后,进入表格详情页面。 表格数据 在表格数据分栏,可以点击“添加表格数据”按钮,可增加表格中的数据。 对表格数据进行了简单的统计,其中包括属性与表格行数的统计。 支持对表格实体进行模糊的查询。
优先级:image > url > pdf_file,当image 字段存在时,url、pdf_file 字段失效 pdf_file_num 否 string 需要识别的 PDF 文件的对应页码,当pdf_file 参数有效时,识别传入页码的对应页面内容,若不传入,则默认识别第 1 页 change_degree 否,当 image、url或 pdf_file 字段存在时,为必需项 integer
停止识别,但保留当前识别结果。
其中, 文字OCR可对网页截图、办公文档、表格、题目公式、海报广告等进行解析; 人物识别包含演员、歌手、企业家等公众人物,可参考百度百科词条人物(不包含国内国际政要等敏感人物); 植物识别能力可识别常见的树木、花卉、农作物等;商品识别能力可输出常见商品名称; 车辆识别包含常见车型、品牌以及颜色等属性。
使用态:导出文档 简介 支持将Markdown中的文字导出为.doc(x)文档或.pdf文档 导出完成后,用户可在右侧导出列表查看并下载导出文档 导出成功的文档默认以【文章主题】命名,保留在云端,支持重复下载
支持WORD/PPT/PDF等格式文本文件、表格文件、图片等文件格式,并独家支持音频文件的解析及混合检索 支持文字图表混排格式报告生成,包括Markdown、HTML格式输出,以及PPT进一步生成的能力 执行流程 具体执行流程包括检索配置、需求澄清、大纲生成及编辑、全文报告生成等步骤。 检索配置 支持进行信息检索增强配置。除联网检索外,支持添加本地文件作为参考信源,完成混合检索任务。