提交解析请求接口
面向企业办公与知识库场景的结构化文档解析服务:支持 PDF、Word、Excel、图片等 18 种主流格式,自动完成版面分析、表格还原、标题层级与阅读顺序识别,并可输出 Markdown 等结构化结果,识别准确率可达 90% 以上;同时具备角度矫正、水印擦除等工程能力,支持 20 余种语种。
权限说明
调用本文API,需使用API Key鉴权方式。使用API Key鉴权调用API流程,具体调用流程,请查看认证鉴权
请求参数
API Key 鉴权,示例值:Bearer {API-Key}
application/x-www-form-urlencoded
和file_url二选一,文件的base64编码数据: -版式文档:pdf、jpg、jpeg、png、bmp、tif、tiff、ofd、ppt、pptx -流式文档:doc、docx、txt、xls、xlsx、wps、html、mhtml 文档大小不超过50M,其中PDF文档最大支持2000页 若文档大小超过50M,须从file_url方式上传。 优先级: file_data > file_url,当file_data字段存在时,file_url字段失效
和file_data二选一,文件数据URL,URL长度不超过1024字节,支持单个URL传入。 PDF文档大小不超过300M,非PDF文档大小不超过50M,其中PDF文档最大支持2000页 优先级: file_data > file_url,当file_data字段存在时,file_url字段失效 请注意关闭URL防盗链
文件名,请保证文件名后缀正确,例如 申请书.pdf
是否对版式类型文档进行公式识别
是否对统计图表进行解析
是否对图片进行矫正
是否返回文档中的图片位置信息
识别语种类型,默认为CHN_ENG,可选值:CHN_ENG(中英文)、JAP(日语)、KOR(韩语)、FRE(法语)、SPA(西班牙语)、POR(葡萄牙语)、GER(德语)、ITA(意大利语)、RUS(俄语)、DAN(丹麦语)、DUT(荷兰语)、MAL(马来语)、SWE(瑞典语)、IND(印尼语)、POL(波兰语)、ROM(罗马尼亚语)、TUR(土耳其语)、GRE(希腊语)、HUN(匈牙利语)、THA(泰语)、VIE(越南语)、ARA(阿拉伯语)、HIN(印地语)
是否对数字进行全半角转换,默认为auto。可选值:auto(不转换,按模型识别结果输出)、half(将所有符号转换为半角输出)、full(将所有符号转换为全角输出)
是否将识别出的表格转换为HTML格式返回,default=True
是否返回文档切分后的片段数据(如按语义、字数、标点)。可按下方说明进行传参
显示子属性
隐藏子属性
是否进行文档内容切分,default=False
切分方式,default=chunk。可选值:chunk(按chunk_size指定字符长度切)、mark(按separators指定标点切)
切分标点列表,split_type=mark时生效,default=['。',';','!','?',';','!','?']
显示子属性
隐藏子属性
单个切分标点符号,例如'。'
切分块的大小。chunk_size=-1时按语义自动切分,不限定块大小;chunk_size>0时按字符长度切
只解析指定页,页码从0开始。格式:4(单页)、0-2(闭区间)、0-2,4,7-9。流式文档不支持
查询成功时额外返回整份PDF的pdf_file_url,default=false
检测印章,输出type=seal的框,default=false
识别章面文字,开启后自动打开detect_seal,default=false
擦除印章。优先级高于章面识别;与recognize_seal同时开时保留检测框、去掉文字。建议不要和章面识别同时开,default=false; 印章参数组合说明: detect_seal=false、recognize_seal=false、erase_seal=false → 不做印章; detect_seal=true、recognize_seal=false、erase_seal=false → 只有检测框; recognize_seal=true、erase_seal=false → 检测 + 章面文字(自动打开检测); erase_seal=true → 擦除章面;若同时识别,框还在、文字去掉
去水印仅用于识别前增强,返回的页面图/PDF不会去掉水印,default=false
图片占页面面积低于该阈值则丢弃,不写入images,default=0.1
将Word转成PDF再按版式解析,转完后可以使用page_filter,default=false
繁体转简体,default=false
POST /rest/2.0/brain/online/v2/parser/task HTTP/1.1
Host: aip.baidubce.com
Authorization: Bearer <API Key>
Content-Type: application/x-www-form-urlencoded
file_name=申请书.pdf&file_url=https%3A%2F%2Fyour-domain.com%2Fpath%2Fto%2F申请书.pdf&detect_seal=true&recognize_seal=true&need_pdffile_data=true
示例代码
import base64
import os
import requests
API_KEY = "bce-v3/ALTAK-xxxxxxxx/xxxxxxxxxxxxxxxx"
CREATE_URL = "https://aip.baidubce.com/rest/2.0/brain/online/v2/parser/task"
def create_task(file_path):
with open(file_path, "rb") as f:
file_data = base64.b64encode(f.read()).decode("utf-8")
data = {
"file_data": file_data,
"file_name": os.path.basename(file_path),
"erase_seal": "false",
"erase_watermark": "false",
"traditional2simplified": "false",
"detect_seal": "true",
"recognize_seal": "true",
}
headers = {
"Content-Type": "application/x-www-form-urlencoded",
"Authorization": f"Bearer {API_KEY}",
}
return requests.post(CREATE_URL, headers=headers, data=data, timeout=120)
if __name__ == '__main__':
print(create_task("./test.pdf").json())
返回响应
唯一的log id,用于问题定位
错误码
错误描述信息
返回的结果列表
显示子属性
隐藏子属性
该请求生成的task_id,后续使用该task_id获取解析结果
{
"error_code": 0,
"error_msg": "",
"log_id": "10138598131137362685273505665433",
"result": {
"task_id": "task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S"
}
}
错误码
如果调用失败并返回报错信息,请参见以下错误码进行解决: 公共错误码:查看公共错误码 OCR 错误码:查看 OCR 错误码
评价此篇文章
