提交解析请求接口
PaddleOCR-VL-1.6-0.9B :多模态文档解析领域的 SOTA 方案,具备全要素精准解析能力,可高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素;基于人类阅读习惯智能推断内容排列顺序,将零散页面信息转化为有序带标签的结构化元素序列,同时支持行级别坐标精准输出。方案覆盖中、英、日、韩、拉丁文等 100+ 种语言,完美适配全球化多语种文档处理需求;还可攻克不规则布局定位、长文档跨页解析等行业难点,全面覆盖企业级复杂文档处理场景。
权限说明
调用本文API,需使用API Key鉴权方式。使用API Key鉴权调用API流程,具体调用流程,请查看认证鉴权
请求参数
API Key 鉴权,示例值:Bearer {API-Key}
application/x-www-form-urlencoded
和file_url二选一,文件的base64编码数据。 -版式文档:pdf、jpg、jpeg、png、bmp、tif、tiff、ofd,图片最长边不大于8192px -流式文档:doc、docx、txt、wps、ppt、pptx 图片不超过10M,版式文档不超过100M,流式文档不超过50M,PDF最大支持500页 若文档大小超过50M须从file_url方式上传 优先级:file_data > file_url,当file_data存在时file_url失效
和file_data二选一,文件数据URL,URL长度不超过1024字节,支持单个URL传入。 PDF文档不超过100M,最大支持500页 优先级:file_data > file_url,当file_data存在时file_url失效 请注意关闭URL防盗链
文件名,请保证文件名后缀正确,例如 1.pdf
是否对版式类型文档进行公式识别。无需开启,大模型默认对版式类型文档进行公式识别
是否对统计图表进行解析
是否返回文档中的图片位置信息。无需开启,大模型默认解析文档中的所有图片
识别语种类型。无需开启,大模型默认识别语种类型
是否将跨页表格合并输出,开启后tables内将返回跨页表格的合并标识,并将合并内容存放在table_html和markdown下
是否对段落标题(paragraph_title)进行分级,开启后会在sub_type中输出对应的标题级别
是否识别印章内容
是否返回行坐标
角度矫正,默认为true
角度矫正模式,开启angle_adjust后生效,默认为direction。可选值:direction(四方向)、arbitrary(任意方向)
印章擦除,默认为false
水印擦除,默认为false
图像扭曲矫正,默认为false
POST /rest/2.0/brain/online/v2/paddle-vl-parser/task HTTP/1.1
Host: aip.baidubce.com
Authorization: Bearer YOUR_API_KEY
Content-Type: application/x-www-form-urlencoded
file_data=base64编码的文件内容&file_name=test.pdf
示例代码
import requests
import os
import base64
API_KEY = "bce-v3/ALTAK-xxxxxxxx/xxxxxxxxxxxxxxxx"
CREATE_URL = "https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task"
def create_task(file_path, file_url=""):
"""
Args:
file_path: 本地文件路径
file_url: 文件链接
Returns: 响应
"""
with open(file_path, "rb") as f:
file_data = base64.b64encode(f.read()).decode("utf-8")
data = {
"file_data": file_data,
"file_url": file_url, # file_path 和 file_url 只能传入其中一个,不可同时传入
"file_name": os.path.basename(file_path)
}
# 文档切分参数,非必传
# return_doc_chunks = json.dumps({"switch": True, "chunk_size": -1})
# data["return_doc_chunks"] = return_doc_chunks
headers = {
"Content-Type": "application/x-www-form-urlencoded",
"Authorization": f"Bearer {API_KEY}",
}
response = requests.post(CREATE_URL, headers=headers, data=data, timeout=120)
return response
if __name__ == '__main__':
file_path = "./test.pdf"
print(create_task(file_path).json())
返回响应
唯一的log id,用于问题定位
错误码
错误描述信息
返回的结果
显示子属性
隐藏子属性
该请求生成的task_id,后续使用该task_id获取解析结果
{
"error_code": 0,
"error_msg": "",
"log_id": "10138598131137362685273505665433",
"result": {
"task_id": "task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S"
}
}
错误码
如果调用失败并返回报错信息,请参见以下错误码进行解决: 公共错误码:查看公共错误码 OCR 错误码:查看 OCR 错误码
评价此篇文章
