快速部署推理服务
概述
本文档介绍如何在百度百舸·AI 计算平台快速部署推理服务。在首次使用百度百舸·AI 计算平台时,您可以按照本文档完成资源池创建、资源队列创建、自定义推理服务部署,以及服务升级、手动扩缩容等操作。
主要操作流程
- 注册百度智能云账号,并完成实名认证。
- 登录 百度百舸·AI 计算管理控制台。
- 创建资源池和资源池队列。
- 部署推理服务。
- 根据业务需要执行服务升级、手动扩缩容、监控等更多操作。
前提条件
全托管资源池 为您提供稳定、易用的免运维资源池,您可更专注于模型训练和推理服务部署;自运维资源池 为您提供稳定、高性能的计算集群,您可在平台全方位管理计算资源。
因当前产品限制,创建资源池需开通相应白名单。创建前可通过 工单 联系百度支持人员,确保当前账号已完成以下操作,否则无法创建和使用资源池:
-
云服务器 BCC:
- 开通 A800 机型套餐白名单。
-
并行文件存储服务 PFS:
- 开通 PFS 产品白名单。
- 创建可用的 PFS 实例。
- 开通 ParentDir 白名单。
- 已在 容器引擎 CCE 的 Helm->Helm 模板 中,在百度智能云模板中安装
cce-inference-controller到kube-system命名空间,并将replicaCount修改为1。
Helm 模板对应 Helm 社区的 Helm Chart 概念,是 Helm 定义的一种打包格式,用来描述一组相关的 Kubernetes 资源。Helm 能够帮助您管理自定义的 Kubernetes 资源集合,从而快速实现复杂应用的定义、安装和升级。
- 准备部署自定义服务所需的信息:
- 服务镜像地址,例如:
registry-vpc.cn-beijing.baidu.com/xxx/yyy:zzz。 - 镜像的启动运行命令,例如:
/data/eas/ENV/bin/python /data/eas/app.py。 - 镜像中进程监听的网络端口号,例如:
8000。
创建流程
第一步:创建资源池
资源池是百舸内部管理异构资源的基础单元,一个资源池对应一个 CCE 集群(计算服务)、一个 PFS 实例(存储服务)和一个 CProm 实例(监控服务)。本文以创建全托管资源池为例。
- 登录 百度百舸·AI 计算平台 控制台,在控制台导航中选择 AI 计算资源->全托管资源池,进入全托管资源池列表后,单击 【新建资源池】。您也可以直接访问 新建资源池。

- 配置基本信息。
- 资源池名称
- 备注
- 选择地域和可用区

- 配置网络信息
- 配置资源池网络
- 选择节点子网和容器子网
- 选择安全组
- 填写Cluster IP网段

- 配置节点信息
- 选择付费方式
- 选择节点规格
- 选择节点数量
- 选择使用时间
- 选择续费方式

- 选择关联服务 按需选择并行文件系统PFS和监控实例,监控实例也可后续再开通。

- 确认订单。 确认资源池配置信息,然后单击提交。

您也可以选择创建自运维资源池进行后续的大模型训练和推理服务部署。创建方式请参考 创建自运维资源池。
第二步:创建队列
队列是一个资源池中部分资源的集合,用于训练任务、在线服务、开发机等工作负载的运行。本文提供创建全托管资源池队列的操作方式。
- 在百度百舸·AI 计算平台控制台导航中选择 AI 计算资源->全托管资源池,进入全托管资源池页面后切换到 资源队列 页签,单击 【创建资源队列】。

- 在队列管理页面,点击 创建队列,并填写相关信息。
- 队列基本信息。
- 资源中节点分配信息。
- 若资源池中无节点,可以点击 添加节点 进行新增。


- 确认队列名称、资源池、节点来源、负载类型、调度策略和队列状态等必填项已完成配置后,单击 【提交】。如页面提示必填项缺失,请补充完成后再次提交。
如您选择创建了自运维资源池,您可以在自运维资源池下创建队列。具体操作请参考 队列管理。
第三步:部署服务
百舸平台提供灵活的部署方式,您可以将通过 Docker 构建的镜像部署为推理服务,并将模型文件或代码挂载到服务实例中。
- 登录 百度百舸·AI 计算平台 控制台,在控制台导航中选择 大规模训练与推理->在线服务部署,进入在线服务列表后,单击 【部署服务】。

- 配置服务基础信息
- 填写服务名称
- 选择资源池:资源池类型和对应资源池队列
- 选择资源规格
- 选择是否开启分布式推理
- 是否开启PD分离
- 选择是否开启服务容错,开启服务容错,当节点或加速芯片故障时会封锁此节点,并自动驱逐坏卡或故障节点的实例在健康节点上重建
- 配置优先级

- 配置环境信息
- 选择服务镜像
- 填写镜像的启动命令
- 如需开启公网需要选择端口
- 添加环境变量
- 选择存储卷设置容器挂载目标路径
- 可选择开启健康检查自动检测并恢复异常状态的容器

- 配置流量接入信息。
- 选择是否开启云原生AI网关,开启时,AI网关仅支持HTTP请求,网络资源成本更低;关闭后,将通过负载均衡接入HTTP、GRPC、TCP、WebSocket请求。
- 选择是否开启公网访问,服务内部默认与公网不通,若需要公网访问到该服务,请开启公网访问配置访问方式,选择一个弹性公网IP。

- 根据需要选择高级配置。
- 配置最小实例数
- 选择是否开启日志持久化,开启日志持久化功能会将日志持久化保存到日志服务(BLS)中,日志存储、读取、写入和索引会产生费用。
- 配置优雅退出时间
- 选择是否开启资源碎片迁移
- 滚动更新 支持为服务设置滚动更新策略,需要输入滚动更新过程中最大不可用和最大超量实例数比例。
(1)最大不可用:滚动更新过程中不可用实例的数量占预期实例数的百分比,范围1%-100%。示例:预期实例数为10,最大不可用为20%,则更新过程中可用的实例数最少有8个。
(2)最大超量:滚动更新过程中超出预期的实例数量占预期实例数的百分比,范围1%-100%。 示例:预期实例数为10,最大超量为10%,则更新过程中实例数最多可达11个。
- 设置共享内存大小

第四步:升级服务和手动扩缩容
- 升级服务
服务部署成功后,您可以通过 升级服务 修改镜像版本、存储挂载、健康检查、滚动更新策略等信息,填写本次变更内容的描述。 平台会记录详细的版本变更记录,您可在服务详情中查看版本变更记录。

- 手动扩缩容
服务部署成功后,如果您的服务流量有变化,您可以进行扩缩容操作以满足您的流量负载要求。

更多操作
评价此篇文章
