查看详情 海淀城市大脑 利用百度智能云人工智能技术,在海淀城市大脑实现全面的创新应用,形成需求、业务、数据、技术的融合发展和动态演进,不断提升海淀城市大脑智能化水平。 查看详情 相关产品 GPU云服务器 配备GPU的云端服务器,可以为机器学习、高性能计算、图形图像渲染等计算密集型应用提供加速处理能力。
下面将介绍如何查询训练任务的监控。 前提条件 资源池已经接入百度云 Prometheus监控服务 。请参考 资源池接入Prometheus监控实例 。 已经创建训练任务,详情可参考 创建任务 。 查询入口 登录 百舸控制台 。
快速部署推理服务 本文为您简要介绍使用百度百舸·AI计算平台快速部署推理服务。在首次使用百度百舸·AI计算平台的情况下,帮助开发者快速上手,在平台上完成自定义部署推理服务的流程。 主要操作流程 注册百度智能云账号,并完成实名认证。请参考 注册 和 实名认证 登录 百度百舸·AI计算管理控制台 。 创建资源池和资源池队列。 部署推理服务。 更多操作:升级服务、扩缩容、监控。
本文会介绍如何部署使用OpenClaw,在WebUI中OpenClaw进行对话。 使用需知: OpenClaw需要至少搭配一个大模型服务,才能进行最基础的对话; OpenClaw 既是一个产品,也是一项实验:接入真实的通讯平台和真实的工具。 不存在“绝对安全”的设置方案 。
使用 Terraform 快速搭建图像处理应用 概述 本文介绍了使用百度云函数计算,结合 BOS 和百度云图像效果增强能力,实现图像文件的自动处理,并通过 Terraform 实现应用的快速部署。 前提概念 首先介绍在本文出现的几个比较重要的概念: Terraform :是一种安全有效地构建、更改和版本控制基础设施的工具。
MPI任务实践 本文档介绍在百舸平台中使用 DeepSpeed 进行分布式训练的最佳实践,我们以 2 个 worker 节点、每个节点配备 2个 GPU 的典型集群配置为例,展示如何正确配置和启动训练任务。本方案的 MPI 核心参数配置具有通用性,可适配各类MPI任务,根据参数和代码做适当调整即可。
自适应并行策略搜索工具 产品介绍 自适应并行工具能够为大模型训练提供的根据环境配置,自动匹配适合的并行策略,从而充分利用计算资源,显著提高训练效率。本篇文档介绍自适应并行策略搜索工具的使用方式。
服务网卡配置参考 使用说明 本文以 快速启动预定义训练任务 和 创建Project并训练推理 两个案例,介绍Isaac Lab的使用过程。
资源队列管理详情 概述 资源队列是百度百舸·AI计算平台资源分配与任务调度的核心单元。本指南详细介绍了队列详情页的资源定义、节点管理操作及高级配置策略,帮助管理员高效管理算力资源,优化任务调度效率。 权限与访问 访问入口 登录百度百舸·AI计算平台控制台 → 查看【资源队列】Tab页面 → 点击目标【队列名称】 → 进入队列详情。
在线服务部署常见问题 本文为您介绍在线服务部署过程中的常见问题。 目录 一、推理服务部署与启动 二、模型运行与资源配置 名词说明 :本文涉及以下缩写。 AIAK :百度 AI 加速套件(AI Accelerator Kit),用于推理 / 训练加速。 PFS :并行文件存储(Parallel File Storage),可挂载的外部高性能存储。