发起训练 训练模型 完成数据的标注,或提交已标注的数据后,即可在「模型中心」目录中点击「训练模型」,开始模型的训练。 按以下步骤操作,启动模型训练: Step 1 选择模型 选择此次训练的模型 Step 2 训练配置 部署方式 可选择「公有云部署」、「EasyEdge本地部署」。
模型训练 创建任务 当您的模型以及数据集创建完成后,您可以点击左边目录导航栏中的【训练模型】,创建模型或选择您已经创建的模型,再添加您要使用的训练数据集,建议您使用的每个文本创作数据的样本数应达到1000个以上,再启动训练. 训练环境 平台为您提供了GPU算力机器,TeslaGPU V100_32G显存单卡 80核CPU_640G内存,训练设备数默认为8(暂不支持增删机器)。
说明2 :为确保训练任务的正常进行,建议您在开通付费后确保账户余额不低于100元。 说明3 :预置模型调参参与计费的时长计算方式: 若用户选择数据增强—自动搜索,则计费时长为实际训练过程耗时( 即状态为运行中-训练阶段的持续时间)+ 自动数据增强耗时相加总时长 。
hang 分析 在任务详情页面,点击进入 Hang 解析 标签页,即可查看训练任务hang 的分析报告 若您在创建任务时 已开启 Hang 检测 ,系统检测到任务挂起后,将 自动触发指标采集 ,并生成聚合函数栈火焰图。 同时本功能 支持手动触发采集 ,无需提前开启 Hang 检测,当你发现任务 Hang 时可手动发起诊断分析 数据采集完成后,会自动生成聚合函数栈火焰图,支持下载。
系统限制 资源限制 N/A 访问限制 单个用户访问限制为 200 QPS 每个请求被加密的数据长度不超过113 byte
训练性能监控 百舸平台提供了训练过程中的吞吐、训练分阶段耗时以及训练Loss指标,帮助客户实时掌控训练的性能状态,快速发现性能异常,为性能异常排查场景提效 训练性能监控说明 目前针对于性能可观测提供了以下指标: 训练吞吐 训练过程中单位时间内模型能够处理的数据量,它是衡量训练性能的关键指标之一。
分布式训练相关 查询训练任务列表 使用以下代码可以查询训练任务列表。
查询训练任务事件 描述 获取一个任务系统事件。 请求结构 Bash 复制 1 POST ?
分布式训练相关 查询训练任务列表 使用以下代码可以查询训练任务列表。
训练任务事件 概述 任务事件包括了任务在启动/运行阶段,任务以及关联资源的变更情况,可以弥补资源监控在实时性和场景上的欠缺,有助于运维人员日常观察的任务变更以及定位问题。本文介绍如何查询训练任务的事件信息。 操作步骤 登录 百舸AI计算平台AIHC控制台 。 在左侧菜单栏选择 分布式训练 ,进入 任务列表 页面。