报警策略相关接口 报警策略相关接口 报警策略列表查询接口 接口描述 该接口可获取云产品监控、站点监控等相关报警的报警策略列表信息。
云数据库 TiDB 云数据库 TiDB 包含TIDB节点(TIDBNode)、TiKV节点(TiKVNode)、PD节点(PDNode))3种监控对象类型,各监控对象类型包含的监控指标列表如下: TIDB节点(TIDBNode) 指标英文名称(metric name) 指标中文名称 单位 维度 备注 TiDBCPUUsagePercent TiDB CPU使用率 % NodeId, InstanceId
下面介绍如何接入LLM应用: 支持的 LLM 组件与框架 LLM 应用可以基于 Traceloop 开源的 OpenLLMetry 项目进行接入,该项目完全兼容 OpenTelemetry 协议标准,能够和其他使用 OpenTelemetry 方案接入的应用实现链路信息互通。
监控配置 在首页【域名列表】的配置栏中选择【监控配置】,进入该域名下的监控配置页。 输入请求配置、监控点配置和故障判断配置。根据2个不同的【协议类型】填写相应的设置。 选择 【协议类型】-> HTTP时,请填写如下设置(支持查看HTTP协议下的状态码): 选择【协议类型】-> TCP时,请填写如下设置: 监控配置说明 项目 描述 监控配置 指定检查后端服务器监控状态时使用的协议类型。
附录-监控指标内置标签说明 百舸平台在监控指标体系中内置的标准标签(label) ,用于对训练任务与资源进行统一标识与多维度区分。平台会自动在系统级与自定义监控指标中附加这些标签,无需用户手动维护,主要用于任务溯源、按租户/队列/地域等维度进行统计与运维分析。
不同Region的监控数据独立存储,完全隔离。例如,北京Region的用户无法看到广州Region的监控数据,同理广州Region也无法看到北京Region的数据。
应用程序挂载探针后,会连接百度智能云 APM 服务端并上报监控数据。 在有正常流量的情况下, 应用性能监控->应用列表 中将展示接入的应用。由于数据处理存在一定延时,如果接入后在控制台没有查询到应用,请等待 30 秒左右后刷新列表。
训练任务性能劣化(slow)诊断 背景 使用 大模型训练服务观测 功能,如何接入训练任务,在训练任务出现性能问题(slow)时如何诊断并解读诊断报告、分析问题。 前置条件 训练框架: PyTorch 接入任务 根据接入任务说明文档,部署采集器,接入训练任务。 训练任务出现在任务列表中表明任务已接入成功,为了后续能够查看性能指标分析及发起诊断,请保持性能指标采集开启。
网络探测 NP 网络探测NP包含4种监控对象类型,分别是:DNS探测(DNS)、ICMP探测(ICMP)、UDP探测(UDP)、TCP探测(TCP)。
Remote Write和Remote Read地址使用说明 概述 本文档介绍如何在百度云 Prometheus 监控服务中获取 Remote Write 和 Remote Read 地址,配置开源 Prometheus 将监控数据写入百度云 Prometheus 监控服务,并在 Grafana 中查看写入后的监控数据。 前提条件 已部署开源 Prometheus,并确保其运行正常。