百舸相关dashboards已包含显卡监控,不需要导入gpu-dashboards,gpu-dashboards是执行了GPU监控采集才有用。一般k8s-dashboards均要导入,如果部署了百舸组件就导入baige-dashboards,如果未部署百舸组件且已部署GPU监控采集,则导入gpu-dashboards。
报警策略列表接口 接口描述 该接口可获取云产品监控、站点监控等相关报警的报警策略列表信息。
通过 Langfuse SDK 接入 概述 Langfuse 是当下 Python 流行的 LLM 可观测 SDK,支持对 Agent、Chain、Tool、LLM Generation 等节点进行细粒度的链路追踪。百度智能云 LLM 应用性能监控兼容 Langfuse 协议,您可以使用 Langfuse SDK 将调用链路数据上报至百度 LLM应用性能监控。
下面介绍如何接入LLM应用: 支持的 LLM 组件与框架 LLM 应用可以基于 Traceloop 开源的 OpenLLMetry 项目进行接入,该项目完全兼容 OpenTelemetry 协议标准,能够和其他使用 OpenTelemetry 方案接入的应用实现链路信息互通。
报警策略相关接口 报警策略相关接口 报警策略列表查询接口 接口描述 该接口可获取云产品监控、站点监控等相关报警的报警策略列表信息。
报警策略相关接口 报警策略相关接口 报警策略列表查询接口 接口描述 该接口可获取云产品监控、站点监控等相关报警的报警策略列表信息。
训练任务性能劣化(slow)诊断 背景 使用 大模型训练服务观测 功能,如何接入训练任务,在训练任务出现性能问题(slow)时如何诊断并解读诊断报告、分析问题。 前置条件 训练框架: PyTorch 接入任务 根据接入任务说明文档,部署采集器,接入训练任务。 训练任务出现在任务列表中表明任务已接入成功,为了后续能够查看性能指标分析及发起诊断,请保持性能指标采集开启。
云数据库 TiDB 云数据库 TiDB 包含TIDB节点(TIDBNode)、TiKV节点(TiKVNode)、PD节点(PDNode))3种监控对象类型,各监控对象类型包含的监控指标列表如下: TIDB节点(TIDBNode) 指标英文名称(metric name) 指标中文名称 单位 维度 备注 TiDBCPUUsagePercent TiDB CPU使用率 % NodeId, InstanceId
附录-监控指标内置标签说明 百舸平台在监控指标体系中内置的标准标签(label) ,用于对训练任务与资源进行统一标识与多维度区分。平台会自动在系统级与自定义监控指标中附加这些标签,无需用户手动维护,主要用于任务溯源、按租户/队列/地域等维度进行统计与运维分析。
Remote Write和Remote Read地址使用说明 概述 本文档介绍如何在百度云 Prometheus 监控服务中获取 Remote Write 和 Remote Read 地址,配置开源 Prometheus 将监控数据写入百度云 Prometheus 监控服务,并在 Grafana 中查看写入后的监控数据。 前提条件 已部署开源 Prometheus,并确保其运行正常。