告警管理
更新时间:2026-09-20
概述
告警管理用于集中查看当前网关实例关联的 Prometheus 监控(CProm)告警规则。网关侧提供告警规则的统一展示,规则的创建、编辑与通知策略配置在 CProm 控制台完成。入口位于实例导航的 观测与分析 > 告警管理,也可从资源监控、业务监控页面右上角的 管理告警 进入。
前提条件
已为当前实例开启 Prometheus 监控服务(CProm),开启方式详见资源监控。
注意:Prometheus 监控服务按用量计费,具体参考 Prometheus 监控计费详情。
查看告警规则
进入 观测与分析 > 告警管理,列表展示当前实例关联 CProm 实例下的全部告警规则。
| 列 | 说明 |
|---|---|
| 告警名称 | 告警规则名称,鼠标悬浮可查看规则描述。 |
| 告警状态 | 已启用 / 已停用。 |
| 告警等级 | 通知 / 警告 / 重要 / 严重。 |
| 告警规则 | 规则使用的 PromQL 表达式,悬浮可查看完整表达式。 |
| 持续时间 | 指标持续满足条件多久后触发告警(对应规则的 for 字段)。 |
| 通知策略 | 该规则绑定的通知策略 ID,单击可跳转到 CProm 的通知策略模板页面。 |
创建与管理告警规则
| 操作 | 说明 |
|---|---|
| 创建告警 | 单击 创建告警,跳转到 CProm 控制台的告警创建页面,基于 PromQL 表达式配置规则。 |
| 管理告警 | 单击 管理告警,跳转到 CProm 控制台的告警规则列表,进行编辑、启停、删除等操作。 |
| 通知策略 | 在列表的通知策略列单击对应 ID,跳转到 CProm 的通知策略模板页面配置通知方式。 |
说明:网关侧不预置默认告警规则,也不支持在网关侧直接创建或编辑规则;在 CProm 侧完成配置后,回到本页面刷新即可看到最新规则。
告警规则填写说明
告警规则基于 PromQL 表达式配置,可结合网关指标编写。以下为常用场景的表达式示例,$instanceId 需替换为实际的网关实例 ID。更多告警指标可参考:告警指标参考
请求成功率低于 95%
Plain Text
1sum(rate(aigw_route_requests_total{namespace="$instanceId", status_class="2xx"}[5m]))
2 / sum(rate(aigw_route_requests_total{namespace="$instanceId"}[5m])) < 0.95
5xx 错误请求速率持续偏高
Plain Text
1sum(rate(aigw_route_requests_total{namespace="$instanceId", status_class="5xx"}[5m])) > 1
QPS 超过预期水位
Plain Text
1sum(rate(aigw_route_requests_total{namespace="$instanceId"}[5m])) > 1000
Token 消耗速率超过预算
Plain Text
1sum(rate(aigw_model_tokens_total{namespace="$instanceId"}[5m])) > 10000
编写规则时建议:
- 通过
namespace标签限定网关实例,避免规则跨实例生效。 - 通过
service_id、api_id、domain_id、model_id等标签把告警收敛到具体服务、API、域名或模型。 - 结合 持续时间(
for)过滤瞬时抖动,例如持续 5 分钟满足条件才触发。 - 告警等级建议与处理时效对应:严重(立即处理)、重要、警告、通知。
相关操作
评价此篇文章
