Model服务监控
更新时间:2026-09-20
概述
Model 服务的监控用于观察该服务下全部 Model API 的调用情况与 Token 消耗,入口位于服务详情的 监控 标签页。
前提条件
已为当前实例开启 Prometheus 监控服务(CProm)。开启后会产生费用,具体参考 Prometheus 监控计费详情。
操作步骤
- 进入 服务管理 > Model 服务,单击目标服务名称进入详情。
- 切换到 监控 标签页。
- 设置 时间筛选:近 1 小时、近 6 小时、近 1 天、近 3 天、近 7 天、近 14 天或自定义区间。
- 设置 统计周期:可选 5 分钟、10 分钟、15 分钟、30 分钟、1 小时、6 小时、12 小时、24 小时。查询跨度越大可选的最小统计周期越大(≤3 天最小 5 分钟,3~7 天最小 10 分钟,>7 天最小 30 分钟)。
- 按需填写聚合条件后单击 查询。
- (可选)单击 管理告警 进入告警管理页面。
聚合维度
| 维度 | 填写方式 |
|---|---|
| 域名 ID | 下拉多选,也支持手动输入选项以外的值 |
| 模型名称 | 标签输入框,输入一个模型名称后按 Enter 继续输入下一个 |
多个值之间为「或」关系。多模型场景下按模型名称聚合,可横向对比各模型的成功率、响应时间与 Token 消耗。
通用指标
| 指标 | 说明 |
|---|---|
| 每秒请求数 QPS | 每秒处理的请求数。 |
| PV | 请求总量,一段时间内的总请求次数。 |
| 请求成功率 | 成功请求数 / 总请求数。 |
| 请求成功数 | 统计周期内成功返回的请求数量。 |
| 请求响应时间 | 请求从发出到收到响应的耗时,提供 P50、P90、P95、P99、Avg 五条曲线。 |
| 入站流量 / 出站流量 | 接收与发送的流量速率。 |
| 服务访问量 | 按服务维度统计的访问量。 |
| HOST 访问量 | 按 Host 域名维度统计的访问量。 |
| 状态码分布 | 返回的 HTTP 状态码分布。 |
| Method 分布 | 不同 HTTP 方法的请求占比。 |
AI 指标
| 指标 | 说明 |
|---|---|
| Token 总数 | 服务调用消耗的总 Token 数。 |
| Token 分类统计 | 按 Token 类型分类统计,包含输入/输出 Token 数、缓存输入/输出 Token 数。 |
| 模型 token 使用统计 | 按具体模型维度统计 Token 消耗。 |
| Token 缓存命中率 | 缓存命中的 Token 占比。 |
| 首 Token 时延 | 从发出请求到模型返回第一个 Token 的时间,按模型维度展示。 |
| 限流请求数 | 统计周期内被限流拦截的请求数量。 |
观测建议
- 多模型对比:按模型名称聚合,对比成功率、请求响应时间与首 Token 时延,识别效果或性能不达标的模型。
- 灰度验证:Model API 使用按比例策略时,结合权重变化观察新后端的成功率与首 Token 时延。
- 成本观察:关注 Token 分类统计与 Token 缓存命中率,缓存命中率偏低时评估提示词复用策略。
- 明细下钻:通过日志分析的
ai_log字段(含 model、input_token、output_token、llm_first_token_duration 等)查询单次调用明细。 - 告警:通过告警管理为成功率、Token 消耗速率配置 PromQL 告警规则。
相关文档
评价此篇文章
