ModelAPI监控
更新时间:2026-09-21
概述
Model API 的调用指标可在实例维度与服务维度两处查看,除通用业务指标外还提供 Token 消耗、首 Token 时延等 AI 指标。
查看入口
| 入口 | 路径 | 支持的聚合维度 | 统计范围 |
|---|---|---|---|
| 实例维度 | 观测与分析 > 业务监控 > Model 服务 标签页 | 域名 ID、服务 ID、模型名称 | 该实例下全部 Model 服务的汇总指标 |
| 服务维度 | Model 服务详情的 监控 标签页 | 域名 ID、模型名称 | 单个 Model 服务的指标 |
前提条件
已为当前实例开启 Prometheus 监控服务(CProm)。开启后会产生费用,具体参考 Prometheus 监控计费详情。
操作步骤
- 进入上述任一入口。
- 设置 时间筛选:近 1 小时、近 6 小时、近 1 天、近 3 天、近 7 天、近 14 天或自定义区间。
- 设置 统计周期:可选 5 分钟至 24 小时。查询跨度越大可选的最小统计周期越大(≤3 天最小 5 分钟,3~7 天最小 10 分钟,>7 天最小 30 分钟)。
- 在 模型名称 输入框中填写目标模型(输入一个后按 Enter 可继续输入多个),单击 查询。
- 指标卡片右上角支持全屏放大,鼠标悬浮在指标名称的图标上可查看口径说明。
通用指标
| 指标 | 说明 |
|---|---|
| 每秒请求数 QPS | 每秒处理的请求数。 |
| PV | 请求总量,一段时间内的总请求次数。 |
| 请求成功率 | 成功请求数 / 总请求数。 |
| 请求成功数 | 统计周期内成功返回的请求数量。 |
| 请求响应时间 | 请求从发出到收到响应的耗时,提供 P50、P90、P95、P99、Avg 五条曲线。 |
| 入站流量 / 出站流量 | 接收与发送的流量速率。 |
| 服务访问量 / HOST 访问量 | 按服务、Host 域名维度统计的访问量。 |
| 状态码分布 | 返回的 HTTP 状态码分布。 |
| Method 分布 | 不同 HTTP 方法的请求占比。 |
AI 指标
| 指标 | 说明 |
|---|---|
| Token 总数 | 调用消耗的总 Token 数。 |
| Token 分类统计 | 按 Token 类型分类统计,包含输入/输出 Token 数、缓存输入/输出 Token 数。 |
| 模型 token 使用统计 | 按具体模型维度统计 Token 消耗。 |
| Token 缓存命中率 | 缓存命中的 Token 占比。 |
| 首 Token 时延 | 从发出请求到模型返回第一个 Token 的时间,按模型维度展示。 |
| 限流请求数 | 统计周期内被限流拦截的请求数量。 |
观测建议
- 多模型对比:按模型名称聚合,横向对比各模型的成功率、请求响应时间与首 Token 时延,识别效果或性能不达标的模型。
- 灰度验证:使用按比例策略灰度新模型时,观察新后端的成功率与首 Token 时延,确认无异常后再提升权重。
- 成本观察:结合 Token 分类统计与 Token 缓存命中率评估调用成本;配合消费者费用信息做成本分摊。
- 明细下钻:通过日志分析的
ai_log字段(含 model、input_token、output_token、llm_first_token_duration、consumer 等)查询单次调用明细。 - 告警:通过告警管理为成功率、Token 消耗速率配置 PromQL 告警规则。
相关文档
- 业务监控:完整指标口径与聚合查询交互。
- Model 服务监控
- 配额管理
评价此篇文章
