用量统计说明
更新时间:2026-09-08
使用方式
平台支持查看预置服务和自定义服务的使用量。包括以下两种查看方式:
- 接口:可通过程序化调用获取用量数据。可移步API参考文档查看管控API相关指导。
- 控制台:调用统计页中,您可清晰查看该账号下的调用总tokens数、输入总tokens数、输出总tokens数等指标。
接口返回usage说明
usage说明
| 字段名 | 含义 |
|---|---|
| prompt_tokens | 问题tokens数(包含历史QA) |
| completion_tokens | 回答tokens数;当调用对话Chat API返回此参数 |
| total_tokens | 总tokens数;计算方式:问题tokens数+回答tokens数 |
| prompt_tokens_details | 问题tokens数详情 |
| +search_tokens | 触发检索增强以后膨胀的token;用户可以通过usage.prompt_tokens_details.search_tokens>0判断是否出发了检索增强,并且计算触发检索增强的次数 |
| +cached_tokens | 触发上下文缓存后,输入命中缓存的token数量 |
| +plugin_tokens | 触发插件以后膨胀的token,key为插件名称,value为token数 |
| ++ChatFilePlus | 触发阅读助手插件的token |
| completion_tokens_details | 回答tokens数详情 |
| +reasoning_tokens | 思维链的token |
usage返回示例
深度思考模型返回reasoning_tokens示例
Plain Text
1 "usage": {
2 "prompt_tokens": 2,
3 "completion_tokens": 274,
4 "total_tokens": 276,
5 "completion_tokens_details": {
6 "reasoning_tokens": 242
7 }
8 }
触发阅读助手插件返回plugin_tokens示例
Plain Text
1 "usage": {
2 "prompt_tokens": 15918,
3 "completion_tokens": 109,
4 "total_tokens": 16027,
5 "prompt_tokens_details": {
6 "plugin_tokens": {
7 "ChatFilePlus": 15871
8 },
9 "cache_tokens": xxx
10 "search_tokens":xxxx
11 }
12 }
触发搜索返回search_tokens示例
Plain Text
1 "usage": {
2 "prompt_tokens": 4149,
3 "completion_tokens": 287,
4 "total_tokens": 4436,
5 "prompt_tokens_details": {
6 "search_tokens": 4146
7 }
8 }
触发prompt cache返回cache_tokens示例
Plain Text
1 "usage": {
2 "prompt_tokens": 159,
3 "completion_tokens": 89,
4 "total_tokens": 248,
5 "prompt_tokens_details": {
6 "cached_tokens": 128
7 }
8 }
千帆控制台用量统计说明
控制台入口
- 左侧导航栏:【模型服务】→【模型监控】
筛选条件与操作
调用统计页顶部提供以下筛选与操作:
- 服务类型:下拉选择,默认「全部」
- 应用身份:默认「全部应用身份」,可按指定应用身份筛选
- API Key:可按指定 API Key 筛选调用
- 时间范围:支持自定义起止日期,默认当天
- 【查询】:应用筛选条件,刷新统计结果
- 【导出】:导出当前查询结果,支持调用统计、调用明细查询结果导出,支持查看调用明细导出记录。
- 【BCM监控告警】:跳转 BCM 云监控告警
用量概览
页面顶部以指标卡形式展示整体用量:
- 调用接口数:统计周期内产生调用的接口数量
- 调用总量:调用成功+调用失败
- 调用失败:调用失败
- 调用总tokens数:调用成功的输入+输出token
- 输入tokens数:调用成功的输入token
- 输出tokens数:调用成功的输出token
服务调用明细
列表按服务维度展示当前筛选范围内的调用情况,支持在搜索框中按服务名称检索:
- 列表字段:服务名称、调用总量、调用失败、失败率、调用总tokens数、输入tokens数、输出tokens数,搜索触发次数,搜索膨胀tokens数,cache tokens数
- 每行【操作】列提供【查看V2监控】链接,可跳转查看该服务/模型的单模型用量详情
- 调用总量:调用成功+调用失败
- 调用失败:调用失败
- 失败率:调用失败/调用总量
- 调用总tokens数:调用成功的输入+输出token
- 输入tokens数:调用成功的输入token
- 输出tokens数:调用成功的输出token
- 搜索触发次数:调用ERNIE模型触发搜索增强次数,按照0.004元/次计费
- 搜索膨胀tokens数:触发搜索增强以后带来的输入token膨胀数量
- cache tokens数:命中prompt cache的输入token
- cache触发次数:命中prompt cache的次数
单模型用量详情
控制台入口
- 点击列表页【查看V2监控】按钮即可跳转

各指标计算方式
Hover ?处即可展示各指标计算公式:
1、输入token数+输出token数=请求总token数
2、输入token数包含搜索触发膨胀token数(如果触发)和chatifle触发token数(如果触发)
3、prompt cache token数表示输入token当中命中缓存部分的token
评价此篇文章
