配额管理
更新时间:2026-08-13
概述
配额管理支持周期性为消费者设置请求数配额上限或 Token 配额上限,超出后请求被网关拦截,直至下一周期自动重置。多租户共用网关时,可将上游模型成本可预测地分摊到每个调用方,避免个别异常用量拖垮整体。本文介绍配额管理相关的操作。
说明:配额与插件实现的限流解决的问题不同,可以叠加使用——先通过消费者配额限制每个周期的总用量来兜住整体成本,再通过流量管控插件平滑瞬时流量,避免短时突发把后端打挂。
开启配额管理
- 进入消费者详情的 配额管理 标签页,单击 开启配额管理。
- 配置以下参数:
| 配置项 | 说明 |
|---|---|
| 生效方式 | 支持立即生效。 |
| 重置周期 | 支持不重置,或按每天/每周/每月重置,到期自动清零重新计量。 |
| 限制维度 | 以下限制维度至少选择一项: 1. Token 配额上限:周期内允许消耗的 Token 总量(支持 OpenAI 的 chat/completions 接口和 Anthropic 的 messages 接口)。 2. 请求数配额上限:周期内允许的请求总数。 |
- 单击确认后配额生效,后续可进入该页面查看配额上限、配额已用量以及剩余用量。
注意:配额生效后,超出限额的请求将被网关拦截,直至下一周期重置。请求数与 Token 两个维度可同时启用,命中任一上限即触发拦截。
编辑配额
- 进入消费者详情的 配额管理 标签页。
- 在 配额管理 标签页单击 编辑配额,修改配额值或重置周期后保存。
关闭配额管理
单击 关闭配额管理,二次确认后关闭。
注意:关闭配额管理后,原有的配额配置将被清除,该消费者恢复不限量调用;再次开启需重新配置全部字段,请确认后操作。
使用建议
- 当对接有自身配额限制的第三方模型服务时,建议把所有消费者的限额之和控制在该服务总配额以内,避免单一消费者耗尽整体额度。
- 结合费用信息观察各消费者的实际用量,定期校准配额值。
评价此篇文章
