千问AI平台对部分模型采用动态限流,TPM 限流值随平台月消费额度按月调整,实际可用 TPM 不低于限流值。
动态限流机制
千问AI平台对部分模型采用动态限流机制,核心要点如下:
- 限流值:按千问AI平台账号的月消费额度分档确定,作为吞吐的保证基线,每月调整。
- 软限流:当调用量达到限流值时,若平台仍有剩余资源,则不会触发限流,因此实际可用 TPM 不低于限流值;调用时观察到的实际限流值可能高于该限流值,属预期行为。
- 限流粒度:按账号 + 模型,同一千问AI平台账号下所有业务空间、API Key 的调用量合并计入该账号对该模型的 TPM 配额,共享同一限额。
- 业务空间:可为模型单独设置限流值,未单独设置的业务空间共享账号级配额。
- RPM:动态限流机制下模型具备较高的 RPM 限额,无需单独设置,正常使用不会触发 RPM 限流。
- 更多说明:RPM/TPM 基础概念与各维度详见限流,业务空间限流设置见业务空间。
模型与限流档位
TPM 限流值按千问AI平台月消费金额分档,支持的模型分档如下(数值以控制台实际展示为准):
| 支持的模型 | 等级1(当前)≤¥10万 | 等级2 ¥10万~¥100万 | 等级3 >¥100万 |
|---|---|---|---|
| kimi-k3 | 120万 | 500万 | 1000万 |
| qwen3.8-max | 500万 | 1000万 | 2000万 |
| deepseek-v4-pro-0813 | 120万 | 500万 | 1000万 |
| qwen3.8-27b | 500万 | 500万 | 500万 |
| qwen3.8-flash | 500万 | 1000万 | 2000万 |
| qwen3.8-2.4t-a95b | 500万 | 500万 | 500万 |
| glm-5.3 | 500万 | 500万 | 500万 |
| qwen3.8-max-0902 | 150万 | 150万 | 150万 |
| qwen3.8-max-prime(邀测中) | 200万 | 500万 | 1000万 |
| qwen3.8-omni-flash | 200万 | 500万 | 1000万 |
| deepseek-v4.1-flash | 120万 | 120万 | 120万 |
若 TPM 限流值无法满足业务需求,可联系商务经理申请提额。
限流动态调整策略
限流档位按以下规则动态调整:
- 分档依据:千问AI平台消费金额。
- 测算周期:按自然月账单周期测算。
- 通知:每月 10 日向调整用户发送通知。
- 生效时点:每月 15 日新档位生效,有效期至次月 15 日。
- 调整方向:低档→高档(升级)或持平不变。