优速模式为对输出速度敏感的场景提供更高的 TPS,适用于 AI 编程助手、Agent 多步推理、实时对话等场景。
优速模式为对输出速度敏感的场景提供更高的 TPS。
优速模式具备以下关键特性:
返回示例:
流式调用示例:
优速模式按输入与输出 token 计费,计费逻辑与标准 API 一致。具体价格见模型调用计费。
使用方式
优速模式具备以下关键特性:
- 高速输出:TPS 提升至标准 API 的 1.5~2 倍;适用于 AI 编程助手、Agent 多步推理、实时对话等对输出速度敏感的场景。
- 按 token 计费:计费逻辑与标准 API 一致,按输入与输出 token 计费。
- 特殊限流:调用量达到限流值时,若平台仍有剩余资源,则不会触发限流,因此实际可用 TPS 不低于限流值。
model 参数指定为支持的模型的 model ID 即可开启,无需额外参数。
基础调用示例:
GLM 5.2 的优速模式的模型名称仍然为
glm-5.2-fast-preview。支持的模型
模型支持的能力、使用限制与原版模型相同。
文本生成模型
| 模型 | 输入(每百万 Token) | 输出(每百万 Token) | 缓存命中(每百万 Token) |
|---|---|---|---|
| glm-5.2-fast-preview | 16 元 | 56 元 | 4 元 |
视频生成模型
| 模型 | 480P(元/秒) | 720P(元/秒) | 1080P(元/秒) |
|---|---|---|---|
| wan3.0-video-prime | 0.45 | 0.9 | 1.8 |
使用示例
模型支持的能力、使用限制与原版模型相同。