跳转到主要内容
运行与扩展

优速模式(Prime)

优速模式为对输出速度敏感的场景提供更高的 TPS,适用于 AI 编程助手、Agent 多步推理、实时对话等场景。

优速模式为对输出速度敏感的场景提供更高的 TPS。

使用方式

优速模式具备以下关键特性:
  • 高速输出:TPS 提升至标准 API 的 1.5~2 倍;适用于 AI 编程助手、Agent 多步推理、实时对话等对输出速度敏感的场景。
  • 按 token 计费:计费逻辑与标准 API 一致,按输入与输出 token 计费。
  • 特殊限流:调用量达到限流值时,若平台仍有剩余资源,则不会触发限流,因此实际可用 TPS 不低于限流值。
调用时将 model 参数指定为支持的模型的 model ID 即可开启,无需额外参数。 基础调用示例:
GLM 5.2 的优速模式的模型名称仍然为 glm-5.2-fast-preview
curl -X POST https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "glm-5.2-fast-preview",
  "messages": [{"role": "user", "content": "你是谁"}],
  "stream": false
}'
返回示例:
{
  "id": "chatcmpl-xxx",
  "object": "chat.completion",
  "model": "glm-5.2-fast-preview",
  "choices": [{
    "index": 0,
    "message": {
      "role": "assistant",
      "reasoning_content": "...",
      "content": "..."
    },
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 14,
    "completion_tokens": 137,
    "total_tokens": 151,
    "prompt_tokens_details": {"cached_tokens": 0},
    "completion_tokens_details": {"reasoning_tokens": 127}
  }
}

支持的模型

模型支持的能力、使用限制与原版模型相同。

文本生成模型

模型输入(每百万 Token)输出(每百万 Token)缓存命中(每百万 Token)
glm-5.2-fast-preview16 元56 元4 元

视频生成模型

模型480P(元/秒)720P(元/秒)1080P(元/秒)
wan3.0-video-prime0.450.91.8

使用示例

模型支持的能力、使用限制与原版模型相同。
流式调用示例:
import os
from openai import OpenAI

client = OpenAI(
  api_key=os.environ.get("DASHSCOPE_API_KEY"),
  base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
  model="glm-5.2-fast-preview",
  messages=[{"role": "user", "content": "你是谁"}],
  stream=True,
)
# glm-5.2 默认返回 reasoning_content 思考字段;
# 流式输出时思考内容与回答内容分别通过 delta.reasoning_content 与 delta.content 推送。
for chunk in completion:
  if not chunk.choices:
    continue
  delta = chunk.choices[0].delta
  if hasattr(delta, "reasoning_content") and delta.reasoning_content:
    print(delta.reasoning_content, end="", flush=True)
  if hasattr(delta, "content") and delta.content:
    print(delta.content, end="", flush=True)

计费说明

优速模式按输入与输出 token 计费,计费逻辑与标准 API 一致。具体价格见模型调用计费