本文档介绍如何在千问 AI 平台平台调用智谱(ZHIPU AI)直供的模型推理服务。
服务开通
- 前往千问 AI 平台控制台,搜索 GLM,找到智谱直供的 GLM 模型卡片,单击立即开通;
- 在弹窗内确认开通及授权。
快速开始
前提条件
- 需要已开通千问 AI 平台服务并完成API Key的创建
- 如果通过SDK调用,需要安装对应SDK
enable_thinking 参数设置思考与非思考模式:
- 思考模式(
enable_thinking: true,默认):模型会输出详细的推理过程(reasoning_content) - 非思考模式(
enable_thinking: false):直接输出结果,不包含推理过程
- OpenAI兼容
- DashScope
enable_thinking 非 OpenAI 标准参数,OpenAI Python SDK 通过 extra_body 传入,Node.js SDK 作为顶层参数传入。- Python
- Node.js
清除历史思考(clear_thinking)
clear_thinking 参数用于控制多轮对话中是否将历史轮次的 reasoning_content(思考过程)作为上下文输入给模型。仅 GLM 系列模型支持。
true:忽略历史轮次的reasoning_content,仅使用可见文本、工具调用与结果等非推理内容作为上下文输入,可降低上下文长度与成本。false(默认):保留历史轮次的reasoning_content并随上下文一同提供给模型。若希望启用 Preserved Thinking,必须在 messages 中完整、未修改、按原顺序透传历史reasoning_content,缺失、裁剪、改写或重排会导致效果下降或无法生效。
该参数只影响跨轮次的历史思考内容,不改变模型在当前轮次内是否产生/输出思考。
assistant 消息中携带 reasoning_content)。设置 clear_thinking=true 后,历史思考内容不会被计入上下文,因此 prompt_tokens 少于 false(默认)的情况,实际数值取决于历史 reasoning_content 的长度。
- OpenAI兼容
- Python
- curl
其它功能
| 模型 | 多轮对话 | Function Calling | 联网搜索 | 上下文缓存 | 思考深度控制 |
|---|---|---|---|---|---|
| ZHIPU/GLM-5.2 | ✓ | ✓ | ✓(仅非思考模式) | ✓ | ✓(reasoning_effort) |
| ZHIPU/GLM-5.1 | ✓ | ✓ | ✓(仅非思考模式) | ✓ | ✗ |
| ZHIPU/GLM-5 | ✓ | ✓ | ✓(仅非思考模式) | ✓ | ✗ |
参数默认值
| 模型 | enable_thinking | temperature | top_p | top_k | repetition_penalty |
|---|---|---|---|---|---|
| ZHIPU/GLM-5.2 | true | 1.0 | 0.95 | — | — |
| ZHIPU/GLM-5.1 | true | 1.0 | 0.95 | 20 | 1.0 |
| ZHIPU/GLM-5 | true | 1.0 | 0.95 | 20 | 1.0 |
模型列表与计费
ZHIPU/GLM-5.2、ZHIPU/GLM-5.1、ZHIPU/GLM-5 是智谱AI直供的混合推理模型,适用于智能交互、企业应用及开发辅助等场景。
模型上下文长度与价格信息请参见千问 AI 平台控制台。
按照模型的输入与输出 Token 计费。
思考模式下,思维链按照输出 Token 计费。