本文档介绍如何在千问AI平台平台调用智谱(ZHIPU AI)直供的模型推理服务。
服务开通
- 前往模型市场,搜索 GLM,找到智谱直供的 GLM 模型卡片,单击立即开通;
- 在弹窗内确认开通及授权。
快速开始
前提条件
- 需要已开通千问AI平台服务并完成API Key的创建
- 如果通过SDK调用,需要安装对应SDK
enable_thinking 参数设置思考与非思考模式:
- 思考模式(
enable_thinking: true,默认):模型会输出详细的推理过程(reasoning_content) - 非思考模式(
enable_thinking: false):直接输出结果,不包含推理过程
- OpenAI兼容
- DashScope
enable_thinking 非 OpenAI 标准参数,OpenAI Python SDK 通过 extra_body 传入,Node.js SDK 作为顶层参数传入。- Python
- Node.js
流式工具调用
ZHIPU/GLM-5.3-Flash、ZHIPU/GLM-5.3、ZHIPU/GLM-5.2、ZHIPU/GLM-5.1、ZHIPU/GLM-5 支持 tool_stream 参数(boolean,默认 false),仅在 stream 为 true 时生效。开启后,Function Calling 返回的 tool_call 参数(arguments)会以流式增量方式逐步返回。
stream 与 tool_stream 的组合行为如下:
| stream | tool_stream | tool_call 返回方式 |
|---|---|---|
true | true | arguments 以增量方式分多个 chunk 返回 |
true | false(默认) | arguments 在一个 chunk 中完整返回 |
false | true/false | tool_stream 不生效,arguments 在完整响应中一次性返回 |
- Python
- Node.js
- curl
思考控制(thinking.type 与 reasoning_effort)
ZHIPU/GLM-5.3 与 ZHIPU/GLM-5.3-Flash 始终以思考模式运行,不支持关闭思考,请保持 thinking.type 为 enabled(使用 enable_thinking 时保持为 true),并通过 reasoning_effort 控制推理深度。
| 参数 | 说明 | 取值 |
|---|---|---|
thinking.type | 控制是否开启思考,默认为 enabled。ZHIPU/GLM-5.3 与 ZHIPU/GLM-5.3-Flash 不再支持 disabled,传入 disabled 会导致 API 请求失败。 | enabled |
reasoning_effort | 控制模型推理深度。未指定时默认值为 max,建议使用 max。 |
|
清除历史思考(clear_thinking)
clear_thinking 参数用于控制多轮对话中是否将历史轮次的 reasoning_content(思考过程)作为上下文输入给模型。仅 GLM 系列模型支持。
true:忽略历史轮次的reasoning_content,仅使用可见文本、工具调用与结果等非推理内容作为上下文输入,可降低上下文长度与成本。false(默认):保留历史轮次的reasoning_content并随上下文一同提供给模型。若希望启用 Preserved Thinking,必须在 messages 中完整、未修改、按原顺序透传历史reasoning_content,缺失、裁剪、改写或重排会导致效果下降或无法生效。
该参数只影响跨轮次的历史思考内容,不改变模型在当前轮次内是否产生/输出思考。
assistant 消息中携带 reasoning_content)。设置 clear_thinking=true 后,历史思考内容不会被计入上下文,因此 prompt_tokens 少于 false(默认)的情况,实际数值取决于历史 reasoning_content 的长度。
- OpenAI兼容
- Python
- curl
多模态理解
ZHIPU/GLM-5.3-Flash 原生支持图像、视频与文件输入,文本参数与 ZHIPU/GLM-5.3 一致。传入图片时,在 messages[].content 数组中添加 type 为 image_url 的内容块,通过 image_url.url 传入图片 URL(推荐)或 Base64 Data URL;传入多张图片时添加多个 image_url 内容块。
- OpenAI兼容
Python
其它功能
| 模型 | 多轮对话 | Function Calling | 结构化输出 | 联网搜索 | 前缀续写 | 上下文缓存 | 思考深度控制 |
|---|---|---|---|---|---|---|---|
| ZHIPU/GLM-5.3 | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓(reasoning_effort) |
| ZHIPU/GLM-5.2 | ✓ | ✓ | ✓(仅非思考模式) | ✗ | ✓ | ✓ | ✓(reasoning_effort) |
| ZHIPU/GLM-5.1 | ✓ | ✓ | ✓(仅非思考模式) | ✗ | ✓ | ✓ | ✗ |
| ZHIPU/GLM-5 | ✓ | ✓ | ✓(仅非思考模式) | ✗ | ✓ | ✓ | ✗ |
参数默认值
| 模型 | enable_thinking | temperature | top_p | top_k | repetition_penalty |
|---|---|---|---|---|---|
| ZHIPU/GLM-5.3 | true(不可关闭) | 1.0 | 0.95 | — | — |
| ZHIPU/GLM-5.2 | true | 1.0 | 0.95 | — | — |
| ZHIPU/GLM-5.1 | true | 1.0 | 0.95 | 20 | 1.0 |
| ZHIPU/GLM-5 | true | 1.0 | 0.95 | 20 | 1.0 |
模型列表与计费
ZHIPU/GLM-5.3、ZHIPU/GLM-5.2、ZHIPU/GLM-5.1、ZHIPU/GLM-5 是智谱AI直供的混合推理模型,适用于智能交互、企业应用及开发辅助等场景,其中 ZHIPU/GLM-5.3 仅支持思考模式。
模型上下文长度与价格信息请参见模型市场。
按照模型的输入与输出 Token 计费。
思考模式下,思维链按照输出 Token 计费。