通过逐步推理解决复杂任务
Thinking(推理)模型在回答前先进行推理,输出
使用
通过
开启
多轮对话中,模型默认不会读取历史消息中
开启推理后进行 function calling,模型会先推理应调用哪些工具、如何使用返回结果,再生成回答。响应中每次工具调用前都会包含
思考内容按输出 token 计费。部分混合思考模型在思考与非思考模式下价格不同。模型在思考模式下若未输出思考过程,按非思考模式价格计费。
具体模型的思考模式定价请参见模型市场。
reasoning_content(Chat Completions / DashScope)或 reasoning_text 事件(Responses API)。模型支持两种推理模式:
- 混合模式:通过
enable_thinking逐请求开关推理。 - 纯推理模式:始终进行推理,无法关闭。
支持的模型
展开查看完整模型列表
展开查看完整模型列表
Qwen3.8
- Max 系列(混合模式,默认开启):
qwen3.8-max - 开源系列(混合思考模式,默认开启思考模式):
qwen3.8-2.4t-a95b
Qwen3.7
- Max 系列(混合模式,默认开启):
qwen3.7-max、qwen3.7-max-2026-06-08、qwen3.7-max-2026-05-20 - Max 系列(仅支持思考模式):
qwen3.7-max-preview、qwen3.7-max-2026-05-17 - Plus 系列(混合模式,默认开启):
qwen3.7-plus、qwen3.7-plus-2026-05-26 - Flash 系列(混合模式,默认开启,
thinking_budget上限 256K):qwen3.7-flash、qwen3.7-flash-2026-07-15
Qwen3.6
- Max 系列(混合模式,默认开启):
qwen3.6-max-preview - Plus 系列(混合模式,默认开启):
qwen3.6-plus、qwen3.6-plus-2026-04-02 - Flash 系列(混合模式,默认开启,
thinking_budget上限 128K):qwen3.6-flash、qwen3.6-flash-2026-04-16 - 开源版:
qwen3.6-35b-a3b
Qwen3.5
商业版- Plus 系列(混合模式,默认开启):
qwen3.5-plus、qwen3.5-plus-2026-02-15 - Flash 系列(混合模式,默认开启):
qwen3.5-flash、qwen3.5-flash-2026-02-23
- 混合模式,默认开启:
qwen3.5-397b-a17b、qwen3.5-122b-a10b、qwen3.5-27b、qwen3.5-35b-a3b
Qwen3
商业版- Max 系列(混合模式,默认关闭):
qwen3-max、qwen3-max-2026-01-23、qwen3-max-preview - Plus 系列(混合模式,默认关闭):
qwen-plus、qwen-plus-latest、qwen-plus-2025-04-28及之后的快照版模型 - Flash 系列(混合模式,默认关闭):
qwen-flash、qwen-flash-2025-07-28及之后的快照版模型 - Turbo 系列(混合模式,默认关闭):
qwen-turbo及之后的快照版模型
- 混合模式,默认开启:
qwen3-235b-a22b、qwen3-32b、qwen3-30b-a3b、qwen3-14b、qwen3-8b - 纯推理模式:
qwen3-next-80b-a3b-thinking、qwen3-235b-a22b-thinking-2507、qwen3-30b-a3b-thinking-2507
QwQ(基于 Qwen2.5)
- 纯推理模式:
qwq-plus
DeepSeek
千问AI平台部署- 混合模式,默认开启:
deepseek-v4-pro-0813、deepseek-v4-pro、deepseek-v4-flash、deepseek-v4-flash-0731 - 混合模式,默认关闭:
deepseek-v3.2、deepseek-v3.2-exp、deepseek-v3.1 - 纯推理模式:
deepseek-r1、deepseek-r1-0528、DeepSeek-R1 蒸馏模型
- 混合模式,默认关闭:
siliconflow/deepseek-v3.2、siliconflow/deepseek-v3.1-terminus - 纯推理模式:
siliconflow/deepseek-r1-0528
- 混合模式,默认关闭:
vanchin/deepseek-v3.2-think、vanchin/deepseek-v3.1-terminus - 纯推理模式:
vanchin/deepseek-r1
GLM
- 混合模式,默认开启:
glm-5.2、glm-5.2-fast-preview、glm-5.1、glm-5、glm-4.7、glm-4.6、glm-4.5、glm-4.5-air
Kimi
千问AI平台部署- 仅思考模式:
kimi-k2.7-code - 混合模式,默认关闭:
kimi-k2.6、kimi-k2.5 - 纯推理模式:
kimi-k2-thinking
- 仅思考模式:
kimi/kimi-k3、kimi/kimi-k2.7-code-highspeed、kimi/kimi-k2.7-code - 混合模式,默认开启:
kimi/kimi-k2.6、kimi/kimi-k2.5
MiniMax
千问AI平台部署- 纯推理模式:
MiniMax-M2.5、MiniMax-M2.1
- 混合思考模式:
MiniMax/MiniMax-M3
MiniMax/MiniMax-M3 通过
thinking 参数控制思考模式,取值为 adaptive(自适应,默认)或 disabled(关闭)。详细用法请参见 MiniMax-稀宇科技。- 纯推理模式:
MiniMax/MiniMax-M2.7、MiniMax/MiniMax-M2.5、MiniMax/MiniMax-M2.1
Stepfun
- 混合思考模式:
stepfun/step-3.7-flash
开启推理
- OpenAI Chat Completions
- OpenAI Responses API
- DashScope
思考模式(
enable_thinking 为 true)下,max_tokens 参数的有效取值范围为 [1, 32768],超出该范围时接口返回 400 错误(InvalidParameter: Range of max_tokens should be [1, 32768])。非思考模式下无此限制。建议使用 max_completion_tokens 参数替代 max_tokens:max_completion_tokens 限制模型的完整输出长度(包含思维链和最终回复),不受 32768 上限约束;max_tokens 仅限制最终回复部分的长度,且即将废弃,新接入的业务请使用 max_completion_tokens。控制推理深度
Token 预算
使用 thinking_budget 限制推理 token 的最大数量。达到上限后,模型会停止推理并立即生成回答。适用于 Qwen3.8、Qwen3.7、Qwen3.6、Qwen3.5、Qwen3-VL、Qwen3、GLM(千问AI平台直供)、Kimi(千问AI平台直供)系列模型。仅适用于 Chat Completions 和 DashScope,Responses API 暂不支持。
- OpenAI Chat Completions
- DashScope
reasoning_effort
通过 reasoning_effort 参数以档位方式控制推理力度,无需手动指定 token 数。不同模型支持的可选值和默认值不同。以 qwen3.8-max 为例(可选值:low、medium、xhigh,默认 xhigh):
- OpenAI Chat Completions
- DashScope
qwen3.8-max 不支持 reasoning_effort 与 thinking_budget 同时设置,同时传入会报错。两者均未设置时使用模型默认值。该参数非 OpenAI 标准参数,通过 Python SDK 调用时请放入
extra_body。各模型支持的档位、默认值及与 thinking_budget 的映射关系详见 API 参考文档。控制台体验深度思考
- 登录千问AI平台控制台。
- 在左侧导航栏选择体验 > 文本模型,进入模型体验中心。
- 页面默认展示 Qwen3.7-Max 模型,也可单击模型名称,在下拉列表中选择其他 Qwen3 系列模型。
- 在输入框底部单击深度思考,开启推理模式,查看模型的思考过程。
- 切换到模型调试标签页,在配置面板中设置
thinking_budget参数,控制思维链输出的最大 Token 数量,取值范围 1~32768,默认值 4000。如需体验更多模型,可前往模型广场。
Prompt 级控制
开启 enable_thinking: true 后,可在消息中添加 /no_think 跳过当次推理,用 /think 恢复。多条指令以最后一条为准。支持开源 Qwen3 混合模型和 qwen-plus-2025-04-28。
多轮对话中传递思考过程
多轮对话中,模型默认不会读取历史消息中 messages 数组里的 reasoning_content。将 preserve_thinking 设为 true 后,assistant 消息中的 reasoning_content 将被拼接到下一轮输入,让模型参考之前的推理过程。
preserve_thinking 参数仅支持 qwen3.8-max(默认开启)、qwen3.7-max、qwen3.7-max-2026-06-08、qwen3.7-max-2026-05-20、qwen3.7-max-preview、qwen3.7-max-2026-05-17、qwen3.7-plus、qwen3.7-plus-2026-05-26、qwen3.6-max-preview、qwen3.6-plus、qwen3.6-plus-2026-04-02、qwen3.7-flash、qwen3.7-flash-2026-07-15、kimi-k2.7-code、kimi-k2.6(千问AI平台部署)、kimi/kimi-k3、kimi/kimi-k2.7-code-highspeed、kimi/kimi-k2.7-code、kimi/kimi-k2.6(月之暗面部署)。- OpenAI Chat Completions
- DashScope
preserve_thinking非 OpenAI 标准参数,使用 Python SDK 需通过extra_body传入。- Java SDK 暂不支持
preserve_thinking参数。通过 HTTP 调用时,请将preserve_thinking放入parameters对象中。 - 启用后,历史对话中的
reasoning_content会计入输入 Token 数量并计费。
推理模式下的 function calling
开启推理后进行 function calling,模型会先推理应调用哪些工具、如何使用返回结果,再生成回答。响应中每次工具调用前都会包含 reasoning_content。
要点:
- 在
tools数组的同时传入enable_thinking: true即可,无需额外配置。 - 在多轮工具调用流程中,将助手的
reasoning_content一并回传。省略该字段会降低准确性。 - 流式输出先返回推理 token,再返回工具调用的增量数据。解析方式参见流式输出中的工具调用。
thinking_budget的用法与普通推理模式一致。
推理模式在复杂工具编排场景中价值最大——多步推理选择工具、确定参数、解读结果。对于简单的单工具调用,额外开销可能不值得。
计费说明
思考内容按输出 token 计费。部分混合思考模型在思考与非思考模式下价格不同。模型在思考模式下若未输出思考过程,按非思考模式价格计费。
具体模型的思考模式定价请参见模型市场。
常见问题
如何以非流式(同步)方式调用深度思考模型?
如何以非流式(同步)方式调用深度思考模型?
本文示例默认采用流式输出(推荐,可实时查看思考过程、避免长时间等待)。商业版深度思考模型(如 qwen-plus、qwen3-max、qwen-flash 等)也支持非流式(同步)输出,一次性返回完整的思考过程与回复。以下以 OpenAI 兼容接口、非流式调用 qwen3.8-max 开启思考模式为例:
将流式示例改为非流式时,请同步修改结果解析代码:非流式调用返回的是完整的响应对象(
completion),不能再像流式示例那样通过 for chunk in completion 迭代(否则会报错 'tuple' object has no attribute 'choices'),而应直接读取 completion.choices[0].message.reasoning_content(思考过程)与 completion.choices[0].message.content(回复内容)。此外,stream=False 时不能设置 stream_options 参数。部分模型(如 qwen3-235b-a22b、qwen3-32b 等开源版)仅支持流式输出,非流式调用会报错
parameter.enable_thinking only support stream call,此类模型请使用流式调用。qwen3.7-plus 调用响应慢如何排查?
qwen3.7-plus 调用响应慢如何排查?
qwen3.7-plus 属于混合思考模式模型,且默认开启思考模式。思考过程会生成大量推理 Token(实测占总输出 Token 的 60% 以上),因此单次调用的总耗时明显长于非思考模式。此时 Token 生成速度本身并无异常(实测约 52~54 Tokens/s),总耗时的差异主要来自思考过程产生的 Token 数量,而非模型或网络异常。排查与优化建议:
- 确认是否开启了思考模式。qwen3.7-plus 默认开启,可根据响应中是否返回
reasoning_content字段判断。 - 查看响应用量中的
completion_tokens与reasoning_tokens。若reasoning_tokens占比较高,则总耗时长属于思考模式的预期表现。 - 若无需思考过程,在请求中将
enable_thinking设为false关闭思考模式。关闭后输出 Token 大幅减少,实测总耗时可降低 60%~75%。 - 若需保留思考能力,可改用流式输出,以更快获得首个 Token 并实时查看思考过程,避免长时间等待完整响应。
用量统计中展示的是单次调用的整体耗时(含思考 Token 的生成时间),并非单个 Token 的生成延迟。
使用第三方客户端调用深度思考模型时,输出思考标签后客户端断连怎么办?
使用第三方客户端调用深度思考模型时,输出思考标签后客户端断连怎么办?
该问题属于客户端侧问题,并非模型限制思考过程输出。千问AI平台通过
enable_thinking参数控制思考模式开关,模型返回结果中的reasoning_content字段包含完整思考过程内容,模型侧会正常返回思考内容。断连通常由客户端网络波动或客户端版本兼容问题引起。排查步骤:- 检查客户端网络连接的稳定性。
- 将客户端升级至最新版本。
- 查看客户端日志,确认断连时间点与思考标签输出的关联。
长提示词生成失败或超时怎么办?
长提示词生成失败或超时怎么办?
使用长提示词调用模型时出现生成失败或响应超时,通常是因为开启了思考模式(
enable_thinking 为 true)。思考模式会增加处理时间,长提示词场景下可能导致响应被截断或请求超时。- 关闭思考模式:将
enable_thinking设为false,处理时间可从约 50 秒降至约 30 秒。 - 开启流式输出:将
stream设为true,避免非流式调用的超时限制。 - 调大超时时间:如需保留思考模式,请将客户端超时时间设为 180 秒以上。
使用视觉模型(如 qwen-vl-plus)进行图片安全判断时,模型结论与内容描述矛盾怎么办?
使用视觉模型(如 qwen-vl-plus)进行图片安全判断时,模型结论与内容描述矛盾怎么办?
视觉模型输出的安全判断是模型生成文本的一部分,并非独立的内容审核裁决。该结论可能随模型版本和所在区域不同而变化,也可能与同一次响应中的内容描述不一致,因此不建议将其作为内容合规的唯一依据。如果您需要稳定、统一的安全判断标准,请接入 AI 安全护栏,对模型的输入与输出进行独立的内容审核。
注意事项
- 部分模型必须使用流式输出:Qwen3.6 Plus、Qwen3.5 Plus/Flash、Qwen3 Max、Qwen Plus/Flash/Turbo(商业版)以及 Qwen3.5 开源模型支持非流式输出。Qwen3 开源模型必须使用流式输出。始终建议使用流式输出以避免超时风险。
- 推理模式下不支持语音输出(Qwen3-Omni):文本和图片输入正常,但开启推理后无法输出语音。