了解千问旗舰模型 Qwen3.8-Max 的能力、规格与接入方式
Qwen3.8-Max 是千问系列最新旗舰模型,基于 2.4 万亿参数 MoE 架构。编程与办公能力全面跃升,可自主编程十数天交付完整项目;胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。原生视觉理解贯穿规划、执行与验证全流程,支持超长文档与长视频的深度语义解析。长程任务中自主规划与闭环迭代,持续进化。
Model ID:
编程能力 — 从空仓库独立完成跨越数天的真实项目:能自主搭建并迭代一套自进化编程工具,独立复现学术论文并在其基础上自我进化改进。
办公助手 — 覆盖法律、金融、UI 设计、医疗等数百种专业场景。可单次通读大量文档完成合规审阅,或仅凭一句需求调度多个子智能体完成量化回测,一次对话端到端交付生产级成果。
长程任务 — 在数千轮交互中持续规划与闭环迭代,而非死守固定策略。从零完成芯片逻辑重构并通过验证,长周期电商经营模拟中收益大幅领先上一代旗舰。
多模态智能体 — 原生视觉理解贯穿规划、执行与验证全流程:跨页理解超长财报与 PDF,将超长视频组织为可检索的记忆,并能在执行中自主发现并修正界面与视觉问题。
以上案例与完整评测数据详见发布博客。
定价详情见模型市场。
默认开启思考模式,通过
Qwen3.8-Max 支持图片、视频和文本的联合理解,适合需要视觉信息参与决策的 Agent 场景。
开启思考后进行工具调用,模型会先推理应调用哪些工具、如何使用返回结果,再生成回答;响应中工具调用前会包含
上下文缓存将重叠请求的公共前缀进行缓存,避免重复计算,在不影响回答质量的前提下降低成本、加快响应:
详细用法与计费参见上下文缓存。
在 Claude Code、Codex、OpenCode 等编程工具中使用 Qwen3.8-Max,推荐订阅 Token Plan——以 Credits 统一计量、支持 Qwen3.8-Max 及其他多种模型,较按量计费更优惠。
qwen3.8-max
核心亮点
编程能力 — 从空仓库独立完成跨越数天的真实项目:能自主搭建并迭代一套自进化编程工具,独立复现学术论文并在其基础上自我进化改进。
办公助手 — 覆盖法律、金融、UI 设计、医疗等数百种专业场景。可单次通读大量文档完成合规审阅,或仅凭一句需求调度多个子智能体完成量化回测,一次对话端到端交付生产级成果。
长程任务 — 在数千轮交互中持续规划与闭环迭代,而非死守固定策略。从零完成芯片逻辑重构并通过验证,长周期电商经营模拟中收益大幅领先上一代旗舰。
多模态智能体 — 原生视觉理解贯穿规划、执行与验证全流程:跨页理解超长财报与 PDF,将超长视频组织为可检索的记忆,并能在执行中自主发现并修正界面与视觉问题。
以上案例与完整评测数据详见发布博客。
模型能力与规格
| 参数 | 值 | 参数 | 值 |
|---|---|---|---|
| 上下文长度 | 1,000,000 token | 最大思维链长度 | 262,144 token |
| 最大输入长度 | 991,808 token | 最大输出长度 | 131,072 token |
| 最大输入长度(思考模式) | 983,616 token | 最大输出长度(思考模式) | 131,072 token |
快速接入
使用说明
深度思考
默认开启思考模式,通过 reasoning_effort 调节推理力度:
| 值 | 说明 | 适用场景 |
|---|---|---|
xhigh(默认) | 最大推理深度 | 数学证明、架构设计、复杂编程 |
medium | 平衡推理与速度 | 日常开发、文档生成 |
low | 快速响应 | 简单问答、信息提取 |
max 和 high 会自动映射为 xhigh。思考模式下 temperature 默认 0.6,传入更小值会自动调整为 0.6。如需整体关闭思考,可设置 enable_thinking=false,模型将直接作答、不再返回 reasoning_content。
多模态理解
Qwen3.8-Max 支持图片、视频和文本的联合理解,适合需要视觉信息参与决策的 Agent 场景。
- 图片理解:在消息中传入
image_url类型内容,模型直接分析图片内容。支持截图分析、设计稿还原、文档 OCR 等任务。高分辨率图像默认会被压缩,可通过vl_high_resolution_images、max_pixels调整视觉 token 上限以保留更多细节。 - 视频理解:传入视频 URL,模型自动抽帧分析。通过
fps控制抽帧频率,在细节捕获与成本间取得平衡。适合视频内容审核、教程摘要、会议记录等场景。 - PDF 理解:以
file_url或 Base64file_data传入 PDF,模型解析其中文字与图片。
工具调用与思考链
开启思考后进行工具调用,模型会先推理应调用哪些工具、如何使用返回结果,再生成回答;响应中工具调用前会包含 reasoning_content,多轮工具调用时需将其一并回传,省略会降低准确性。
多轮对话中,模型默认不读取历史消息里的 reasoning_content;qwen3.8-max 的 preserve_thinking 默认开启,会将思考过程拼接到下一轮输入。
详细规则参见思考模式与函数调用。
上下文缓存
上下文缓存将重叠请求的公共前缀进行缓存,避免重复计算,在不影响回答质量的前提下降低成本、加快响应:
| 模式 | 说明 |
|---|---|
| 隐式缓存 | 自动开启,系统识别公共前缀缓存,不保证命中 |
| 显式缓存 | 手动创建,确定性命中,更低延迟 |
| 会话缓存 | Responses API 专用,请求头添加 x-dashscope-session-cache: enable |