为编程模型添加视觉能力
Token Plan 支持的部分模型(qwen3.7-plus 等)原生支持视觉理解,可直接处理图片输入。对于 glm-5、MiniMax-M2.5 等纯文本模型,可通过添加本地 Skill 使其获得视觉能力。
qwen3.7-plus 等模型具备视觉理解能力。如果经常需要处理图片,直接切换到这些模型是最简单、推荐的做法。
更多编程工具中的模型切换方式请参考接入客户端/开发工具。切换后可直接在对话中引用图片路径,或拖拽/粘贴图片。
如需使用 glm-5、MiniMax-M2.5 等不支持视觉的模型处理图片,可通过配置 Skill 或 Agent 实现。
运行图片理解 Skill 会消耗 Token Plan Credits,无其他收费项。
前提条件
- 已订阅 Token Plan。
- 已在 AI 工具中完成接入配置,且能正常对话,详情请参见接入客户端/开发工具。
视觉支持情况
| 模型 | 是否支持视觉 | 说明 |
|---|---|---|
| qwen3.8-max-preview、qwen3.7-plus、qwen3.6-plus、kimi-k2.5 等 | 是 | 无需额外配置,可直接传入图片 |
| qwen3-max-2026-01-23、qwen3-coder-next、qwen3-coder-plus、glm-5、glm-4.7、MiniMax-M2.5 | 否 | 需通过 Skill 或 Agent 辅助模型获得视觉能力 |
方法 1:直接使用视觉模型(推荐)
qwen3.7-plus 等模型具备视觉理解能力。如果经常需要处理图片,直接切换到这些模型是最简单、推荐的做法。
| 工具 | 模型切换方式 |
|---|---|
| Claude Code | /model qwen3.7-plus 或 /model qwen3.6-plus 或 /model qwen3.5-plus 或 /model kimi-k2.5 |
| OpenCode | /models 然后搜索并选择 qwen3.7-plus 或 qwen3.6-plus 或 qwen3.5-plus 或 kimi-k2.5 |
| Qwen Code | /model 然后选择 qwen3.7-plus 或 qwen3.6-plus 或 qwen3.5-plus 或 kimi-k2.5 |
方法 2:通过 Skill 或 Agent 添加视觉能力
如需使用 glm-5、MiniMax-M2.5 等不支持视觉的模型处理图片,可通过配置 Skill 或 Agent 实现。
- Claude Code
- OpenCode
添加 Skill
- 在项目目录下的
.claude文件夹中新建skills/image-analyzer目录:
- 在该目录下创建
SKILL.md文件,并写入以下内容:
- 创建完成后的目录结构如下:
开始使用
- 在项目目录下运行
claude启动 Claude Code,并运行/model glm-5切换到glm-5模型。 - 在对话中引用图片路径并提问,例如:
请加载image-analyzer skill,描述一下 screenshot.png 中的内容。
常见问题
OpenCode + 视觉理解模型为什么无法理解图片?
OpenCode + 视觉理解模型为什么无法理解图片?
原因:OpenCode 默认不启用模型的视觉能力,需要在配置文件中显式声明
modalities 参数。解决方案:在 OpenCode 配置文件的模型定义中添加 modalities 字段,将 input 设为 ["text", "image"],如下所示:将 sk-sp-xxx 替换为 Token Plan API Key。
OpenClaw + 视觉理解模型为什么无法理解图片?
OpenClaw + 视觉理解模型为什么无法理解图片?
原因:OpenClaw 需要通过配置文件中的 input 字段来判断模型是否支持视觉能力。解决方案:
- 在
~/.openclaw/openclaw.json配置文件中,确保模型定义包含"input": ["text", "image"]字段。
- 修改配置后,需要清除 OpenClaw 的模型缓存并重启,否则旧的配置仍会生效。