跳转到主要内容
资料与数据处理

网页提数 · 指定字段抓成表

网页抓取工具拿正文全文,按指定字段对齐成表,比联网搜索更老实。

免责声明:本页展示内容均为 AI 模型生成,仅供参考,不构成任何效果承诺;实际产出效果与 Credits 消耗以平台用量统计为准。
要从一个网页里把固定几个字段扒下来(型号、参数、地域、限额),一个个复制粘贴最费人。但这件事有个反直觉的坑:用「联网搜索」去做,模型容易拿摘要片段拼答案、把找不到的字段凭记忆补上;换成「网页抓取」拿正文全文,反而老实得多。 调用链:qwen3.7-plus(Responses API)→ web_extractor + web_search(网页抓取,取正文全文)→ 按指定字段对齐成表。本次目标:把千问AI平台「模型市场」页里的模型抽成表。 产出一句:把「模型市场」页抓成了 28 个模型 × [模型ID / 模态 / 地域 / 接口协议] 的对照表,模型 ID 零编造,还老实交代"地域和协议是从 URL 推断的、页面没直接写"——展开看抓出来的整张表。

步骤:用网页抓取按字段成表

关键是「只用页面真实文字、找不到就说找不到」。把下面的指令发给 qwen3.7-plus(需启用 web_extractor):
请访问下面这个页面,把页面上列出的模型抽成一张表格。
页面:https://www.qianwenai.com/models
抽取字段(每个模型一行):
| 模型 ID | 所属模态类别(文本生成/图像/视频/语音等) | 支持的地域 | 支持的接口协议 |
要求:
1. 必须先抓取该页面的正文内容后再回答,只使用页面上真实存在的文字
2. 模型 ID 必须与页面完全一致(注意大小写、点号、连字符),不要臆造不存在的模型
3. 任何在页面正文里找不到的字段,写「页面未提供」——不要根据记忆或其他页面推测补齐
4. 尽量把页面上出现的模型都列全
5. 最后说明:一共抽到几个模型?受抓取限制有没有遗漏?
## 千问AI平台「模型市场」表格

| 模型 ID | 所属模态类别 | 支持的地域 | 支持的接口协议 |
|---|---|---|---|
| qwen3.8-max | 文本生成 | 北京、新加坡 | OpenAI 兼容 / Anthropic 兼容 / DashScope |
| qwen3.7-plus | 文本生成 | 北京、新加坡 | OpenAI 兼容 / Anthropic 兼容 / DashScope |
| deepseek-v4-pro | 文本生成 | 北京、新加坡 | OpenAI 兼容 / Anthropic 兼容 / DashScope |
| kimi/kimi-k3 | 文本生成 | 北京 | OpenAI 兼容 |
| glm-5.2 | 文本生成 | 北京、新加坡 | OpenAI 兼容 / Anthropic 兼容 / DashScope |
| MiniMax/MiniMax-M3 | 文本生成 | 北京 | OpenAI 兼容 |
| qwen-image-3.0-pro | 图像与视频 | 北京、新加坡 | DashScope |
| wan2.7-image-pro | 图像与视频 | 北京、新加坡 | DashScope |
| happyhorse-1.1-t2v | 图像与视频 | 北京、新加坡 | DashScope |
| Tripo/Tripo-H3.1 | 3D 模型生成 | 北京 | DashScope |
| qwen-audio-3.0-tts-plus | 音频与语音 | 北京、新加坡 | DashScope WebSocket |
| qwen-audio-3.0-asr-flash-streaming | 音频与语音 | 北京、新加坡 | DashScope WebSocket |
| text-embedding-v4 | 向量与重排序 | 北京、新加坡 | OpenAI 兼容 |
| qwen3-rerank | 向量与重排序 | 北京、新加坡 | DashScope |
| …(共 28 个模型,此处节选 14 行,含千问 / DeepSeek / Kimi / 智谱 / MiniMax / 小米 / Tripo 等三方直供) |

——模型自己的说明(原样保留)——
· 一共抽到 28 个模型(去重后)。
· 部分多模态模型在"文本生成"和"图像与视频"分区重复出现,已去重。
· 「支持的地域」「接口协议」页面没有直接写成字段,是根据 URL 模式推断的(cn-beijing→北京、ap-southeast-1→新加坡、compatible-mode/v1→OpenAI 兼容、api/v1→DashScope…),已透明标注推断依据。
· 页面底部提示"前往模型广场查看所有历史版本",可能仍有历史/领域模型未在此页列出。

说明

  • 消耗:本玩法涉及文本生成 + Harness 工具。web_extractor 必须与 web_search 一起启用,两者都按成功调用次数抵扣,抓回的网页正文会整体进入输入。本次抓这个大页面实测 web_extractor 调用 4 次、总 token 约 8.8 万;页面越大、抓取轮次越多,输入消耗越高,建议先小范围验证。
  • 要用「网页抓取」而不是「联网搜索」:同一类任务改用 web_search 跑,它会拿零碎摘要拼答案、把找不到的字段凭记忆补上(曾实测编造过页面上没有的品牌名);web_extractor 拿整页正文,才有这种"页面写了什么就抽什么"的老实结果——本次 28 个模型 ID 全部真实存在于页面、零编造(经逐一回原页核对)。
  • 注意区分"抽取"与"推断":这次模型没把地域/协议硬写成"页面未提供",而是从页面上的真实 URL 推断出来、并明确交代了推断依据——这是可接受的,但你要能一眼看出哪些是页面白纸黑字、哪些是它推断的。提示词里「找不到就说找不到、禁止凭记忆补齐」这句务必保留。