网页抓取工具拿正文全文,按指定字段对齐成表,比联网搜索更老实。
免责声明:本页展示内容均为 AI 模型生成,仅供参考,不构成任何效果承诺;实际产出效果与 Credits 消耗以平台用量统计为准。
qwen3.7-plus(Responses API)→ web_extractor + web_search(网页抓取,取正文全文)→ 按指定字段对齐成表。本次目标:把千问AI平台「模型市场」页里的模型抽成表。
产出一句:把「模型市场」页抓成了 28 个模型 × [模型ID / 模态 / 地域 / 接口协议] 的对照表,模型 ID 零编造,还老实交代"地域和协议是从 URL 推断的、页面没直接写"——展开看抓出来的整张表。
步骤:用网页抓取按字段成表
关键是「只用页面真实文字、找不到就说找不到」。把下面的指令发给 qwen3.7-plus(需启用 web_extractor):
查看实测产出 · web_extractor 抓取结果原样(节选,未改写)
查看实测产出 · web_extractor 抓取结果原样(节选,未改写)
说明
- 消耗:本玩法涉及文本生成 + Harness 工具。
web_extractor必须与web_search一起启用,两者都按成功调用次数抵扣,抓回的网页正文会整体进入输入。本次抓这个大页面实测web_extractor调用 4 次、总 token 约 8.8 万;页面越大、抓取轮次越多,输入消耗越高,建议先小范围验证。 - 要用「网页抓取」而不是「联网搜索」:同一类任务改用
web_search跑,它会拿零碎摘要拼答案、把找不到的字段凭记忆补上(曾实测编造过页面上没有的品牌名);web_extractor拿整页正文,才有这种"页面写了什么就抽什么"的老实结果——本次 28 个模型 ID 全部真实存在于页面、零编造(经逐一回原页核对)。 - 注意区分"抽取"与"推断":这次模型没把地域/协议硬写成"页面未提供",而是从页面上的真实 URL 推断出来、并明确交代了推断依据——这是可接受的,但你要能一眼看出哪些是页面白纸黑字、哪些是它推断的。提示词里「找不到就说找不到、禁止凭记忆补齐」这句务必保留。