curl --location 'https://dashscope.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"image": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20250925/fpakfo/image36.webp"
},
{
"text": "Generate an image that matches the depth map, following this description: A dilapidated red bicycle is parked on a muddy path with a dense primeval forest in the background."
}
]
}
]
},
"parameters": {
"n": 2,
"negative_prompt": " ",
"prompt_extend": true,
"watermark": false,
"size": "1536*1024"
}
}'{
"output": {
"rewrite_status": "not_use",
"choices": [
{
"finish_reason": "stop",
"message": {
"content": [
{
"image": "https://dashscope-result-sz.oss-cn-shenzhen.aliyuncs.com/xxx.png?Expires=xxx"
},
{
"image": "https://dashscope-result-sz.oss-cn-shenzhen.aliyuncs.com/xxx.png?Expires=xxx"
}
],
"role": "assistant"
}
}
]
},
"usage": {
"output_height": 1024,
"output_width": 1536,
"input_image_count": 1,
"input_image_type": "qima_input_1k",
"output_image_count": 2,
"output_image_type": "qima_output_1k"
},
"request_id": "bf37ca26-0abe-98e4-8065-xxxxxx"
}鉴权
千问AI平台 API Key。详见获取 API Key。
请求体
application/json模型名称。
包含 messages 数组的输入数据。
显示子属性
显示子属性
仅支持单轮对话,messages 数组必须包含且仅包含一条 role 为 user 的消息。
显示子属性
显示子属性
必须为 user。
消息内容数组,须包含 1 到 3 个图像对象和恰好 1 个文本对象。多图输入时,图像按位置引用(图像 1、图像 2、图像 3),输出图像的宽高比由最后一张图像决定。
显示子属性
显示子属性
输入图像,支持公开可访问的 URL(HTTP/HTTPS)或 Base64 编码字符串(格式:data:{mime_type};base64,{data})。支持的格式:JPG、JPEG、PNG、BMP、TIFF、WEBP、GIF(仅第一帧)。建议图像宽高在 384 到 3072 像素之间以获得最佳效果。最大文件大小:10 MB。
图像编辑指令,描述期望输出图像包含的元素和视觉特征。支持中英文,qwen-image-3.0 系列推荐不超过 4500 Token;qwen-image-2.0 系列上限为 1300 Token;其他模型为 800 Token。超出部分将自动截断。仅支持传入一条文本输入,不传或传入多条将报错。
图像编辑参数。
显示子属性
显示子属性
生成图像的数量。默认值:1。
- qwen-image-3.0 / qwen-image-2.0 / qwen-image-edit-max / qwen-image-edit-plus 系列:1-6 张。
- qwen-image-edit:仅支持 1 张。
描述不希望出现在图像中的内容。支持中英文,最多 500 个字符,超出部分自动截断。
输出分辨率,格式为 宽*高。
- qwen-image-3.0 系列:总像素在 512*512 到 2048*2048 之间,宽高比在 1:8 到 8:1 之间,不指定时由模型根据提示词自动推荐分辨率。
- qwen-image-2.0 系列:总像素在 512*512 到 2048*2048 之间,默认与输入图像相同(多图请求以最后一张图像为准)。
- qwen-image-edit-max/plus:宽和高均在 [512, 2048] 范围内,默认约 1024*1024,宽高比与输入图像相近,自动调整为最近的 16 的倍数。
- qwen-image-edit:不支持此参数。
推荐尺寸:1024*1024(1:1)、768*1152 / 1024*1536(2:3)、1152*768 / 1536*1024(3:2)、720*1280 / 1080*1920(9:16)、1280*720 / 1920*1080(16:9)。
启用提示词优化。开启后模型将对编辑指令进行优化,当提示词描述不够详细时效果提升显著;qwen-image-3.0 系列按 prompt_extend_mode 指定的方式改写。qwen-image-edit 不支持此参数。
提示词改写方式。仅 qwen-image-3.0 系列支持。
direct(默认):直接提示词增强(DPE),适用于大多数场景。agent:智能体提示词增强(APE),仅文生图支持;图像编辑场景传入将返回 400 错误。
在图像右下角添加 "Qwen-Image" 水印。
是否开启思考模式,默认值为 true。开启时,模型将增强推理能力以提升出图质量,但会增加生成耗时。仅在 prompt_extend=true 时生效,适用于 Direct T2I、Direct I2I 和 Agent T2I,I2I Agent 暂不支持。
随机数种子,范围:[0, 2147483647]。相同的种子可生成较为一致(但不完全相同)的结果。不指定时使用随机种子。
响应
用量统计(仅统计成功结果)。字段随模型系列不同:qwen-image-3.0 系列返回 output_* / input_* 字段,其他系列返回 image_count / width / height。
显示子属性
显示子属性
最终输出图片的宽度(像素)。仅 qwen-image-3.0 系列返回。
最终输出图片的高度(像素)。仅 qwen-image-3.0 系列返回。
请求中输入图片的数量。文生图为 0,图像编辑按实际输入图片数返回。仅 qwen-image-3.0 系列返回。
输入图片计量档位,按输出分辨率像素面积判断:面积不大于 2,250,000 为 qima_input_1k,大于 2,250,000 为 qima_input_2k。仅 qwen-image-3.0 系列返回。
实际返回的输出图片数量。仅 qwen-image-3.0 系列返回。
输出图片计量档位,按输出分辨率像素面积判断:面积不大于 2,250,000 为 qima_output_1k,大于 2,250,000 为 qima_output_2k。仅 qwen-image-3.0 系列返回。
已生成的图像数量。qwen-image-3.0 系列不返回此字段,改用 output_image_count。
生成图像的宽度(像素)。qwen-image-3.0 系列不返回此字段,改用 output_width。
生成图像的高度(像素)。qwen-image-3.0 系列不返回此字段,改用 output_height。
请求的唯一标识符,用于追踪和排查问题。