跳转到主要内容
多模态向量

DashScope 多模态向量

多模态向量化 API

POST
/services/embeddings/multimodal-embedding/multimodal-embedding
curl --location --request POST \
  'https://maas.qianwenaiapi.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "model": "tongyi-embedding-vision-plus",
    "input": {
        "contents": [
            {"text": "Multimodal embedding model"},
            {"image": "https://example.com/image.jpg"},
            {"video": "https://example.com/video.mp4"}
        ]
    }
}'
{
  "output": {
    "embeddings": [
      {
        "index": 0,
        "embedding": [
          0
        ],
        "type": "text"
      }
    ]
  },
  "usage": {
    "input_tokens": 0,
    "input_tokens_details": {
      "image_tokens": 0,
      "text_tokens": 0
    },
    "output_tokens": 0,
    "total_tokens": 0,
    "image_tokens": 0
  },
  "request_id": "1fff9502-a6c5-9472-9ee1-73930fdd04c5"
}
将文本、图像和视频转换为统一语义空间中的数值向量,用于跨模态检索、相似度搜索和内容分类。
开始前:获取 API Key,将其设置为环境变量,如需使用 SDK 请先安装 DashScope SDK。

请求地址

  • HTTP:POST https://maas.qianwenaiapi.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding
  • SDK base_http_api_url:https://maas.qianwenaiapi.com/api/v1

模型概览

模型支持模态向量维度单张图片大小
qwen3-vl-embedding文本、图像、视频2560(默认)、2048、1536、1024、768、512、25610 MB
qwen2.5-vl-embedding文本、图像、视频2048、1024(默认)、768、5125 MB
tongyi-embedding-vision-plus-2026-03-06文本、图像、视频、多图1152(默认)、1024、512、256、128、64建议 5 MB,最大 10 MB
tongyi-embedding-vision-flash-2026-03-06文本、图像、视频、多图768(默认)、512、256、128、64建议 5 MB,最大 10 MB
tongyi-embedding-vision-plus文本、图像、视频、多图11523 MB
tongyi-embedding-vision-flash文本、图像、视频、多图7683 MB

使用说明

  • 图像输入:公网 URL 或 Base64 数据 URI(data:image/{format};base64,{data})。
  • 多图输入:使用 multi_images 字段,值为图像 URL 列表,最多 8 张。
  • 视频输入:必须为公网 URL。通过 parameters 中的 fps 参数控制采样帧率(取值范围 [0, 1],默认 1.0)。

错误码

本 API 常见的错误码及排查方向如下。完整错误码请参见通用错误码。
错误码HTTP 状态码触发条件排查建议
InvalidApiKey401API Key 无效或已过期,返回 Invalid API-key provided.确认 Authorization 请求头为 Bearer sk-xxx 格式,且使用的是当前账号下有效的 API Key。
BadRequest.EmptyModel400请求中缺少 model 字段,返回 Required parameter model missing from request.在请求体中补充 model 字段,取值使用本文模型列表中的模型名称。
InvalidParameter400model 取值不存在,返回 Model not exist.核对 model 拼写,确认使用了本文模型列表中的模型名称。
InvalidParameter400input.contents 缺失或为空数组,返回 input can not be empty: input.contents 或 contents input can not be empty: input.contents确认 input.contents 存在且为非空数组,数组中每个元素包含有效的 text、image 或 video 键。
InvalidParameter400dimension 取值不在所选模型支持的向量维度范围内。按本文模型列表中该模型支持的向量维度取值;multimodal-embedding-v1 不支持 dimension 参数,固定为 1024 维。
InternalError.Algo500请求体结构不完整或 input.contents 元素格式异常,导致服务端处理失败。检查请求体结构,确认 input 及 input.contents 字段存在且元素格式符合本文请求参数说明;结构无误仍持续报错时,携带 request_id 联系技术支持。

鉴权

string
header
必填

千问AI平台 API Key。详见获取 API Key。

请求体

application/json
enum<string>
必填

多模态向量嵌入的模型名称。

qwen3-vl-embedding,qwen2.5-vl-embedding,tongyi-embedding-vision-plus,tongyi-embedding-vision-flash,tongyi-embedding-vision-plus-2026-03-06,tongyi-embedding-vision-flash-2026-03-06,multimodal-embedding-v1
tongyi-embedding-vision-plus
object
必填

包含内容项的输入数据。

object

多模态向量嵌入的参数。

响应

200-application/json
object
object

Token 用量统计。不同模型返回的字段存在差异:tongyi-embedding-vision-* 系列返回 input_tokens(含文本和图片 Token 总和)、input_tokens_details、output_tokens、total_tokens;其他模型返回的字段可能不同,详见各字段说明。

string

唯一请求标识符。

1fff9502-a6c5-9472-9ee1-73930fdd04c5