跳转到主要内容
知识库

创建知识库并导入

一步完成创建知识库和导入文件

POST
/api/v1/indices/rag/index/create_v2
cURL
curl -X POST "https://dashscope.aliyuncs.com/api/v1/indices/rag/index/create_v2" \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "name": "my-knowledge-base",
    "description": "知识库描述信息",
    "structureType": "unstructured",
    "sinkType": "DEFAULT",
    "sourceType": "DATA_CENTER_FILE",
    "embeddingModelName": "text-embedding-v4",
    "chunkSize": 600,
    "docIds": ["file_abc123", "file_def456"],
    "dataSources": [{"sourceType": "DATA_CENTER_FILE"}]
  }'
{
  "code": "Success",
  "status_code": 200,
  "success": true,
  "message": "success",
  "data": {
    "pipelineId": "your_pipeline_id",
    "ingestionId": "ing_abc123",
    "status": "PENDING",
    "created_at": 1783657930436,
    "updated_at": 1783657930436
  },
  "request_id": "xxxxxxxx-xxxx-xxxx-xxxx-xxxxxxxxxxxx",
  "status": "SUCCESS"
}
文件 ID 参数名为 docIds,不是 file_idsfileIds。但校验失败时错误信息中的参数名为 file_ids

知识库类型与使用场景

knowledgeTypeknowledgeScene 对应控制台创建知识库第 1 步的知识库类型和使用场景。两者必须同时提供或同时省略,只传一个会报 knowledgeType and knowledgeScene cannot be empty;同时省略时,系统按 structureType 采用默认配置。 控制台仅在文档搜索类型下提供使用场景选项,其余三种类型的场景是固定的(控制台自动填入),但通过 API 创建时仍需显式成对传入。
knowledgeType控制台名称structureType可用的 knowledgeScene
document文档搜索unstructuredbasic_document_qa(基础文档问答)
visual_perception_qa(视觉理解,富文本文档)
lite_document_qa(极速问答)
table数据查询structuredbasic_table_qa(固定)
image图片问答unstructuredimage_qa(固定)
multimedia音视频搜索unstructuredbasic_multimedia_qa(固定)
  • knowledgeTypestructureType 不匹配时会报 knowledgeType and structureType do not matchknowledgeScene 不属于该类型时会报 knowledgeType and knowledgeScene do not match
  • lite_document_qa(极速问答)要求 sinkTypeBUILT_IN,使用默认的 DEFAULT 会报 Lite Rag only supports BUILT_IN sink type
  • visual_perception_qaimage_qa 必须通过 multimodalEmbeddingModelName 指定多模态向量模型(如 qwen3-vl-embedding),否则报 invalid multi embedding model
  • document 类型下还有一个 visual_document_qa(图文并茂回复)场景,接口仍接受该取值,但控制台已不再提供该入口,不建议在新建知识库时使用。
图片问答的请求体示例:
{
  "name": "image-kb",
  "description": "图片问答知识库",
  "structureType": "unstructured",
  "knowledgeType": "image",
  "knowledgeScene": "image_qa",
  "sinkType": "BUILT_IN",
  "sourceType": "DATA_CENTER_FILE",
  "multimodalEmbeddingModelName": "qwen3-vl-embedding",
  "docIds": ["file_abc123"],
  "dataSources": [{ "sourceType": "DATA_CENTER_FILE" }]
}

鉴权

string
header
必填

DashScope API Key,在控制台 API Key 页面 获取。

请求体

application/json
string
必填

知识库名称,1-20 字符。

length: 1–20
string
必填

知识库描述,1-200 字符。

length: 1–200
enum<string>
必填

结构类型:unstructured(非结构化)或 structured(结构化)。

unstructured,structured
string
默认值"DEFAULT"
必填

存储类型,默认 DEFAULTBUILT_IN 表示使用平台内置向量存储,knowledgeScenelite_document_qa(极速问答)时必须为 BUILT_IN

string
必填

数据源类型,如 DATA_CENTER_FILE

string[]
必填

创建知识库时同步导入的文件 ID 列表,值来自 addFile 注册文件后返回的 fileId,或通过 listFile 查询已有文件获取。建议导入不超过 10000 个。注意参数名为 docIds(非 file_ids/fileIds),但校验失败时错误信息中的参数名为 file_ids

items >= 1
object[]
必填

数据源配置列表。

enum<string>

知识库类型,取值与 structureType/knowledgeScene 的匹配见知识库类型与使用场景

document,table,image,multimedia
enum<string>

使用场景,取值取决于 knowledgeType,见知识库类型与使用场景

basic_document_qa,visual_document_qa,lite_document_qa,visual_perception_qa,basic_table_qa,image_qa,basic_multimedia_qa
string

向量嵌入模型名称,如 text-embedding-v4

string

多模态向量模型名称,如 qwen3-vl-embeddingknowledgeSceneimage_qa(图片问答)或 visual_perception_qa(视觉理解)时必填,缺失或取值非法会返回 invalid multi embedding model

integer

文档切片大小(字符数)。建议值 300-800。

x >= 1
string[]

创建知识库时可同步导入文件。通过指定类目 ID,可导入对应类目下的所有文件,建议导入不超过 10000 个。

响应

200-application/json
string

响应码,成功时为 Success

integer

HTTP 状态码。

boolean

请求是否成功,成功时为 true

string

响应消息,成功时为 success

string

请求唯一标识,排查问题时请提供此 ID。

string

请求状态,成功时为 SUCCESS

object