本文介绍声音复刻的HTTP API接口详情,包括创建音色、查询音色列表、查询音色详情、更新音色和删除音色等操作。
用户指南:声音复刻。
HTTP请求地址:
Qwen-Audio-TTS/CosyVoice返回
Qwen-Audio-TTS/CosyVoice返回
Qwen-Audio-TTS/CosyVoice的output为空对象,Qwen返回
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为
接口地址(Qwen-Audio-TTS/CosyVoice/Qwen-TTS)
POST https://maas.qianwenaiapi.com/api/v1/services/audio/tts/customization
接口地址(MiniMax)
HTTP请求地址:POST https://maas.qianwenaiapi.com/api/v1/services/aigc/multimodal-generation/generation
SDK调用配置的base_url:https://maas.qianwenaiapi.com/api/v1
第三方模型(MiniMax)目前仅支持通过maas.qianwenaiapi.com域名调用,暂不支持专属域名。
请求头
| 参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
| Authorization | string | 是 | 鉴权令牌,格式为Bearer $DASHSCOPE_API_KEY,使用时,将"$DASHSCOPE_API_KEY"替换为实际的API Key。 |
| Content-Type | string | 是 | 请求体的媒体类型。Qwen-Audio-TTS/CosyVoice/Qwen-TTS固定为application/json,MiniMax固定为application/json; charset=utf-8。 |
创建音色(Qwen-Audio-TTS/CosyVoice/Qwen-TTS)
请求体
| 参数 | 类型 | 说明 |
|---|---|---|
| model | string | (必选) 声音复刻模型。取值:
|
| input | object | (必选) 输入参数对象。 |
| input.action | string | (必选) 操作类型。
|
| input.target_model | string | (必选) 驱动音色的语音合成模型。必须与后续调用语音合成接口时使用的模型一致,否则合成会失败。 |
| input.url | string | (条件必选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice声音复刻(model为voice-enrollment时)。 用于复刻音色的音频文件URL,要求公网可访问。 |
| input.audio | object | (条件必选) 提示: 仅适用于Qwen-TTS声音复刻(model为qwen-voice-enrollment时)。 音频数据,支持两种提交方式:
|
| input.text | string | (可选) 提示: 仅适用于Qwen-TTS声音复刻(model为qwen-voice-enrollment时)。 音频对应的文本内容,用于辅助提升复刻效果。 |
| input.prefix | string | (条件必选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice(model为voice-enrollment时)。 音色名称前缀,仅允许数字和英文字母,不超过10个字符。生成的音色名格式:{target_model}-{prefix}-{唯一标识}。 |
| input.preferred_name | string | (条件必选) 提示: 仅适用于Qwen-TTS声音复刻(model为qwen-voice-enrollment时)。 音色名称前缀,仅允许数字、英文字母和下划线,不超过16个字符。 |
| input.language_hints | array[string] | (可选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice声音复刻(model为voice-enrollment时),且仅qwen-audio-3.0-tts-plus、qwen-audio-3.1-tts-flash、qwen-audio-3.0-tts-flash、cosyvoice-v3.5-plus、v3.5-flash、v3-plus和v3-flash模型支持。 辅助模型识别样本音频的语种,从而更准确地提取音色特征,提升复刻效果。若设置的语种与实际音频语种不符(例如为中文音频设置 en),系统将忽略该设置并自动检测语种。 此参数为数组,但当前版本仅处理第一个元素。 取值范围(因模型而异):
|
| input.language | string | (可选) 提示: 仅适用于Qwen-TTS声音复刻(model为qwen-voice-enrollment时)。 指定 audio.data 音频对应的语种。若使用该参数,设置的语种须与实际用于复刻的音频语种一致。 取值范围:
|
| input.max_prompt_audio_length | float | (可选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice声音复刻(model为voice-enrollment时),且仅qwen-audio-3.0-tts-plus、qwen-audio-3.1-tts-flash、qwen-audio-3.0-tts-flash、cosyvoice-v3.5-plus、v3.5-flash和v3-flash模型支持。 音频预处理后用于声音复刻的参考音频最大时长(秒)。取值范围:[3.0, 30.0]。 默认值:10.0。 |
| input.enable_preprocess | boolean | (可选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice声音复刻(model为voice-enrollment时),且仅qwen-audio-3.0-tts-plus、qwen-audio-3.1-tts-flash、qwen-audio-3.0-tts-flash、cosyvoice-v3.5-plus、v3.5-flash和v3-flash模型支持。 是否开启音频预处理(降噪、音频增强、音量规整)。有背景噪音时建议开启;安静环境建议关闭以最大程度还原音色。 默认值:false。 |
| input.enable_volume_normalization | string | (可选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice声音复刻(model为voice-enrollment时)。 是否对用于声音复刻的样本音频进行音量归一化。取值:
"false"。 |
返回体
voice_id字段,Qwen返回voice字段。Qwen-TTS声音复刻还可能返回fallback_mode和fallback_reason字段。
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | 模型返回的数据。 |
| output.voice_id / voice | string | 音色ID。Qwen-Audio-TTS/CosyVoice返回voice_id,Qwen返回voice。可直接用于语音合成接口的voice参数。 |
| output.target_model | string | 提示: 仅Qwen返回。 驱动音色的语音合成模型。 |
| output.fallback_mode | boolean | 提示: 仅适用于Qwen-TTS声音复刻(model为qwen-voice-enrollment时)。 是否以降级模式创建音色。当音频质量不佳或与文本不匹配时,该值为true,表示复刻效果可能不理想。 |
| output.fallback_reason | string | 提示: 仅当fallback_mode为true时返回。 降级原因。可能的值包括no_merged_segments(无法合并音频片段)、no_valid_asr_segments(音频与文本严重不匹配)等。 |
| usage | object | 本次请求用量信息。 |
| usage.count | integer | 创建的音色数量,固定为1。 |
创建音色(MiniMax)
音色复刻请求会生成一段试听音频,试听音频按所选模型的同步语音合成单价额外计费。
请求体
| 参数 | 类型 | 说明 |
|---|---|---|
| model | string | (必选) 指定合成试听音频使用的语音模型。 支持的模型:
|
| input | object | (必选) |
| input.action | string | (必选) 需要进行的操作,支持设置为:voice_clone(声音克隆) |
| input.audio_url | string | (必选) 需要复刻的音频文件 URL,音频需符合以下规范:
|
| input.clone_prompt | object | (可选) 音色复刻示例音频,提供本参数将有助于增强语音合成的音色相似度和稳定性。若使用本参数,需准备一小段示例音频。 |
| input.clone_prompt.prompt_audio | string | (可选) 示例音频文件 URL,音频需符合以下规范:
|
| input.clone_prompt.prompt_text | string | (可选) 示例音频的对应文本,需确保和音频内容一致,句末需有标点符号做结尾。 |
| input.text | string | (必选) 复刻声音期望试听的内容。限制 1000 字符以内。 > 试听将根据字符数正常收取语音合成费用,收费标准参见MiniMax模型价格。
|
| input.voice_id | string | (必选) 克隆音色的 voice_id,正确示例:"MiniMax001"。用户进行自定义 voice_id 时需注意:
|
| input.language_boost | enum<string> | **(可选)**默认值:null 是否增强对指定的小语种和方言的识别能力。可设置为 auto 让模型自主判断。 Chinese, Chinese,Yue, English, Arabic, Russian, Spanish, French, Portuguese, German, Turkish, Dutch, Ukrainian, Vietnamese, Indonesian, Japanese, Italian, Korean, Thai, Polish, Romanian, Greek, Czech, Finnish, Hindi, Bulgarian, Danish, Hebrew, Malay, Persian, Slovak, Swedish, Croatian, Filipino, Hungarian, Norwegian, Slovenian, Catalan, Nynorsk, Tamil, Afrikaans,auto |
| input.need_noise_reduction | boolean | **(可选)**默认值:false 音频复刻参数,表示是否开启降噪,默认值为 false。 |
| input.need_volume_normalization | boolean | **(可选)**默认值:false 是否开启音量归一化。 |
| input.aigc_watermark | boolean | **(可选)**默认值:false 是否在合成试听音频的末尾添加音频节奏标识。 |
返回体
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | |
| output.input_sensitive | boolean | 输入音频是否命中风控。 |
| output.input_sensitive_type | integer | 输入音频命中风控的类型,取值为以下其一:
|
| output.demo_audio | string | 链接形式的试听音频。 |
| output.base_resp | object | |
| output.base_resp.status_code | integer | 状态码
|
| output.base_resp.status_msg | string | 状态详情 |
| usage | object | 本次请求的字符用量。 |
| usage.characters | integer | 输入文本的字符数。 |
查询音色列表
MiniMax不支持通过本接口查询音色列表。如需查询 MiniMax 系列模型(如 MiniMax/speech-2.8-turbo)的可用音色 ID(含系统音色与已复刻音色),请参见声音管理。
请求体
| 参数 | 类型 | 说明 |
|---|---|---|
| model | string | (必选) 声音复刻模型。取值:
|
| input | object | (必选) 输入参数对象。 |
| input.action | string | (必选) 操作类型。Qwen-Audio-TTS/CosyVoice:list_voice。Qwen:list。 |
| input.prefix | string | (可选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice。 按前缀筛选音色。 |
| input.page_index | integer | (可选) 页码索引。 |
| input.page_size | integer | (可选) 每页包含数据条数。 |
返回体
voice_list数组,每项包含voice_id字段;Qwen同样返回voice_list数组,每项包含voice字段。Qwen的output中还包含page_index、page_size和total_count分页信息字段。
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | 模型返回的数据。 |
| output.page_index | integer | 提示: 仅Qwen返回。 当前页码索引。 |
| output.page_size | integer | 提示: 仅Qwen返回。 每页数据条数。 |
| output.total_count | integer | 提示: 仅Qwen返回。 音色总数。 |
| output.voice_list | array[object] | 查询到的音色列表。Qwen-Audio-TTS/CosyVoice和Qwen均使用voice_list字段名。 |
| output.voice_list.voice_id / voice | string | 音色ID。Qwen-Audio-TTS/CosyVoice为voice_id,Qwen为voice。 |
| output.voice_list.gmt_create | string | 创建时间。 |
| output.voice_list.gmt_modified | string | 修改时间。 |
| output.voice_list.status | string | 提示: 仅Qwen-Audio-TTS/CosyVoice返回。 音色状态,取值参见"音色状态说明"。 |
| output.voice_list.target_model | string | 提示: 仅Qwen返回。 驱动音色的语音合成模型。 |
| usage | object | 本次请求用量信息。 |
| usage.count | integer | Qwen-Audio-TTS/CosyVoice固定为1。Qwen固定为0。 |
查询音色详情
仅适用于Qwen-Audio-TTS/CosyVoice(model为
voice-enrollment时)。Qwen和MiniMax模型不支持查询音色详情操作。请求体
- Qwen-Audio-TTS/CosyVoice
| 参数 | 类型 | 说明 |
|---|---|---|
| model | string | (必选) 固定为voice-enrollment(Qwen-Audio-TTS/CosyVoice)。 |
| input | object | (必选) 输入参数对象。 |
| input.action | string | (必选) 固定为query_voice。 |
| input.voice_id | string | (必选) 要查询的音色ID。 |
返回体
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | 模型返回的数据。 |
| output.resource_link | string | 音频文件的URL地址。 |
| output.gmt_create | string | 创建时间。 |
| output.gmt_modified | string | 修改时间。 |
| output.status | string | 音色状态,取值参见"音色状态说明"。 |
| output.target_model | string | 驱动音色的语音合成模型。 |
| usage | object | 本次请求用量信息。 |
| usage.count | integer | 固定为1。 |
更新音色
仅适用于Qwen-Audio-TTS/CosyVoice声音复刻(model为
voice-enrollment时)。Qwen和MiniMax模型不支持更新操作。请求体
| 参数 | 类型 | 说明 |
|---|---|---|
| model | string | (必选) 固定为voice-enrollment。 |
| input | object | (必选) 输入参数对象。 |
| input.action | string | (必选) 固定为update_voice。 |
| input.voice_id | string | (必选) 要更新的音色ID。 |
| input.url | string | (必选) 新的音频文件URL,要求公网可访问。 |
返回体
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | 模型返回的数据,更新操作返回空对象。 |
| usage | object | 本次请求用量信息。 |
| usage.count | integer | 固定为1。 |
删除音色
MiniMax不支持通过本接口查询音色列表。如需查询 MiniMax 系列模型(如 MiniMax/speech-2.8-turbo)的可用音色 ID(含系统音色与已复刻音色),请参见声音管理。
请求体
| 参数 | 类型 | 说明 |
|---|---|---|
| model | string | (必选) 声音复刻模型。取值:
|
| input | object | (必选) 输入参数对象。 |
| input.action | string | (必选) 操作类型。Qwen-Audio-TTS/CosyVoice:delete_voice。Qwen:delete。 |
| input.voice_id | string | (条件必选) 提示: 仅适用于Qwen-Audio-TTS/CosyVoice。 要删除的音色ID。 |
| input.voice | string | (条件必选) 提示: 仅适用于Qwen。 要删除的音色名称。 |
返回体
voice字段。
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | 模型返回的数据。Qwen-Audio-TTS/CosyVoice返回空对象,Qwen返回已删除的音色名称。 |
| output.voice | string | 提示: 仅Qwen返回。 已删除的音色名称。 |
| usage | object | 本次请求用量信息。 |
| usage.count | integer | 固定为1。 |
音色状态说明
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为voice-enrollment时),Qwen的查询和列表返回中不包含status字段。
| 状态 | 说明 |
|---|---|
| DEPLOYING | 审核中/处理中。 |
| OK | 审核通过,可正常使用。 |
| UNDEPLOYED | 审核未通过,不可使用。 |