curl -X POST https://dashscope.aliyuncs.com/api/v1/services/audio/tts/customization \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "cosyvoice-v3.5-plus",
"prefix": "myvoice",
"url": "https://your-audio-url.wav",
"language_hints": ["zh"],
"enable_volume_normalization": "false"
}
}'{
"output": {
"voice_id": "cosyvoice-v3.5-plus-myvoice-xxxxxx"
},
"usage": {
"count": 1
},
"request_id": "xxxxxxxx-xxxx-xxxx-xxxx-xxxxxxxxxxxx"
}鉴权
DashScope API Key。前往获取 API Key。
请求体
application/json固定为 voice-enrollment。
显示子属性
显示子属性
固定为 create_voice。
克隆音色绑定的语音合成模型。后续合成调用的 model 必须与此一致。支持 Qwen-Audio-TTS(qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash)与 CosyVoice(cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-plus、cosyvoice-v3-flash)系列模型。
音色名称前缀,仅限字母和数字,最长 10 个字符。生成的名称格式:{target_model}-{prefix}-{unique_id}。
用于克隆的音频文件 URL,必须可公开访问。
指定用于提取目标音色特征的样本音频语种,仅适用于 cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash 和 cosyvoice-v3-plus 模型。仅使用第一个元素。默认:["zh"]。取值范围(因模型而异):cosyvoice-v3-plus:zh(中文)、en(英文)、fr(法语)、de(德语)、ja(日语)、ko(韩语)、ru(俄语)。cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash:zh(中文)、en(英文)、fr(法语)、de(德语)、ja(日语)、ko(韩语)、ru(俄语)、pt(葡萄牙语)、th(泰语)、id(印尼语)、vi(越南语)。
[
"zh"
]预处理后的最大音频时长(秒)。范围:[3.0, 30.0]。默认:10.0。
是否启用音频预处理(降噪、增强、音量归一化)。默认:false。
是否对用于声音复刻的样本音频进行音量归一化。取值:"true"(开启)、"false"(关闭)。开启后,使用所创建音色合成的音频,其音量可能与关闭该参数时创建的音色不同。默认:"false"。