CosyVoice 声音复刻 Python SDK 参考(VoiceEnrollmentService)。
通过 DashScope Python SDK 的
创建服务前设置 base URL:
包路径:
从音频创建克隆音色。
返回值:
列出克隆音色,支持前缀过滤和分页。
返回值:
查询指定克隆音色的详细信息。
返回值:
用新音频更新已有克隆音色。
返回值:
删除克隆音色。
返回值:
VoiceEnrollmentService 类调用 CosyVoice 声音复刻。该 SDK 仅覆盖声音复刻功能,CosyVoice 声音设计以及所有 Qwen 声音复刻/设计请使用 HTTP API。
用户指南:声音复刻。
前提条件
- API Key,配置为
DASHSCOPE_API_KEY环境变量 - 最新版 DashScope SDK
Service URL
创建服务前设置 base URL:
VoiceEnrollmentService 类
包路径:dashscope.audio.tts_v2.VoiceEnrollmentService
管理 CosyVoice 克隆音色的完整生命周期(创建、列表、查询、更新、删除)。
构造方法
create_voice()
从音频创建克隆音色。
| 参数 | 类型 | 必选 | 说明 |
|---|---|---|---|
| target_model | str | 是 | 克隆音色绑定的语音合成模型。后续合成调用的 model 必须与此一致。 |
| prefix | str | 是 | 音色名称前缀,仅限字母和数字,最长 10 个字符。生成的名称格式:{target_model}-{prefix}-{unique_id}。 |
| url | str | 是 | 用于克隆的音频文件 URL,必须可公开访问。 |
| language_hints | List[str] | 否 | 音频的语言提示,仅使用第一个元素。默认:["zh"]。qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash 支持的语言:zh(中文)、en(英文)、fr(法语)、de(德语)、ja(日语)、ko(韩语)、ru(俄语)、pt(葡萄牙语)、th(泰语)、id(印尼语)、vi(越南语)、it(意大利语)、es(西班牙语)、ms(马来语)、fil(菲律宾语)、ar(阿拉伯语)。 |
| max_prompt_audio_length | float | 否 | 预处理后的最大音频时长(秒)。范围:[3.0, 30.0]。默认:10.0。 |
| enable_preprocess | bool | 否 | 是否启用音频预处理(降噪、增强)。默认:False。 |
str,生成的音色 ID(voice_id)。
list_voice()
列出克隆音色,支持前缀过滤和分页。
| 参数 | 类型 | 必选 | 说明 |
|---|---|---|---|
| prefix | str | 否 | 按名称前缀过滤。 |
| page_index | int | 否 | 页码,从 0 开始。默认:0。 |
| page_size | int | 否 | 每页条数。默认:10。 |
list,音色对象列表。
query_voice()
查询指定克隆音色的详细信息。
| 参数 | 类型 | 必选 | 说明 |
|---|---|---|---|
| voice_id | str | 是 | 要查询的音色 ID。 |
dict,包含 status、resource_link、target_model 等信息。
update_voice()
用新音频更新已有克隆音色。
| 参数 | 类型 | 必选 | 说明 |
|---|---|---|---|
| voice_id | str | 是 | 要更新的音色 ID。 |
| url | str | 是 | 新的音频文件 URL,必须可公开访问。 |
| language_hints | List[str] | 否 | 新音频的语言提示。 |
| max_prompt_audio_length | float | 否 | 预处理后的最大音频时长(秒)。 |
| enable_preprocess | bool | 否 | 是否启用音频预处理。 |
None
delete_voice()
删除克隆音色。
| 参数 | 类型 | 必选 | 说明 |
|---|---|---|---|
| voice_id | str | 是 | 要删除的音色 ID。 |
None