curl -X POST https://dashscope.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"qwen-audio-3.0-tts-flash","input":{"text":"我家的后面有一个很大的花园。","voice":"longanhuan_v3.6","format":"wav","sample_rate":24000}}'{
"request_id": "ee88b03d-0457-9286-8c67-xxxx",
"output": {
"finish_reason": "stop",
"audio": {
"data": "",
"url": "http://dashscope-result-bj.oss-cn-beijing.aliyuncs.com/.../ee88b03d.wav",
"id": "audio_ee88b03d",
"expires_at": 1772697707
}
},
"usage": {
"characters": 15
}
}鉴权
格式为Bearer $DASHSCOPE_API_KEY。
Header 参数
流式合成时设为enable。
请求体
application/json语音合成模型。
取值范围:
- qwen-audio-3.0-tts-plus
- qwen-audio-3.0-tts-flash
- cosyvoice-v3.5-plus
- cosyvoice-v3.5-flash
- cosyvoice-v3-plus
- cosyvoice-v3-flash
- cosyvoice-v2
显示子属性
显示子属性
待合成文本。
支持 SSML 和 LaTeX 格式输入。将待合成文本替换为对应格式即可。
- 使用 SSML 时,需同时将
enable_ssml设置为true。支持的 SSML 标签及用法,请参见SSML 与 LaTeX。 - 使用 LaTeX 时,将待合成文本替换为 LaTeX 格式即可,无需额外配置。支持的 LaTeX 语法及用法,请参见LaTeX 公式转语音。
音色。
取值范围:
- 系统音色:参见Qwen-Audio-TTS音色列表、CosyVoice音色列表
- 声音复刻音色:如何创建音色请参见CosyVoice声音复刻/设计API
- 声音设计音色:如何创建音色请参见CosyVoice声音复刻/设计API
音频编码格式。
默认值:mp3。
取值范围:
- mp3
- pcm
- wav
- opus
音频采样率(Hz)。
取值范围:8000, 16000, 22050(默认), 24000, 44100, 48000。
音量。
默认值:50。
取值范围:[0, 100]。
语速。
默认值:1.0。
取值范围:[0.5, 2.0]。
音频码率(单位:kbps)。
默认值:32。
取值范围:[6, 510]。
仅在format为opus时支持使用该参数。
音调。
默认值:1.0。
取值范围:[0.5, 2.0]。
是否开启字级别时间戳。
默认值:false。
仅在流式输出模式下可用。支持的音色范围:qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash、cosyvoice-v3-plus和cosyvoice-v2模型的复刻音色,以及Qwen-Audio-TTS音色列表、CosyVoice音色列表中标记为支持的系统音色。其他模型的复刻音色不支持此功能。
生成时使用的随机数种子,使合成的效果产生变化。在模型版本、文本、音色及其他参数均相同的前提下,使用相同的seed可复现相同的合成结果。
默认值0。
取值范围:[0, 65535]。
- 此参数为数组,但当前版本仅处理第一个元素,因此建议只传入一个值。
- 此参数用于指定语音合成的目标语言,该设置与声音复刻时的样本音频的语种无关。如需设置复刻任务的源语言,请参见声音复刻API参考。
指定语音合成的目标语言,提升合成效果。
当数字、缩写、符号等朗读方式或者小语种合成效果不符合预期时使用,例如:
- 数字朗读方式不符合预期,“hello, this is 110”读成“hello, this is one one zero”而非“hello, this is 幺幺零”
- 符号朗读不准确,“@”读成“艾特”而非“at”
- 小语种合成效果差,合成不自然
取值范围:
- zh:中文
- en:英语
- fr:法语
- de:德语
- ja:日语
- ko:韩语
- ru:俄语
- pt:葡萄牙语
- th:泰语
- id:印尼语
- vi:越南语
- es:西班牙语
- it:意大利语
- ms:马来西亚语
- fil:菲律宾语
- ar:阿拉伯语
是否在生成的音频中添加AIGC隐性标识。设置为true时,会将隐性标识嵌入到支持格式(wav/mp3/opus)的音频中。
默认值:false。
仅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支持该功能。
设置AIGC隐性标识中的 ContentPropagator 字段,用于标识内容的传播者。仅在 enable_aigc_tag 为 true 时生效。
默认值:千问AI平台UID。
仅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支持该功能。
设置AIGC隐性标识中的 PropagateID 字段,用于唯一标识一次具体的传播行为。仅在 enable_aigc_tag 为 true 时生效。
默认值:本次语音合成请求Request ID。
仅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支持该功能。
文本热修复配置,用于自定义指定词语的发音或对待合成文本进行替换。
cosyvoice-v2不支持该功能。
参数介绍:
- pronunciation:自定义发音。指定词语的拼音标注,用于纠正默认发音不准确的情况。
- replace:文本替换。在语音合成前将指定词语替换为目标文本,替换后的文本将作为实际合成内容。
示例:
"hot_fix": {
"pronunciation": [
{"天气": "tian1 qi4"}
],
"replace": [
{"今天": "金天"}
]
}仅cosyvoice-v3-flash复刻音色支持该功能。
是否启用 Markdown 过滤。启用该功能后,系统在合成语音前自动过滤输入文本中的 Markdown 标记符号,避免将其朗读为文字内容。
默认值:false。
取值范围:
- true:启用Markdown过滤
- false:禁用Markdown过滤
响应
本次调用的唯一标识符。
显示子属性
显示子属性
任务停止原因,自然停止时为stop。
取值范围:
- null:语音合成中
- stop:语音合成结束
子事件类型。仅流式合成时返回该值。
取值范围:
-
sentence-begin:标识句子开始,返回待合成的句子文本内容
-
sentence-synthesis:标识音频数据块
- 一个句子的合成过程中会产生多个
sentence-synthesis事件,每个对应一个音频数据块 - 客户端需要按顺序接收这些音频数据块并以追加模式写入同一文件
sentence-synthesis事件与其后的音频数据帧是一一对应的关系,不会出现错位
- 一个句子的合成过程中会产生多个
-
sentence-end:标识句子结束,返回句子文本内容和累计的计费字符数
对用户输入文本进行分句后的句内容。最后一个句子可能没有此字段。