支持的模型
模型名称 | 语音合成单价(每万字符) | 免费额度(注) | |
|---|---|---|---|
MiniMax/speech-2.8-hd | 3.5元 | 9.9元 (在首次使用复刻出来的音色进行语音合成的时候收取) | 无 |
MiniMax/speech-02-hd | 3.5元 | ||
MiniMax/speech-2.8-turbo | 2元 | ||
MiniMax/speech-02-turbo | 2元 |
URL
HTTP请求地址:POST https://maas.qianwenaiapi.com/api/v1/services/aigc/multimodal-generation/generation
SDK调用配置的base_url:https://maas.qianwenaiapi.com/api/v1
Headers
| 参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
| Authorization | string | 是 | 鉴权令牌,格式为Bearer $DASHSCOPE_API_KEY,使用时,将“$DASHSCOPE_API_KEY”替换为实际的API Key。 |
| Content-Type | string | 是 | 请求体的媒体类型,固定为application/json。 |
| X-DashScope-SSE | string | 否 | 是否启用 SSE(Server-Sent Events)流式输出。设为 enable 时,服务端将以流式事件逐步返回结果,适用于实时性要求较高的场景。不设置时,使用默认的同步响应模式。 |
请求体modelstring(必选)模型名称。支持:
object(必选)
属性 text string(必选)待合成语音的文本。长度限制小于 10000 字符,若文本长度大于 3000 字符,推荐使用流式输出。stream_options object(可选)流式输出的配置项,仅在请求头 X-DashScope-SSE: enable 时生效。
属性 exclude_aggregated_audio boolean(可选) 默认值为false控制流式输出的合成结束帧中,audio 字段是否返回本次合成的完整音频(即此前所有合成中分块拼接后的整段 hex 数据)。取值范围:
该参数仅在流式输出场景下生效;非流式输出场景下设置无效。 object(必选)
属性 voice_id string(必选)设置音色ID。若需要设置混合音色,请设置 timbre_weights 参数,本参数设置为空值。speed float(可选) 默认值为1.0设置语速。取值范围:[0.5, 2.0]。vol float(可选) 默认值为1.0设置音量。取值范围:(0.0, 10.0]。pitch integer(可选) 默认值为0设置音高。取值范围:[-12, 12]。emotion string(可选) 无默认值设置情感。模型会根据输入文本自动匹配合适的情感,一般无需手动指定。取值范围:
speech-2.8-hd, speech-2.8-turbo 模型不支持 whisperboolean(可选) 默认值为false是否启用中文、英语文本规范化,开启后可提升数字阅读场景的性能,但会略微增加延迟。取值范围:
boolean(可选) 默认值为false是否启用朗读 LaTeX 公式的功能。取值范围:
$$x = \\frac{-b \\pm \\sqrt{b^2 - 4ac}}{2a}$$。
object(可选)
属性 sample_rate integer(可选) 默认值为32000设置生成的音频的采样率(单位为Hz)。取值范围:
integer(可选) 默认值为128000设置生成的音频的码率(单位kbps)。取值范围:
该参数仅在 format参数为mp3时生效。对于其他格式,该参数将被忽略。string(可选) 默认值为mp3设置生成的音频的格式。取值范围:
integer(可选) 默认值为1设置生成的音频的声道数。取值范围:
boolean(可选) 默认值为false是否以恒定码率进行音频编码。取值范围:
仅流式输出且音频格式为 mp3时该参数生效。object(可选)
属性 tone string[](可选)定义需要特殊标注的文字或符号对应的注音或发音替换规则。使用 / 作为分隔符。在中文文本中,声调用数字表示:一声为 1,二声为 2,三声为 3,四声为 4,轻声为 5。示例: ["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]object[](可选)若需要设置混合音色,请对该参数进行设置。最多支持 4 种音色混合。
属性 voice_id string(必选)设置音色ID。weight integer(必选)设置音色所占权重,必须与 voice_id 同步填写。单一音色取值占比越高,合成音色与该音色相似度越高。取值范围:[1, 100]。string(可选) 默认值为null是否增强对指定的小语种和方言的识别能力。可设置为 auto 让模型自主判断。
取值范围(点击查看):
object(可选)设置声音效果,该参数支持的音频格式:
属性 pitch integer(可选) 无默认值设置音高(低沉/明亮)。数值越低声音越低沉,数值越高声音越明亮。取值范围:[-100, 100]。intensity integer(可选) 无默认值设置强度(力量感/柔和)。数值越低声音越刚劲,数值越高声音越轻柔。取值范围:[-100, 100]。timbre integer(可选) 无默认值设置音色明暗程度(磁性/清脆)。数值越低声音越浑厚,数值越高声音越清脆。取值范围:[-100, 100]。sound_effects string(可选) 无默认值设置音效。取值范围:
boolean(可选) 默认值为false是否开启字幕。取值范围:
该参数仅在非流式输出场景下有效,且仅对 speech-2.8-hd, speech-2.8-turbo, speech-2.6-hd, speech-2.6-turbo, speech-02-hd, speech-02-turbo, speech-01-hd, speech-01-turbo 模型有效。string(可选) 默认值为hex设置输出结果形式。取值范围:
该参数仅在非流式场景中生效(流式场景只返回 hex形式)。boolean(可选) 默认值为false是否在合成音频末尾添加 AIGC 隐性标识。取值范围:
该参数仅在非流式输出场景下有效。 |
返回体
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 本次调用的唯一标识符。 |
| output | object | 模型返回的数据。 |
| output.base_resp | object | 本次请求的状态码和详情。 |
| output.base_resp.status_code | integer | 状态码。 您可在header中获取本次会话的trace_id,用于在咨询/反馈时帮助定位问题
|
| output.base_resp.status_msg | string | 状态详情。 |
| output.data | object | 返回的合成数据对象,可能为 null,需进行非空判断。 |
| output.data.audio | string | 合成后的音频数据,采用 hex 编码,格式与请求中(output_format参数)指定的输出格式一致。 |
| output.data.status | integer | 当前音频流状态:1 表示合成中,2 表示合成结束 |
| output.extra_info | object | |
| output.extra_info.audio_length | integer | 音频时长(毫秒) |
| output.extra_info.audio_sample_rate | integer | 音频采样率 |
| output.extra_info.audio_size | integer | 音频文件大小(字节) |
| output.extra_info.bitrate | integer | 音频比特率 |
| output.extra_info.audio_format | string | 生成音频文件的格式。取值范围 [mp3, pcm, flac] 可用选项: mp3, pcm, flac。 |
| output.extra_info.audio_channel | integer | 生成音频声道数,1:单声道,2:双声道 |
| output.extra_info.invisible_character_ratio | float | 非法字符占比.非法字符不超过 10%(包含 10%),音频会正常生成,并返回非法字符占比数据;如超过 10% 将进行报错 |
| output.extra_info.usage_characters | integer | 计费字符数 |
| output.extra_info.word_count | integer | 已发音的字数统计,包含汉字、数字、字母,不包含标点符号 |
| output.trace_id | string | 本次会话的 id,用于在咨询/反馈时帮助定位问题 |
| usage | object | 本次请求的字符用量。 |
| usage.characters | integer | 输入文本的字符数。 |