Qwen-Livetranslate-Realtime
本文介绍千问实时语音/音视频翻译 API 的服务端事件,包括事件类型、参数和示例。
相关文档:实时语音/音视频翻译-千问 。
error
服务端返回的错误信息。
{
"event_id" : "event_RoUu4T8yExPMI37GKwaOC" ,
"type" : "error" ,
"error" : {
"type" : "invalid_request_error" ,
"code" : "invalid_value" ,
"message" : "Invalid modalities: ['audio']. Supported combinations are: ['text'] and ['audio', 'text']." ,
"param" : "session.modalities"
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为error。 error object 错误的详细信息。 error.type string 错误类型。 error.code string 错误码。 error.message string 错误信息。 error.param string 与错误相关的参数,如session.modalities。
session.created
客户端连接后,服务端返回的第一个事件,包含本次连接的默认配置信息。
适用于 qwen3.8-livetranslate-flash-realtime。
{
"event_id" : "event_example" ,
"type" : "session.created" ,
"session" : {
"id" : "sess_example" ,
"object" : "realtime.session" ,
"model" : "qwen3.8-livetranslate-flash-realtime" ,
"input_modalities" : [
"audio"
],
"output_modalities" : [
"text" ,
"audio"
],
"audio" : {
"input" : {
"format" : {
"type" : "pcm" ,
"sample_rate" : 16000
},
"turn_detection" : {
"type" : "speaker_detection" ,
"threshold" : 0.5 ,
"silence_duration_ms" : 1000
}
},
"output" : {
"format" : {
"type" : "pcm" ,
"sample_rate" : 24000
},
"voice" : "Tina"
}
},
"translation" : {
"language" : "en"
}
}
}
qwen3.5-livetranslate-flash-realtime 示例:
{
"event_id" : "event_QxBGpjBDmDDQQWDtrqBKB" ,
"type" : "session.created" ,
"session" : {
"id" : "sess_OozZ1vtbPt2muDflHODIH" ,
"object" : "realtime.session" ,
"model" : "qwen3.5-livetranslate-flash-realtime" ,
"modalities" : [
"text" ,
"audio"
],
"voice" : "Cherry" ,
"input_audio_format" : "pcm" ,
"sample_rate" : 16000 ,
"output_audio_format" : "pcm" ,
"turn_detection" : {
"type" : "server_vad" ,
"threshold" : 0.2 ,
"silence_duration_ms" : 1000
},
"translation" : {
"language" : "en" ,
"corpus" : {
"phrases" : {
"人工智能" : "Artificial Intelligence" ,
"机器学习" : "Machine Learning"
}
}
}
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为session.created。 session object 会话的配置。 session.id string 会话的唯一标识符。 session.object string 固定为realtime.session。 session.model string 使用的模型。 session.input_modalities array 适用于 qwen3.8-livetranslate-flash-realtime。输入模态,例如 ["audio"]。 session.output_modalities array 适用于 qwen3.8-livetranslate-flash-realtime。输出模态:["text"] 或 ["text", "audio"]。 session.audio object 适用于 qwen3.8-livetranslate-flash-realtime。音频输入与输出配置。 session.audio.input.format object 输入格式。type 默认值为 pcm,sample_rate 默认值为 16000(Hz)。 session.audio.input.turn_detection object 断句配置。默认 type 为 speaker_detection,threshold 为 0.5,silence_duration_ms 为 1000。 session.audio.output.format object 输出格式。type 默认值为 pcm,sample_rate 默认值为 24000(Hz)。 session.audio.output.voice string 输出音色,默认值为 Tina。 session.modalities array 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 模型输出模态设置。 session.voice string 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 模型生成音频的音色。 session.input_audio_format string 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输入音频的格式,默认为pcm。 session.sample_rate integer 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输入音频的采样率,单位为Hz。 session.output_audio_format string 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输出音频的格式,默认为pcm。 session.turn_detection object 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 VAD(语音活动检测)配置。 session.translation object (可选) 翻译配置。 session.translation.language string (可选) 设置的翻译目标语种。 session.translation.corpus object (可选) 热词配置,用于提升特定词汇的翻译准确性。 session.translation.corpus.phrases object (可选) 热词映射表。key 为源语言词汇,value 为目标语言对应翻译,参见支持的语种 。
session.updated
收到用户的 session.update 请求后,若处理成功,则返回此事件;若出错,则返回 error 事件。
适用于 qwen3.8-livetranslate-flash-realtime。
{
"event_id" : "event_example" ,
"type" : "session.updated" ,
"session" : {
"id" : "sess_example" ,
"object" : "realtime.session" ,
"model" : "qwen3.8-livetranslate-flash-realtime" ,
"input_modalities" : [
"audio"
],
"output_modalities" : [
"text" ,
"audio"
],
"audio" : {
"input" : {
"format" : {
"type" : "pcm" ,
"sample_rate" : 16000
},
"turn_detection" : {
"type" : "speaker_detection" ,
"threshold" : 0.5 ,
"silence_duration_ms" : 1000
}
},
"output" : {
"format" : {
"type" : "pcm" ,
"sample_rate" : 24000
},
"voice" : "Tina"
}
},
"translation" : {
"language" : "en"
}
}
}
qwen3.5-livetranslate-flash-realtime 示例:
{
"event_id" : "event_QxBGpjBDmDDQQWDtrqBKB" ,
"type" : "session.updated" ,
"session" : {
"id" : "sess_OozZ1vtbPt2muDflHODIH" ,
"object" : "realtime.session" ,
"model" : "qwen3.5-livetranslate-flash-realtime" ,
"modalities" : [
"text" ,
"audio"
],
"voice" : "Ethan" ,
"sample_rate" : 16000 ,
"input_audio_format" : "pcm" ,
"output_audio_format" : "pcm" ,
"input_audio_transcription" : {
"model" : "qwen3-asr-flash-realtime" ,
"language" : "zh"
},
"turn_detection" : {
"type" : "server_vad" ,
"threshold" : 0.2 ,
"prefix_padding_ms" : 300 ,
"silence_duration_ms" : 1000 ,
"create_response" : true ,
"interrupt_response" : true
},
"translation" : {
"language" : "en" ,
"corpus" : {
"phrases" : {
"人工智能" : "Artificial Intelligence" ,
"机器学习" : "Machine Learning"
}
}
},
"enable_voice_clone" : true ,
"voice_clone_options" : {
"frequency" : "once"
}
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为session.updated。 session object 会话的配置。 session.id string 会话的唯一标识符。 session.object string 固定为realtime.session。 session.model string 使用的模型。 session.input_modalities array 适用于 qwen3.8-livetranslate-flash-realtime。输入模态,例如 ["audio"]。 session.output_modalities array 适用于 qwen3.8-livetranslate-flash-realtime。输出模态:["text"] 或 ["text", "audio"]。 session.audio object 适用于 qwen3.8-livetranslate-flash-realtime。音频输入与输出配置。 session.audio.input.format object 输入格式。type 默认值为 pcm,sample_rate 默认值为 16000(Hz)。 session.audio.input.turn_detection object 断句配置。默认 type 为 speaker_detection,threshold 为 0.5,silence_duration_ms 为 1000。 session.audio.output.format object 输出格式。type 默认值为 pcm,sample_rate 默认值为 24000(Hz)。 session.audio.output.voice string 输出音色,默认值为 Tina。 session.modalities array 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 模型输出模态设置。 session.voice string 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 模型生成音频的音色。 session.sample_rate integer (可选) 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输入音频的采样率。 session.input_audio_format string 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输入音频的格式,固定为pcm。 session.output_audio_format string 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输出音频的格式,固定为pcm。 session.input_audio_transcription object 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 输入音频转录配置。仅在会话配置了input_audio_transcription.model参数时返回。 session.input_audio_transcription.model string 语音识别模型。 session.input_audio_transcription.language string 设置的语音识别语种。 session.turn_detection object 适用于 qwen3.5-livetranslate-flash-realtime 等模型。 VAD(语音活动检测)配置。Manual 模式下(客户端在session.update中将该参数设为null)不返回此字段。 session.turn_detection.type string VAD 类型,固定为server_vad。 session.turn_detection.threshold float VAD 检测灵敏度。 session.turn_detection.prefix_padding_ms integer 语音开始前保留的音频时长(毫秒),避免丢失语音起始部分。 session.turn_detection.silence_duration_ms integer 语音结束后需保持静音的最短时长(毫秒),超过该时长即判定语音结束。 session.turn_detection.create_response boolean VAD 检测到语音结束后,是否自动触发翻译响应。 session.turn_detection.interrupt_response boolean VAD 检测到新一轮语音开始时,是否打断当前正在生成的翻译响应。 session.translation object (可选) 翻译配置。 session.translation.language string (可选) 设置的翻译目标语种。 session.translation.corpus object (可选) 热词配置,用于提升特定词汇的翻译准确性。 session.translation.corpus.phrases object (可选) 热词映射表。key 为源语言词汇,value 为目标语言对应翻译。 session.enable_voice_clone boolean 是否启用声音复刻。 session.voice_clone_options object 声音复刻控制参数,仅在enable_voice_clone为true时返回。 session.voice_clone_options.frequency string 音色复刻频率。
session.finished
会话结束事件,表示当前会话中,所有音频翻译已完成。
该事件在客户端发送session.finish 后才会发送,客户端接收到该事件后可主动断开连接。
{
"event_id" : "event_xxx" ,
"type" : "session.finished"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为session.finished。
response.created
当服务端生成新的模型响应时,会返回此事件。
{
"event_id" : "event_L8hHVI5jYis6BzAjnPWJh" ,
"type" : "response.created" ,
"response" : {
"id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"object" : "realtime.response" ,
"conversation_id" : "conv_UFClXtYkRkFXrs48y8pmK" ,
"status" : "in_progress" ,
"modalities" : [
"text" ,
"audio"
],
"voice" : "Cherry" ,
"output_audio_format" : "pcm16" ,
"output" : []
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.created。 response object 响应对象。 response.id string 响应的唯一标识符。 response.conversation_id string 当前会话的唯一标识符。 response.object string 对象类型,此事件下固定为realtime.response。 response.status string 响应状态,取值范围: completed(已完成)failed(失败)in_progress(进行中)incomplete(不完整) response.modalities array 响应的模态。 response.voice string 模型生成音频的音色。 response.output_audio_format string 输出音频的格式。 response.output string 此事件下目前为空。
response.done
响应生成完成后,服务端会返回此事件。事件中的 response 对象包含除原始音频数据外的全部输出项。
{
"event_id" : "event_CNea8oXNipVanSg2VIzkO" ,
"type" : "response.done" ,
"response" : {
"id" : "resp_TfhYTqej692vsGA2jNEtH" ,
"object" : "realtime.response" ,
"conversation_id" : "conv_ZtyLfKVm8XqLwYRlsuDih" ,
"status" : "completed" ,
"modalities" : [
"text" ,
"audio"
],
"voice" : "Cherry" ,
"output_audio_format" : "pcm16" ,
"output" : [
{
"id" : "item_MKtkMwN9RtcyE9eJShyWy" ,
"object" : "realtime.item" ,
"type" : "message" ,
"status" : "completed" ,
"role" : "assistant" ,
"content" : [
{
"type" : "audio" ,
"transcript" : "Hello? "
}
]
}
],
"usage" : {
"total_tokens" : 56 ,
"input_tokens" : 47 ,
"output_tokens" : 9 ,
"input_tokens_details" : {
"text_tokens" : 20 ,
"audio_tokens" : 27
},
"output_tokens_details" : {
"text_tokens" : 2 ,
"audio_tokens" : 7
}
}
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.done。 response object 响应对象。 response.id string 响应的唯一标识符。 response.conversation_id string 当前会话的唯一标识符。 response.object string 对象类型,此事件下固定为realtime.response。 response.status string 响应的状态。 response.modalities array 响应的模态。 response.voice string 模型生成音频的音色。 response.output_audio_format string 输出音频的格式。 response.output object 响应的输出。 response.output.id string 响应输出的唯一标识符。 response.output.type string 输出项的类型,当前固定为message。 response.output.object string 输出项的对象类型,当前固定为realtime.item。 response.output.status string 输出项的状态。 response.output.role string 输出项的角色。 response.output.content array 输出项的内容。 response.output.content.type string 输出内容的类型。输出为纯文本时,为text;输出包含音频时,为audio。 response.output.content.text string 输出的文本内容。 response.output.content.transcript string 音频转录为文字后的内容。 response.usage object 本次响应的 Token 消耗信息。
response.text.delta
适用于 qwen3.8-livetranslate-flash-realtime。 仅输出文本时,返回译文的新增文本片段。
{
"event_id" : "event_example" ,
"type" : "response.text.delta" ,
"response_id" : "resp_example" ,
"item_id" : "item_example" ,
"output_index" : 0 ,
"content_index" : 0 ,
"delta" : "Hello"
}
参数 类型 说明 event_id string 事件唯一标识符。 type string response.text.delta。response_id string 响应 ID。 item_id string 消息 ID。 output_index integer 输出项索引。 content_index integer 内容片段索引。 delta string 本次新增的文本片段。按接收顺序累加,不覆盖已收到的文本。
response.text.text
适用于 qwen3.5-livetranslate-flash-realtime 等模型。 使用 qwen3.8-livetranslate-flash-realtime 时,请处理 response.text.delta 事件。
当输出模态仅包含文本,且模型增量生成新的文本时,服务端将返回此事件。
{
"event_id" : "event_B1lIeyOXR7qJMEExbqtTG" ,
"type" : "response.text.text" ,
"response_id" : "resp_B1lIdtjF4Noqpn5NOjznj" ,
"item_id" : "item_B1lIdJsAJlJiFs8ztWpJt" ,
"output_index" : 0 ,
"content_index" : 0 ,
"text" : "How are" ,
"stash" : " you today?"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.text.text。 text string 返回的增量文本。 response_id string 回复的ID。 item_id string 消息项ID,可以关联同一个消息项。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 stash string 初步生成的临时文本,与当前 text 拼接后构成临时生成结果;系统会通过 response.text.text 事件持续更新 text 和 stash,直至收到response.text.done 事件,此时可通过 text 字段获取完整的最终文本。
response.text.done
当输出模态仅包含文本,且模型生成的文本结束时,服务端返回此事件。
当响应中断、不完整或取消时,服务端也会返回此事件。
{
"event_id" : "event_B1lIeE2Nac33zn5V7h2mm" ,
"type" : "response.text.done" ,
"response_id" : "resp_B1lIdtjF4Noqpn5NOjznj" ,
"item_id" : "item_B1lIdJsAJlJiFs8ztWpJt" ,
"output_index" : 0 ,
"content_index" : 0 ,
"text" : "How can I assist you today?"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.text.done。 response_id string 响应的唯一标识符。 item_id string 消息项的唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 text string 模型输出的完整文本。
response.audio.delta
当输出模态包含音频,且模型增量生成新的音频数据时,服务端将返回此事件。
{
"event_id" : "event_B1osWMZBtrEQbiIwW0qHQ" ,
"type" : "response.audio.delta" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"item_id" : "item_OFaPGtzfWCPyGzxnuEX9i" ,
"output_index" : 0 ,
"content_index" : 0 ,
"delta" : "UklGRnoGAABXQVZFZm10IBAAAAAB..."
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.audio.delta。 response_id string 响应的唯一标识符。 item_id string 消息项唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 delta string 模型增量输出的音频数据,使用Base64编码。
response.audio.done
当输出模态包含音频,且模型生成音频结束时,服务端返回此事件。
当响应中断、不完整或取消时,服务端也会返回此事件。
该事件不返回完整音频数据。
{
"event_id" : "event_B1osWMWoDRYyITDyNYcBu" ,
"type" : "response.audio.done" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"item_id" : "item_OFaPGtzfWCPyGzxnuEX9i" ,
"output_index" : 0 ,
"content_index" : 0
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.audio.done。 response_id string 响应的唯一标识符。 item_id string 消息项唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。
当服务端 VAD(语音活动检测)检测到用户开始说话时,返回此事件。
{
"event_id" : "event_xxx" ,
"type" : "input_audio_buffer.speech_started" ,
"audio_start_ms" : 568 ,
"item_id" : "item_xxx"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为input_audio_buffer.speech_started。 audio_start_ms integer 检测到语音开始的时间点(毫秒),相对于音频流开始的偏移量。 item_id string 关联的消息项唯一标识符。 speaker_id integer 适用于 qwen3.8-livetranslate-flash-realtime。启用 speaker_detection 时返回的说话人标识。可通过本事件的 item_id 关联语音识别结果,并通过翻译消息项的 previous_item_id 关联译文。
当服务端 VAD 检测到用户停止说话时,返回此事件,标志本轮语音输入结束。由于翻译响应基于流式语音同步生成,实际的翻译响应可能已经在语音输入过程中开始,无需等待此事件。
{
"event_id" : "event_xxx" ,
"type" : "input_audio_buffer.speech_stopped" ,
"audio_end_ms" : 3900 ,
"item_id" : "item_xxx"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为input_audio_buffer.speech_stopped。 audio_end_ms integer 检测到语音结束的时间点(毫秒),相对于音频流开始的偏移量。 item_id string 关联的消息项唯一标识符。
Manual 模式(turn_detection为null)下,客户端发送input_audio_buffer.commit事件后,服务端返回此事件进行确认,并自动开始生成翻译响应。
{
"event_id" : "event_xxx" ,
"type" : "input_audio_buffer.committed"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为input_audio_buffer.committed。
客户端发送input_audio_buffer.clear事件后,服务端返回此事件进行确认,表示已清空缓冲区中尚未提交的音频数据。
{
"event_id" : "event_xxx" ,
"type" : "input_audio_buffer.cleared"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为input_audio_buffer.cleared。
conversation.item.created
当对话中创建新的消息项时,服务端返回此事件。以下场景会触发此事件:
服务端开始生成翻译响应时,创建对应的 assistant 消息项(此时content为空数组,内容随流式响应逐步填充)。
Manual 模式下,客户端发送input_audio_buffer.commit事件后,服务端会额外创建一个对应用户输入音频的消息项(content中包含{"type": "input_audio"})。
对于同一个 VAD 片段,服务端会分别创建语音识别结果和翻译结果消息项。语音识别结果消息项的 item.id 与翻译结果事件的 previous_item_id 相同。客户端可据此关联原文和译文,并同时展示。
{
"event_id" : "event_xxx" ,
"type" : "conversation.item.created" ,
"previous_item_id" : "item_asr_xxx" ,
"item" : {
"id" : "item_translation_xxx" ,
"object" : "realtime.item" ,
"type" : "message" ,
"status" : "in_progress" ,
"role" : "assistant" ,
"content" : []
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为conversation.item.created。 previous_item_id string 前一消息项的唯一标识符。对于翻译结果事件,该值与同一 VAD 片段的语音识别结果消息项 item.id 相同。 item object 消息项信息。 item.id string 消息项的唯一标识符。 item.type string 固定为message。 item.object string 固定为realtime.item。 item.status string 消息项的状态。 item.role string 消息的角色,取值为assistant或user。 item.content array 消息的内容。响应刚创建时为空数组,随流式响应逐步填充;Manual 模式下 commit 产生的用户消息项中包含{"type": "input_audio"}。
适用于 qwen3.8-livetranslate-flash-realtime。 返回输入语音的原文识别增量。
{
"event_id" : "event_example" ,
"type" : "conversation.item.input_audio_transcription.delta" ,
"item_id" : "item_example" ,
"content_index" : 0 ,
"delta" : "Hello"
}
参数 类型 说明 event_id string 事件唯一标识符。 type string conversation.item.input_audio_transcription.delta。item_id string 消息 ID。 content_index integer 内容片段索引。 delta string 本次新增的文本片段。按接收顺序累加,不覆盖已收到的文本。
conversation.item.input_audio_transcription.text
适用于 qwen3.5-livetranslate-flash-realtime 等模型。 使用 qwen3.8-livetranslate-flash-realtime 时,请处理 conversation.item.input_audio_transcription.delta 事件。
当配置了input_audio_transcription.model参数时,服务端会流式返回输入音频的语音识别结果(源语言原文)。
{
"event_id" : "event_xxx" ,
"type" : "conversation.item.input_audio_transcription.text" ,
"item_id" : "item_xxx" ,
"content_index" : 0 ,
"text" : "" ,
"stash" : "今天天气真好" ,
"language" : "zh" ,
"emotion" : "neutral"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为conversation.item.input_audio_transcription.text。 item_id string 消息项唯一标识符。 content_index integer 目前固定为 0。 text string 已确认的识别文本。 stash string 待确认的识别文本(可能会被后续事件修正)。 language string 检测到的源语种。 emotion string 被识别音频的情感。支持的情感如下: surprised:惊讶neutral:平静happy:愉快sad:悲伤disgusted:厌恶angry:愤怒fearful:恐惧
当配置了input_audio_transcription.model参数时,语音识别完成后服务端会返回此事件,包含最终的完整识别结果。
{
"event_id" : "event_xxx" ,
"type" : "conversation.item.input_audio_transcription.completed" ,
"item_id" : "item_xxx" ,
"content_index" : 0 ,
"transcript" : "今天天气真好,我们一起去公园散步吧。" ,
"language" : "zh" ,
"emotion" : ""
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为conversation.item.input_audio_transcription.completed。 item_id string 消息项唯一标识符。 content_index integer 目前固定为 0。 transcript string 完整的语音识别结果(源语言原文)。 language string 检测到的源语种。 emotion string 被识别音频的情感。支持的情感如下: surprised:惊讶neutral:平静happy:愉快sad:悲伤disgusted:厌恶angry:愤怒fearful:恐惧
当输入了音频但识别失败时,服务端发送该事件。与其他error事件分开处理,便于客户端识别相关的具体项目。
{
"event_id" : "event_xxx" ,
"type" : "conversation.item.input_audio_transcription.failed" ,
"item_id" : "item_xxx" ,
"content_index" : 0 ,
"error" : {
"code" : "xxx" ,
"message" : "xxx" ,
"param" : "xxx"
}
}
参数 类型 说明 type string 事件类型,固定为conversation.item.input_audio_transcription.failed。 item_id string 关联的对话项 ID。 content_index integer 包含音频的内容部分的索引。 error.code string 错误代码。 error.message string 错误消息。
response.audio_transcript.delta
适用于 qwen3.8-livetranslate-flash-realtime。输出文本和音频时,返回译文的新增文本片段。
{
"event_id" : "event_example" ,
"type" : "response.audio_transcript.delta" ,
"response_id" : "resp_example" ,
"item_id" : "item_example" ,
"output_index" : 0 ,
"content_index" : 0 ,
"delta" : "Hello"
}
参数 类型 说明 event_id string 事件唯一标识符。 type string response.audio_transcript.delta。response_id string 响应 ID。 item_id string 消息 ID。 output_index integer 输出项索引。 content_index integer 内容片段索引。 delta string 本次新增的文本片段。按接收顺序累加,不覆盖已收到的文本。
response.audio_transcript.text
适用于 qwen3.5-livetranslate-flash-realtime 等模型。 使用 qwen3.8-livetranslate-flash-realtime 时,请处理 response.audio_transcript.delta 事件。
当输出模态包含音频时,服务端可能返回此事件,用于展示实时翻译内容。
{
"event_id" : "event_xxx" ,
"type" : "response.audio_transcript.text" ,
"response_id" : "resp_xxx" ,
"item_id" : "item_xxx" ,
"output_index" : 0 ,
"content_index" : 0 ,
"text" : "Hello," ,
"stash" : " who are you?"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.audio_transcript.text。 response_id string 响应的唯一标识符。 item_id string 消息项唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 text string 已确认无误的翻译文本片段。 stash string 初步翻译的临时文本,与当前 text 拼接后构成临时翻译结果;系统会通过 response.audio_transcript.text 事件持续更新 text 和 stash,直至收到response.audio_transcript.done 事件,此时可通过 transcript 字段获取完整的最终翻译文本。
response.audio_transcript.done
当输出模态包含音频,且模型生成文本结束时,服务端返回此事件。
{
"event_id" : "event_VN4Q4GJugLcc1S23viW8E" ,
"type" : "response.audio_transcript.done" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"item_id" : "item_JvJauNH2CTXb1D9WV6pD4" ,
"output_index" : 0 ,
"content_index" : 0 ,
"transcript" : "How can I assist you today?"
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.audio_transcript.done。 response_id string 响应的唯一标识符。 item_id string 消息项唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 transcript string 完整文本。
response.output_item.added
在响应生成过程中创建新输出项时,服务端返回此事件。
{
"event_id" : "event_B4O5yPt3Gjnjy5eYH3plG" ,
"type" : "response.output_item.added" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"output_index" : 0 ,
"item" : {
"id" : "item_OFaPGtzfWCPyGzxnuEX9i" ,
"object" : "realtime.item" ,
"type" : "message" ,
"status" : "in_progress" ,
"role" : "assistant" ,
"content" : []
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.output_item.added。 response_id string 响应的唯一标识符。 output_index integer 目前固定为 0。 item object 输出项信息。 item.id string 输出项的唯一标识符。 item.type string 固定为 message。 item.object string 始终为 realtime.item 。 item.status string 输出项的状态。 item.role string 消息的角色。 item.content string 消息的内容。
response.output_item.done
当新的项输出完成时,服务端返回此事件。
{
"event_id" : "event_XkiwbYTBC9Wcdwy6uYJ2G" ,
"type" : "response.output_item.done" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"output_index" : 0 ,
"item" : {
"id" : "item_JvJauNH2CTXb1D9WV6pD4" ,
"object" : "realtime.item" ,
"type" : "message" ,
"status" : "completed" ,
"role" : "assistant" ,
"content" : [
{
"type" : "audio" ,
"text" : "你好,我是阿里云研发的大规模语言模型,我叫千问。有什么我可以帮助你的吗?"
}
]
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.output_item.done。 response_id string 响应的唯一标识符。 output_index integer 目前固定为 0。 item object 输出项信息。 item.id string 输出项的唯一标识符。 item.object string 始终为 realtime.item 。 item.type string 固定为 message。 item.status string 输出项的状态。 item.role string 发送消息的角色。 item.content string 消息的内容。
response.content_part.added
当新的内容部分输出时,服务端返回此事件。
{
"event_id" : "event_J2UixwYKZsXg7c9YXZetL" ,
"type" : "response.content_part.added" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"item_id" : "item_OFaPGtzfWCPyGzxnuEX9i" ,
"output_index" : 0 ,
"content_index" : 0 ,
"part" : {
"type" : "audio" ,
"text" : ""
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.content_part.added。 response_id string 响应的唯一标识符。 item_id string 消息项唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 part object 输出项信息。 part.type string 内容部分的类型。 part.text string 内容部分的文本。
response.content_part.done
当新的内容部分输出完成时,服务端返回此事件。
{
"event_id" : "event_VN4Q4GJugLcc1S23viW8E" ,
"type" : "response.content_part.done" ,
"response_id" : "resp_P79OOMs8LnrXVpiIHUCKR" ,
"item_id" : "item_JvJauNH2CTXb1D9WV6pD4" ,
"output_index" : 0 ,
"content_index" : 0 ,
"part" : {
"type" : "audio" ,
"text" : "你好,我是阿里云研发的大规模语言模型,我叫千问。有什么我可以帮助你的吗?"
}
}
参数 类型 说明 event_id string 本次事件唯一标识符。 type string 事件类型,固定为response.content_part.done。 response_id string 响应的唯一标识符。 item_id string 消息项唯一标识符。 output_index integer 目前固定为 0。 content_index integer 目前固定为 0。 part object 输出项信息。 part.type string 内容部分的类型。 part.text string 内容部分的文本。
音视频翻译-通义千问 API 参考
本文介绍通过 OpenAI 兼容接口调用 qwen3-livetranslate-flash 模型的输入与输出参数。