跳转到主要内容
语音转语音

语音到语音模型

为'语音输入 → 语音输出'场景(语音对话、语音翻译、同声传译等)选择模型。

本文档面向"语音 → 语音"场景。视觉理解、音视频分析和内容审核等能力见全模态模型;其中视频分析、内容标注等需要推理并输出文本的场景,可参考 Qwen3.8-Omni-Flash。

从闭源模型迁移到千问AI平台?

如果你正在使用 OpenAI Realtime 或 Gemini Live,可参考下表选择千问AI平台对位模型。
闭源模型代表千问AI平台推荐
高能力实时对话OpenAI GPT Realtime、Gemini 3.1 Liveqwen-audio-3.1-realtime-plus
成本敏感对话OpenAI gpt-4o-mini Realtimeqwen-audio-3.0-realtime-flash
实时翻译 / 同传Gemini 3.1 Liveqwen3.8-livetranslate-flash-realtime

S2S 与 Pipeline 对比

构建语音应用有两种方式:
S2SPipeline(ASR + LLM + TTS)
延迟低 — 单模型,流式输出较高 — 需经过 3 个串行环节
音频理解端到端 — 能感知语气、情感并做出相应回应先转文字再处理 — 音频细节丢失
语音定制通过 system prompt 选择预设音色支持声音克隆、声音设计(CosyVoice)
  • 选择 S2S:适用于交互式对话、低延迟、需要感知音频情绪的场景。请继续阅读本页。
  • 选择 Pipeline:适用于需要自定义音色,或希望为每个环节分别选择最佳 ASR、LLM 和 TTS 的场景。
本文档继续介绍 S2S 单模型路线(Omni、Livetranslate)。如选择 Pipeline 路线,分别在以下文档中挑选三个组件:

实时还是文件?

  • 实时(WebSocket)— 适用于实时语音交互场景:语音助手、呼叫中心、同声传译。音频流式输入,语音流式输出。
  • 文件(HTTP)— 适用于可以牺牲延迟换取更好效果的场景:视频配音、播客翻译、离线内容处理。文件模式下还支持 Function Calling、联网搜索、思考模式、视频上下文等附带能力(详见下方"S2S 单模型的附带能力")。

按场景选模型(S2S 单模型路线)

以下场景均针对 S2S 单模型路线。Pipeline 路线请按上述链接分别在 ASR / LLM / TTS 文档中选型。
场景推荐模型API
实时音视频对话qwen3.8-omni-flash-realtimeWebSocket、WebRTC、AOQ
语音助手 / 客服对话qwen-audio-3.1-realtime-plusWebSocket
成本敏感的对话qwen-audio-3.0-realtime-flashWebSocket
同声传译 / 直播翻译qwen3.8-livetranslate-flash-realtimeWebSocket
视频配音 / 播客翻译qwen3-livetranslate-flashChat Completions
语义 VAD 语音助手 / 智能客服(支持 Function Calling)qwen-audio-3.1-realtime-plusWebSocket

S2S 单模型的附带能力

以下介绍语音交互中的工具调用、联网搜索及文本推理能力。

Function calling

根据音视频内容查询知识库、查询日程或触发工作流,可使用 Qwen3.8-Omni-Flash-Realtime(WebSocket / WebRTC / AOQ)、Qwen-Audio Realtime(WebSocket)。

联网搜索

需要检索实时信息并生成语音回复时,实时对话可使用 Qwen3.8-Omni-Flash-Realtime 或 Qwen3.5-Omni-Realtime;文件调用可使用 Qwen3.5-Omni(HTTP,Plus 和 Flash 系列)。模型自主决定是否搜索。Qwen-Audio Realtime 3.0 Plus/Flash 和 3.1 Plus 也支持联网搜索,通过 enable_search 开启,不能与 Function Calling 同时启用。
Qwen3-Omni-Flash 和 Livetranslate 模型不支持此功能。

思考模式

当回答质量比延迟更重要时,使用 Qwen3 Omni(HTTP 模式)。模型在回复前会逐步推理,适用于视频分析、批量打标等场景。Qwen-Audio Realtime 不支持此功能。
思考模式下不支持生成语音。

翻译

以下模型系列均支持语音翻译:
  • Qwen3.8-Livetranslate — 支持 60 种源语言和 29 种语言的语音输出,支持音频与图像输入。详见模型信息。
  • Qwen3.5-Livetranslate — 支持 60 种语言互译,其中 29 种支持音频+文本输出、31 种仅支持文本输出,覆盖中文、英语、法语、德语、俄语、日语、韩语、西班牙语、葡萄牙语、阿拉伯语等主流语种。
  • Qwen3-Livetranslate — 支持 18 种语言 + 5 种中文方言,约 3 秒延迟,开箱即用。文件模式支持输入视频以获得上下文感知的翻译精度。其中 7 种语言仅输出文本(不输出语音)。
  • Qwen3.8-Omni-Flash-Realtime — 支持实时语音翻译,语音生成语种与 Qwen3.5-Omni-Realtime 一致,支持 36 种语种和方言,各音色支持范围见音色列表。
  • Qwen3.5-Omni — 支持 29 种输出语言 + 7 种中文方言。音视频理解能力更强,支持联网搜索。可通过 system prompt 注入术语和领域上下文。支持实时和文件两种模式。
  • Qwen3-Omni-Flash — 支持 11 种输出语言 + 8 种中文方言。可通过 system prompt 注入术语和领域上下文,适用于专业领域翻译。支持实时和文件两种模式。成本更低。
快速上手选 Qwen3.5-Livetranslate(60 种语言,约 3 秒延迟);追求最佳质量和最广语言覆盖选 Qwen3.5-Omni;控制成本选 Qwen3-Omni-Flash。
语言Qwen3.5-LivetranslateQwen3-LivetranslateQwen3.5-OmniQwen3-Omni-Flash
英语✓✓✓✓
中文(普通话)✓✓✓✓
  + 粤语仅文本✓✓✓
  + 四川话✓✓✓✓
  + 上海话✓✓✓✓
  + 北京话✓✓✓✓
  + 天津话✓✓✓✓
  + 南京话——✓✓
  + 陕西话——✓✓
  + 闽南语——✓✓
法语✓✓✓✓
德语✓✓✓✓
俄语✓✓✓✓
意大利语✓✓✓✓
西班牙语✓✓✓✓
葡萄牙语✓✓✓✓
日语✓✓✓✓
韩语✓✓✓✓
阿拉伯语✓仅文本✓—
泰语✓仅文本✓✓
越南语✓仅文本✓—
印尼语✓仅文本✓—
土耳其语✓仅文本✓—
印地语✓仅文本✓—
马来语✓—✓—
荷兰语✓—✓—
乌尔都语✓—✓—
挪威语✓—✓—
瑞典语✓—✓—
丹麦语✓—✓—
希伯来语✓—✓—
芬兰语✓—✓—
波兰语✓—✓—
冰岛语✓—✓—
捷克语✓—✓—
菲律宾语✓—✓—
波斯语✓—✓—
希腊语仅文本仅文本——
南非荷兰语仅文本———
阿斯图里亚斯语仅文本———
白俄罗斯语仅文本———
保加利亚语仅文本———
孟加拉语仅文本———
波斯尼亚语仅文本———
加泰罗尼亚语仅文本———
宿务语仅文本———
爱沙尼亚语仅文本———
加利西亚语仅文本———
古吉拉特语仅文本———
克罗地亚语仅文本———
匈牙利语仅文本———
爪哇语仅文本———
哈萨克语仅文本———
卡纳达语仅文本———
柯尔克孜语仅文本———
拉脱维亚语仅文本———
马其顿语仅文本———
马拉雅拉姆语仅文本———
马拉地语仅文本———
旁遮普语仅文本———
罗马尼亚语仅文本———
斯洛伐克语仅文本———
斯洛文尼亚语仅文本———
斯瓦希里语仅文本———
塔吉克语仅文本———
阿塞拜疆语仅文本———
乌克兰语仅文本———
✓ = 音频 + 文本输出。"仅文本" = 该语言不支持音频输出。Qwen3.5-Livetranslate 共支持 60 种语言(29 种音频+文本,31 种仅文本)。Qwen3.8-Omni-Flash、Qwen3.8-Omni-Flash-Realtime 和 Qwen3.5-Omni 均支持 113 种输入语言/方言。详见完整列表。旧版 qwen-omni-turbo 仅支持中文和英语。

推荐模型

下表列出每个系列的常用入口模型。如需锁定特定日期版本(用于版本回归或稳定性需求),请见下方"所有模型"。
模型API输入Function calling联网搜索思考模式翻译
qwen3.8-omni-flash-realtimeWebSocket、WebRTC、AOQ文本、音频、图像、视频✓✓—29种
qwen3.5-omni-plusHTTP文本、音频、图像、视频—✓—29种
qwen3.5-omni-flashHTTP文本、音频、图像、视频—✓—29种
qwen3-omni-flash-realtimeWebSocket文本、音频、图像、视频———11种
qwen3-omni-flashHTTP文本、音频、图像、视频✓—✓11种
qwen3.8-livetranslate-flash-realtimeWebSocket音频———60种
qwen3.5-livetranslate-flashHTTP音频、视频———18种

所有模型

模型API输入Function calling联网搜索思考模式翻译
qwen-audio-3.1-realtime-plusWebSocket音频、文本支持支持——
qwen-audio-3.0-realtime-plusWebSocket音频、文本支持支持——
qwen-audio-3.0-realtime-flashWebSocket音频、文本支持支持——
模型API输入Function calling联网搜索思考模式
qwen3.8-omni-flash-realtimeWebSocket、WebRTC、AOQ文本、音频、图像、视频✓✓—
多通道音频、文本与音频输出及 MCP 用法见实时多模态语音。
模型API输入Function calling联网搜索思考模式批量
qwen3.5-omni-plus-realtimeWebSocket文本、音频、图像、视频✓✓——
qwen3.5-omni-plus-realtime-2026-03-15WebSocket文本、音频、图像、视频✓✓——
qwen3.5-omni-flash-realtimeWebSocket文本、音频、图像、视频✓✓——
qwen3.5-omni-flash-realtime-2026-03-15WebSocket文本、音频、图像、视频✓✓——
qwen3.5-omni-plusHTTP文本、音频、图像、视频—✓——
qwen3.5-omni-plus-2026-03-15HTTP文本、音频、图像、视频—✓——
qwen3.5-omni-flashHTTP文本、音频、图像、视频—✓——
qwen3.5-omni-flash-2026-03-15HTTP文本、音频、图像、视频—✓——
模型API输入Function calling联网搜索思考模式批量
qwen3-omni-flash-realtimeWebSocket文本、音频、图像、视频————
qwen3-omni-flash-realtime-2025-12-01WebSocket文本、音频、图像、视频————
qwen3-omni-flash-realtime-2025-09-15WebSocket文本、音频、图像、视频————
qwen3-omni-flashHTTP文本、音频、图像、视频✓—✓—
qwen3-omni-flash-2025-12-01HTTP文本、音频、图像、视频✓—✓—
qwen3-omni-flash-2025-09-15HTTP文本、音频、图像、视频✓—✓—
模型API输入语言数
qwen3.8-livetranslate-flash-realtimeWebSocket音频、图片60
模型API输入语言数
qwen3.5-livetranslate-flash-realtimeWebSocket音频60
qwen3.5-livetranslate-flash-realtime-2026-05-19WebSocket音频60
模型API输入语言数
qwen3-livetranslate-flash-realtime(旧版)WebSocket音频18
qwen3-livetranslate-flash-realtime-2025-09-22WebSocket音频18
qwen3-livetranslate-flashHTTP音频、视频18
qwen3-livetranslate-flash-2025-12-01HTTP音频、视频18
以下模型不再更新。新项目的实时音视频对话推荐 Qwen3.8-Omni-Flash-Realtime;离线语音输出可选择 Qwen3.5-Omni。
模型输入API
qwen2.5-omni-7b文本、音频、图像、视频HTTP
qwen-omni-turbo文本、音频、图像、视频HTTP
qwen-omni-turbo-latest文本、音频、图像、视频HTTP
qwen-omni-turbo-2025-03-26文本、音频、图像、视频HTTP
qwen-omni-turbo-2025-01-19文本、音频、图像、视频HTTP
qwen-omni-turbo-realtime文本、音频WebSocket
qwen-omni-turbo-realtime-latest文本、音频WebSocket
qwen-omni-turbo-realtime-2025-05-08文本、音频WebSocket

下一步

选定模型后,参考对应的调用文档:

了解更多