为多模态理解、音视频分析、语音对话、内容审核、语音翻译等全模态场景选择模型。
全模态模型能同时理解文本、音频、图像和视频,并输出文本和语音。当前提供三个系列:
各系列的日期版本、能力矩阵与翻译语种支持见语音到语音模型的"推荐模型"、"所有模型"和"翻译"章节。各模型可用的音色见音色列表。
| 系列 | 定位 | 特点 |
|---|---|---|
| Qwen3.5-Omni | 旗舰 | 能力最全,支持联网搜索、声音复刻;音频最长 3 小时、视频最长 1 小时 |
| Qwen3-Omni-Flash | 轻量 | 成本更低,支持思考模式;单次输入限 150 秒 |
| Qwen3.5-Livetranslate | 专业翻译 | 开箱即用,60 种语言,约 3 秒延迟 |
按场景选模型
| 场景 | 推荐模型 | API | 文档 |
|---|---|---|---|
| 实时语音/视频对话 — 通过麦克风和摄像头实时交互(语音助手、智能客服、视觉问答、直播分析) | Qwen3.5-Omni Realtime | WebSocket | 实时音视频理解 |
| 实时语音对话(语义 VAD) — 端到端语音交互,无意义附和声不会打断,支持 Function Calling | Qwen-Audio Realtime | WebSocket | 实时语音对话 |
| 音视频内容分析 — 上传音频或视频文件,分析内容并生成文本或语音回复(视频审核、会议纪要、字幕生成) | Qwen3.5-Omni | HTTP | 音视频文件理解 |
| 轻量音视频分析 — 成本更低,支持深度推理(思考模式下仅输出文本) | Qwen3-Omni-Flash | HTTP | 音视频文件理解 |
| 实时语音翻译 — 语音同传,约 3 秒延迟,支持 60 种语言(同声传译、多语言会议) | Qwen3.5-Livetranslate | WebSocket | 实时音视频翻译 |
| 音视频文件翻译 — 上传音频/视频文件翻译为目标语言(视频配音、播客翻译) | Qwen3-Livetranslate | HTTP | 音视频文件翻译 |
| 声音复刻 — 提供参考音频,用该音色生成语音回复 | Qwen3.5-Omni Plus / Flash | HTTP、WebSocket | 音视频文件理解 |
能力边界
- Function Calling — 仅 Qwen3-Omni-Flash(HTTP)和 Qwen-Audio Realtime(WebSocket)支持。
- 联网搜索 — 仅 Qwen3.5-Omni(HTTP 和 WebSocket)支持。联网搜索与 Function Calling 不可同时开启。
- 思考模式 — 仅 Qwen3-Omni-Flash(HTTP)支持,且思考模式下不输出语音。
- 旧版模型 —
qwen-omni-turbo仅支持中文和英语,不再更新,新项目请使用 Qwen3.5-Omni。
从闭源模型迁移到千问AI平台?
| 闭源模型代表 | 千问AI平台推荐 | |
|---|---|---|
| 高能力 | GPT-5.5、Gemini 3.1 Pro | qwen3.5-omni-plus |
| 轻量低成本 | GPT-5.4-mini、Gemini 3.1 Flash | qwen3-omni-flash |
| 实时翻译 | Gemini 3.1 Live | qwen3.5-livetranslate-flash |
完整模型列表
各系列的日期版本、能力矩阵与翻译语种支持见语音到语音模型的"推荐模型"、"所有模型"和"翻译"章节。各模型可用的音色见音色列表。
如果你只需要"语音输入 → 语音输出",且要在 S2S 单模型与 Pipeline(ASR + LLM + TTS)两种架构之间做选择,请先阅读语音到语音模型。