跳转到主要内容
全模态

全模态模型

为多模态理解、音视频分析、语音对话、内容审核、语音翻译等全模态场景选择模型。

全模态模型能同时理解文本、音频、图像和视频,并输出文本和语音。当前提供三个系列:
系列定位特点
Qwen3.5-Omni旗舰能力最全,支持联网搜索、声音复刻;音频最长 3 小时、视频最长 1 小时
Qwen3-Omni-Flash轻量成本更低,支持思考模式;单次输入限 150 秒
Qwen3.5-Livetranslate专业翻译开箱即用,60 种语言,约 3 秒延迟

按场景选模型

场景推荐模型API文档
实时语音/视频对话 — 通过麦克风和摄像头实时交互(语音助手、智能客服、视觉问答、直播分析)Qwen3.5-Omni RealtimeWebSocket实时音视频理解
实时语音对话(语义 VAD) — 端到端语音交互,无意义附和声不会打断,支持 Function CallingQwen-Audio RealtimeWebSocket实时语音对话
音视频内容分析 — 上传音频或视频文件,分析内容并生成文本或语音回复(视频审核、会议纪要、字幕生成)Qwen3.5-OmniHTTP音视频文件理解
轻量音视频分析 — 成本更低,支持深度推理(思考模式下仅输出文本)Qwen3-Omni-FlashHTTP音视频文件理解
实时语音翻译 — 语音同传,约 3 秒延迟,支持 60 种语言(同声传译、多语言会议)Qwen3.5-LivetranslateWebSocket实时音视频翻译
音视频文件翻译 — 上传音频/视频文件翻译为目标语言(视频配音、播客翻译)Qwen3-LivetranslateHTTP音视频文件翻译
声音复刻 — 提供参考音频,用该音色生成语音回复Qwen3.5-Omni Plus / FlashHTTP、WebSocket音视频文件理解

能力边界

  • Function Calling — 仅 Qwen3-Omni-Flash(HTTP)和 Qwen-Audio Realtime(WebSocket)支持。
  • 联网搜索 — 仅 Qwen3.5-Omni(HTTP 和 WebSocket)支持。联网搜索与 Function Calling 不可同时开启。
  • 思考模式 — 仅 Qwen3-Omni-Flash(HTTP)支持,且思考模式下不输出语音。
  • 旧版模型qwen-omni-turbo 仅支持中文和英语,不再更新,新项目请使用 Qwen3.5-Omni。

从闭源模型迁移到千问AI平台?

闭源模型代表千问AI平台推荐
高能力GPT-5.5、Gemini 3.1 Proqwen3.5-omni-plus
轻量低成本GPT-5.4-mini、Gemini 3.1 Flashqwen3-omni-flash
实时翻译Gemini 3.1 Liveqwen3.5-livetranslate-flash

完整模型列表

各系列的日期版本、能力矩阵与翻译语种支持见语音到语音模型的"推荐模型"、"所有模型"和"翻译"章节。各模型可用的音色见音色列表
如果你只需要"语音输入 → 语音输出",且要在 S2S 单模型与 Pipeline(ASR + LLM + TTS)两种架构之间做选择,请先阅读语音到语音模型

了解更多