跳转到主要内容
Realtime API

概述

Realtime API 提供多种传输协议,针对性能、延迟、弱网对抗、接入成本等不同需求进行优化

Realtime API 提供多种传输协议,针对性能、延迟、弱网对抗、接入成本等不同需求进行优化,供开发者灵活选择。 Realtime API 支持AOQ(AI over QUIC)WebRTCWebSocket三种传输协议,开发者可以根据业务场景灵活选择。
维度AOQWebRTCWebSocket
适用场景AI 多模态实时交互、弱网场景、混合数据传输浏览器端互动、传统音视频通话服务端集成、快速原型验证
浏览器兼容性不支持原生支持原生支持
接入难度中等极低
弱网对抗极致良好
数据类型音视频 + 文本音视频 + 文本文本/音频/图像
建连速度
回声消除/降噪内置内置无,需客户端自行处理
AI 场景适配原生为 AI 多模态数据特征深度定制传统设计,AI 场景需额外适配基础,适合纯文本或低实时性场景
端侧平台支持Android / iOS / HarmonyOS浏览器、移动端全平台(任何支持 WebSocket 的环境)
开发者可根据实际需求选择协议方案:
  • AOQ 方案:适合对延迟、弱网对抗、多模态数据传输有极致要求的 AI 实时交互场景,同时内置回声消除和降噪能力,尤其是移动端原生应用。
  • WebRTC 方案:适合需要浏览器原生支持、已有 WebRTC 基础设施的传统音视频通话场景,内置回声消除和降噪能力。
  • WebSocket 方案:适合服务端集成、快速原型验证、对接入门槛要求极低的场景。通过 DashScope SDK 可快速实现实时语音对话。

模型支持力度

不同协议对模型的支持情况如下:
类型模型AOQWebRTCWebSocket
实时全模态qwen3.5-omni-plus-realtime支持支持支持
实时全模态qwen3.5-omni-flash-realtime支持支持支持
实时语音翻译qwen3.5-livetranslate-flash-realtime支持支持支持
实时语音识别Qwen-Audio-3.0-ASR-Flash-Streaming、Fun-ASR-Realtime系列模型支持不支持支持
实时语音合成CosyVoice系列模型支持不支持支持
实时语音合成qwen-audio-3.0-tts-flash、qwen-audio-3.0-tts-plus支持不支持支持
实时语音对话qwen-audio-3.0-realtime-plus、qwen-audio-3.0-realtime-flash支持支持支持
模型的名称、上下文、价格、快照版本等信息请参见千问AI平台控制台;并发限流条件请参考限流

最佳实践