跳转到主要内容
Realtime API

Realtime API简介

Realtime API 支持 WebSocket、WebRTC 和 AOQ 三种传输协议

Realtime API 是一系列针对性能、延迟、抗弱网、对接成本、适配性提供多种对接方式的方法,供客户灵活选择。

概述

Realtime API 支持WebSocketWebRTC和**AOQ(AI over QUIC)**三种传输协议,开发者可以根据业务场景灵活选择。
维度WebSocketWebRTCAOQ
适用场景服务端集成、快速原型验证浏览器端互动、传统音视频通话AI 多模态实时交互、弱网场景、混合数据传输
浏览器兼容性原生支持原生支持不支持
接入难度极低中等
弱网对抗良好极致
数据类型文本/音频/图像音视频 + 文本音视频 + 文本
建连速度
回声消除/降噪无,需客户端自行处理内置内置
AI 场景适配基础,适合纯文本或低实时性场景传统设计,AI 场景需额外适配原生为 AI 多模态数据特征深度定制
端侧平台支持全平台(任何支持 WebSocket 的环境)浏览器、移动端Android / iOS / HarmonyOS
开发者可根据实际需求选择协议方案:
  • WebSocket 方案:适合服务端集成、快速原型验证、对接入门槛要求极低的场景。通过 DashScope SDK 可快速实现实时语音对话。
  • WebRTC 方案:适合需要浏览器原生支持、已有 WebRTC 基础设施的传统音视频通话场景,内置回声消除和降噪能力。
  • AOQ 方案:适合对延迟、弱网对抗、多模态数据传输有极致要求的 AI 实时交互场景,同时内置回声消除和降噪能力,尤其是移动端原生应用。

模型支持力度

不同协议对模型的支持情况如下:
类型模型AOQWebRTCWebSocket
实时全模态qwen3.5-omni-plus-realtime支持支持支持
实时全模态qwen3.5-omni-flash-realtime支持支持支持
实时全模态qwen3.5-livetranslate-flash-realtime支持支持支持
实时语音识别Fun-ASR系列模型不支持不支持支持
实时语音合成CosyVoice系列模型不支持不支持支持
实时语音对话qwen-audio-3.0-realtime-plus、qwen-audio-3.0-realtime-flash不支持不支持支持
模型的名称、上下文、价格、快照版本等信息请参见千问 AI 平台控制台;并发限流条件请参考限流