跳转到主要内容
快速入门

选择模型

根据使用场景选择合适的模型

文本生成

从能力最强到成本最低,按需选择。了解更多

千问模型

三方模型

API 格式与千问模型一致。

图像与视频

理解

分析图片和视频内容,返回文本描述或结构化结果。了解更多

生成

通过文本或图片生成图像与视频,支持编辑、参考与高分辨率输出。了解更多

3D模型生成

文生3D模型或图生3D模型,构建三维资产。

音频与语音

语音合成

将文本转换为自然语音。了解更多

音乐生成

根据提示词或歌词生成音乐。了解更多

语音识别

专业 ASR 与大模型两种方案,按精度与灵活性选择。了解更多

语音转语音

端到端语音对话,无需分别调用 ASR 和 TTS。了解更多

全模态

融合文本、图像、音频、视频等多种模态的理解与生成能力。了解更多

向量与重排序

文本或图文向量化,配合重排序提升检索精度。了解更多

查看所有模型

模型目录

浏览文本、图像、视频、音频和向量模型的完整列表,包含详细规格与定价信息。