跳转到主要内容
更新日志

模型发布记录

模型发布与更新记录

部分历史模型将于近期下线,请查看模型下线机制说明了解下线时间表与替代模型;模型升级、版本切换、更新及调价等变更公告,请查看模型升级与变更公告了解详情。
2026年9月24日

decision-model-preview

面向高频业务判断的结构化决策模型,可根据文本或业务状态并行完成分类、是非判断与评分,并返回概率分布和置信度,适用于工单分流、内容审核、智能体路由与结果校验等场景。
2026年9月21日

qwen3.8-omni-flash-realtime

Qwen3.8-Omni-Flash-Realtime 支持实时音视频交互及文本、音频输出,新增多通道音频、视频聚合和远程 MCP 工具调用,支持 WebSocket、WebRTC 和 AOQ 接入。详见实时音视频理解。

ZHIPU/GLM-5.3-FlashX

GLM-5.3-FlashX 是 GLM-5 系列的高速模型,推理速度达 200 tokens/s,提供更快、更流畅的模型体验。支持 1M 上下文与 128K 输出,原生支持图像、视频与文件输入。API 参考

stepfun/step-5-preview

Step 5 Preview 是面向真实世界 Agentic 任务的旗舰基座模型,在 AI 编程、软件工程、专业知识工作等任务上达到前沿水平,金融领域表现尤为突出。采用稀疏 MoE 架构(600B 总参数,27B 激活参数),支持 1M Token 上下文窗口和视觉输入。详见 Stepfun-阶跃星辰。

vanchin/deepseek-v4.1-flash

DeepSeek-V4.1-Flash 是 DeepSeek 全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力,支持 1M 上下文与 384K 输出。全新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大,并可扩展到更大参数模型。
2026年9月20日

qwen-audio-3.1-realtime-plus

Qwen-Audio-3.1-Realtime-Plus 支持实时双工语音对话,沿用 3.0 Plus 的接入协议,保留原有音色并新增 8 个系统音色。上下文长度为 262,144 Token,支持 Function Calling、联网搜索及声音复刻。详见实时语音对话(Qwen-Audio-Realtime)。
2026年9月18日

happyoyster-1.0-adventure

HappyOyster Adventure 是实时交互、可探索的开放式世界模型,基于多模态(文本/图像)输入生成世界场景,通过实时交互、移动和镜头控制实现沉浸式无边界探索。适用于可玩世界、游戏、教育模拟和虚拟导游等场景。详见 世界模型。

qwen3.8-omni-flash

Qwen 新一代原生全模态模型,支持 1M 长序列,可直接输入文本、图像、音频与视频,基于 Qwen3.8-Flash-Next 架构。模型面向真实生产力场景中的 Agent 能力:在具备编程、文本知识工作、GUI 操作等 Agentic 能力的同时,在以音视频为核心的 Agentic 应用(例如视频剪辑、音乐视频创作、影视制作与解说、音视频到图文摘要、音视频对话等需要综合处理文本、图像、音频和视频的工作流)上取得了显著效果。支持 2 通道与 4 通道空间音频解析,兼容 DashScope 与 OpenAI 协议,建议安装配套的 Qwen-MM-Plugins,便于 Agent 框架接入原生多模态能力。详见全模态。
2026年9月17日

qwen3.8-livetranslate-flash-realtime

Qwen3.8-LiveTranslate-Flash-Realtime 是多语言实时音视频同传模型,支持音频和图像输入、文本和音频输出,可识别 60 种源语言,并支持 29 种语言的语音输出。相较 qwen3.5-livetranslate-flash-realtime,端到端时延降至约 2.3 秒,新增实时说话人分离,ASR 转写默认开启。通过 WebSocket Realtime API 调用,使用 session.output_modalities 配置输出模态。详见实时音视频翻译。
2026年9月16日

qwen-mt-uni

Qwen-MT-Uni 一次调用即可完成文本、文档(PDF/Word/PPT/Excel/HTML/Markdown/TXT)、图片、音频的翻译;服务端自动识别输入模态并进行版面还原、语音克隆等处理,输出翻译后的文本或文件下载链接。支持同步与异步两种调用方式,适用于跨模态大规模翻译场景。详见多模态翻译。
2026年9月15日

glm-5.3

GLM-5.3 是智谱最新旗舰大语言模型,编程与智能体能力全面进阶,达开源模型 SOTA 水平,内部编程基准较上代提升 50%,可端到端交付生产级成果。涌现网络安全能力,漏洞发现基准 CyberGym 创当前最佳。支持 1M 上下文、128K 输出与三档深度思考,胜任长程复杂任务。详见 GLM-千问AI平台。
2026年9月13日

deepseek-v4.1-flash

DeepSeek-V4.1-Flash 是 DeepSeek 全新架构系列中的轻量旗舰模型,以 552B 总参数 MoE 实现越级智能,在多项基准上超越包括 DeepSeek-V4-Pro 在内的主流旗舰模型。采用 Causal Encoder-Decoder 非对称架构,输入激活仅 8B、输出激活 16B,并具备原生多模态视觉理解能力。KV Cache 压缩至上一代 HBM 的 1/4、SSD 的 1/8,显著降低长上下文与 Agent 任务成本。支持 1M 上下文与 384K 最大输出,兼顾高吞吐、低延迟与极致性价比。详见 DeepSeek。
2026年9月2日

qwen3.8-max-0902

Qwen3.8-Max-0902(别名qwen3.8-max-2026-09-02)是qwen3.8-max的快照版本。编码深度再突破,可驾驭更复杂的工程级项目与长程自主开发;协作智能体能力显著增强,在多工具调度与端到端交付中表现更从容;视觉理解全面精进,图表推理、文档解析与多模态感知更敏锐准确。延续 100 万上下文、思考模式与完整工具生态,在更高智能水平上持续进化。详见文本生成模型。
2026年9月1日

qwen3.7-text-rerank

基于Qwen3.7底座训练的多语言通用文本重排序模型。相较qwen3-rerank,在通用与Web检索、代码检索、指令遵循、Agentic与Memory检索等方面大幅提升;在MTEB、websearch等评测任务上均取得更优效果,其中websearch相对提升约35%。详见重排序。

qwen3.7-text-embedding-flash

基于Qwen3.7训练的轻量级多语言文本向量模型,面向成本和吞吐敏感场景。相较text-embedding-v4,在多语言覆盖(100到201种)、长文本处理(32K到128K)和Sparse Embedding等能力上大幅升级;在语义、跨语言及代码检索评测上整体效果基本持平,其中AIRBench-zh提升约3%。详见文本与多模态向量化。
2026年8月31日

ZHIPU/GLM-5.3-Flash

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B,采用稀疏注意力与线性注意力混合架构,以更低成本提供超越 GLM-5.2 的智能水平。支持 1M 上下文与 128K 输出,原生支持图像、视频与文件输入,可在代码、浏览器与图形界面之间协同完成任务。API 参考
2026年8月28日

qwen-mt-image-2.0

专注做图片翻译的模型服务,能将中、英、日等55个语言的图片翻译到指定的语言,精准还原图片排版和内容信息,支持术语定义、敏感词过滤、商品主体检测等自定义功能,提供灵活、准确、高效的图像本地化服务。API 参考
2026年8月27日

kling/kling-v3-turbo-video-generation

可灵V3 Turbo极速视频生成模型,固定音画同出,支持文生视频、图生视频(首帧)及多镜头生成。API 参考
2026年8月26日

qwen3.8-flash

Qwen3.8-Flash 是通义千问最新推出的多模态大模型,兼具强大的理解与生成能力和出色的响应速度。模型原生支持百万级上下文窗口,能够一次性处理超长文档、代码仓库和复杂对话。在编程辅助、智能体协作、图文理解等场景中表现尤为出色——无论是自动修复代码、操作桌面应用,还是分析图表与长视频,都能给出准确、高质量的结果。同时兼容 OpenAI 与 Anthropic 主流接口协议,可无缝接入 Claude Code、Codex 等开发者工具,轻松构建高并发应用与智能工作流。凭借优异的性能与极具竞争力的推理成本,Qwen3.8-Flash 是开发者和企业在 AI 应用中兼顾效果与效率的理想选择。详见文本生成模型。
2026年8月24日

wan3.0-video 公开发布

万相3.0 是 All-in-One 视频生成模型,统一支持文生视频、图生视频(首帧/首尾帧)和参考生视频等多种用法,支持有声视频、声音开关、智能时长、自适应长宽比等能力。8月6日邀测上架,现正式公开发布。API 参考

wan3.0-video-prime

Wan3.0-Video-Prime 是万相3.0 的高速版视频生成模型,具备与 wan3.0-video 相同的全能参考能力,生成速度更快。API 参考

MiniMax/MiniMax-H3

MiniMax-H3 视频生成模型现已上线。支持文生视频、图生视频(首帧/尾帧/首尾帧)和多模态参考生视频。支持 768P 和 2K 分辨率,视频时长 4-15 秒。API 参考

vidu/vidu-image-pro_reference2image、vidu/vidu-image-lite_reference2image

Vidu 图像生成系列新增 Pro 和 Lite 两个模型,支持文生图、参考图生图和图片编辑。API 参考
2026年8月20日

kimi-k3

Kimi 迄今能力最强的旗舰模型,始终进行推理并采用保留式思考(仅思考模式)。支持文本与图像输入(暂不支持视频输入),支持 Function Calling、结构化输出、上下文缓存以及动态加载工具,上下文窗口达 100 万 token。详见 Kimi。
2026年8月19日

qwen3.8-27b

Qwen3.8 系列 27B 原生视觉语言 Dense 模型,模型效果相较 qwen3.6-27b 重点提升了文本和视觉模态下的编程与办公场景能力,能更可靠地端到端完成复杂任务,输出值得信赖的成果。详见文本生成模型。

ZHIPU/GLM-5.3

智谱(ZHIPU AI)直供的 GLM-5.3 模型现已上线。GLM-5.3是智谱迄今编程能力最强的模型,在内部自建体感评测中较GLM-5.2提升50%;网络安全能力:在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5,展现出面向网络安全防御场景的强大潜力。用户指南
2026年8月13日

deepseek-v4-pro-0813

旗舰级 MoE 大模型,总参1.6T、激活 49B,原生支持百万级超长上下文。依托海量高质量训练数据,具备顶尖数学逻辑、复杂推理、专业代码与长文本深度解析能力,适配高阶科研、复杂办公、深度智能代理等高难度场景。支持流式输出、深度思考、Function Calling、结构化输出、联网搜索与上下文缓存。详见 DeepSeek。

qwen3.8-2.4t-a95b

Qwen3.8-2.4T-A95B 是通义千问最新旗舰系列的开源版本,采用稀疏 MoE 架构,总参数 2.4 万亿,每步激活约 950 亿,配合混合注意力机制,支持 100 万 Token 上下文。模型默认开启思考模式,在编程、办公、科研和长周期 Agent 任务上实现显著提升。详见文本生成模型。

pixverse/pixverse-v6-r2v-omni

V6-R2V-Omni 是 PixVerse 推出的融合参考生视频模型,支持图片+视频混合参考输入,智能融合多主体和动作信息,生成高质量视频。支持多种分辨率和宽高比输出。API 参考
2026年8月6日

wan3.0-video

万相3.0全能参考视频生成模型(All-in-One),邀测上架(已转公开发布),统一支持文生视频、图生视频(首帧/首尾帧)和参考生视频等多种用法。API 参考
2026年8月4日

qwen-image-3.0-pro、qwen-image-3.0

Qwen-Image-3.0-Pro 系列模型,支持长文本输入与图中图密集排版,能够一次性精准生成报纸、分镜、菜单及试卷等复杂版面;具备 10 像素小字精准渲染能力,生动还原微表情、毛孔与发丝等摄影级细节,并支持 12 国语言、多种字体及主流网页、游戏界面的高保真仿真。qwen-image-3.0 为标准版,兼顾质量与速度。详见千问-文生图、千问-图像编辑。
2026年8月3日

qwen3.8-max

Qwen3.8 原生视觉语言系列 Max 模型,是通义千问迄今能力最强的旗舰模型,拥有 2.4 万亿参数,采用 MoE 架构,展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果相较 3.7 系列显著提升。支持混合思考模式(默认开启),1M 上下文。详见文本生成模型。
2026年8月1日

deepseek-v4-flash-0731

高效轻量化MoE模型,总参284B,激活13B,原生支持百万超长上下文能力。推理速度快、延迟低、调用成本低廉,综合能力均衡,主打高并发、轻量化任务,适合日常对话、内容创作、基础 RAG、批量文案处理等普惠刚需场景。该版本对应深度求索正式发布的 DeepSeek-V4-Flash(2026年7月31日版本),为当前推荐使用的稳定版本。详见 DeepSeek。
2026年7月30日

Qwen-Audio-3.0-ASR-Flash 系列语音识别模型

新增 Qwen-Audio-3.0-ASR-Flash-Streaming(实时)、Qwen-Audio-3.0-ASR-Flash-Filetrans(非实时)和 Qwen-Audio-3.0-ASR-Flash(非实时)系列模型:方言支持覆盖汉语七大方言(官话/吴/湘/赣/客/闽/粤)及 20+ 地区口音;古诗词识别优化,适用于文化教育、有声读物等场景;标点预测与文本归一化增强,数字/日期/金额自动转标准格式;支持中、英、日、韩等共 30 个语种;支持热词(预编译热词和即时热词)与 context 上下文,提升特定词汇识别准确率。详见语音识别模型。
2026年7月25日

qwen3.7-flash、qwen3.7-flash-2026-07-15

Qwen3.7 原生视觉语言系列 Flash 模型,相较 qwen3.6-flash 全面提升多模态理解与 Agent 执行能力。重点强化多模态基础能力,万物识别能力更强,真实世界感知与空间智能进一步提升;Search Agent、CI Agent 等多模态 Agent 场景能力显著升级,端到端任务执行更稳定;多模态 Coding 能力优化,vibe coding 体验更加流畅。
2026年7月16日

pixverse/pixverse-lipsync

爱诗 PixVerse 视频对口型模型,支持输入视频和音频(或 TTS 文本),生成与音频同步的对口型视频。API 参考

pixverse/pixverse-motioncontrol

爱诗 PixVerse 视频动作模仿模型,支持输入人物图片和动作参考视频,将视频中的动作迁移到目标角色上,生成角色复现相同动作的新视频。API 参考

pixverse/pixverse-upscale

爱诗 PixVerse 视频超清模型,支持将输入视频进行超分辨率处理,固定输出 4K(3840×2160)分辨率视频。API 参考
2026年7月15日

qwen3.7-text-embedding

Qwen3.7 多语言文本统一向量模型,相较 text-embedding-v4 在文本检索、聚类、分类性能大幅提升,MTEB 多语言、中英、Code 检索等评测效果提升 20%;支持 256~2560 维用户自定义向量维度。详见文本与多模态向量化。
2026年7月14日

qwen-plus-character

千问系列角色扮演模型,适合拟人化的角色扮演,同时优化了限定人设指令遵循、话题推进、倾听共情等能力,支持个性化角色的深度还原。角色扮演(Qwen-Character)

qwen-audio-3.0-realtime-plus、qwen-audio-3.0-realtime-flash

Qwen-Audio端到端实时语音大模型兼顾语音推理能力与双工对话节奏,在保持流畅、自然的实时交互体验的同时,通过并行推理、全向流式等工程优化,有效控制端到端响应时延。实时语音对话(Qwen-Audio-Realtime)

qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash

Qwen-Audio-TTS语音合成模型上线,新增更多小语种和中文方言支持,增强了指令遵循与细粒度标签控制能力,音质和表现力全面提升。其中 Plus 版本面向高品质专业场景,Flash 版本面向低延迟实时交互场景,首包延时控制在 200ms 以内。实时语音合成
2026年7月13日

Vidu 图像生成系列

由生数科技提供的 Vidu 系列图片生成 API 服务,支持文生图、参考图生图和图片编辑,对中英文字精准渲染、UI/图表等设计细节像素级还原。可用模型:vidu/vidu-image_reference2image、vidu/viduq3-fast_reference2image、vidu/viduq2-pro_reference2image、vidu/viduq2-fast_reference2image。API 参考

vidu/viduq3-pro-fast_img2video

Vidu 图生视频旗舰极速版,最高支持 1080P,最长 16 秒。API 参考

vidu/viduq3-ad_reference2video

Vidu 参考生视频广告版,面向广告行业,支持营销级智能切镜、运镜和音效直出。API 参考

vidu/viduq3-drama_reference2video

Vidu 参考生视频精品剧版,角色一致性强、动效细腻、情绪表达真实,适合剧情向内容生产。API 参考
2026年7月1日

wan2.7-t2v-2026-06-12

万相2.7文生视频模型快照版本,模型能力与 wan2.7-t2v 一致。详见万相2.7-文生视频。

wan2.7-r2v-2026-06-12

万相2.7参考生视频模型快照版本,支持主体参考和音色定制,并可输入单张多宫格故事板直接生成剧本化视频。详见万相2.7-参考生视频。
2026年6月25日

qwen-image-2.0-pro-2026-06-22

Qwen-Image-2.0 系列模型最新快照,融合图片生成与编辑能力。相较于 4 月 22 日快照,文字渲染能力进一步增强,支持最长 1k token 的指令输入;真实质感与写实场景细节刻画更加细腻;语义遵循能力更强。详见千问-文生图、千问-图像编辑。
2026年6月22日

happyhorse-1.1-t2v

HappyHorse 1.1 文生视频模型。支持生成带音频的 3-15 秒视频,分辨率 720P/1080P。API 参考

happyhorse-1.1-i2v

HappyHorse 1.1 图生视频模型。支持生成带音频的 3-15 秒视频,分辨率 720P/1080P。API 参考

happyhorse-1.1-r2v

HappyHorse 1.1 参考生视频模型。支持多张参考图像输入,生成带音频的 3-15 秒视频,分辨率 720P/1080P。API 参考

happyhorse-1.0-video-edit

HappyHorse 视频编辑模型,支持对视频进行风格化编辑和增强。API 参考
2026年6月18日

kimi/kimi-k2.7-code-highspeed

月之暗面直供的高速编程模型,与 kimi/kimi-k2.7-code 功能完全一致,速度提升5~6倍。详见 Kimi-月之暗面。
2026年6月17日

glm-5.2

GLM-5.2 是智谱AI推出的面向长程任务(Long Horizon Task)设计的最新旗舰模型,支持 1M 超长上下文。拥有强大逻辑推理、长文本理解与代码生成能力,兼顾性能与推理效率;在多任务基准中表现优异,适用于智能交互、企业应用、开发辅助等场景。支持 OpenAI 兼容、DashScope 及 Anthropic 兼容接口调用。详见 GLM-千问AI平台。

ZHIPU/GLM-5.2

智谱AI直供的 glm-5.2 模型。详见 GLM-智谱。

fun-asr-flash-2026-06-15

百聆2026年6月更新的大模型ASR版本,全面支持汉语传统七大方言体系(官话/吴/湘/赣/客/闽/粤),并适配 20+ 地区口音官话。针对中文古诗词的韵律、节奏与文言表达特点进行专项优化,提升对古诗词内容的识别准确率,适用于文化传承、教育讲解、有声读物等场景。优化标点预测与文本归一化能力,使输出文本更符合书面表达习惯,数字、日期、金额等信息自动转换为标准格式,增强内容的可读性与专业性。同时语种扩展至英语、日语、韩语、越南语、泰语、印尼语、马来语、菲律宾语、印地语、阿拉伯语、法语、德语、西班牙语、葡萄牙语、俄语、意大利语、荷兰语、瑞典语、丹麦语、芬兰语、挪威语、希腊语、波兰语、捷克语、匈牙利语、罗马尼亚、保加利亚语、克罗地亚语、斯洛伐克语等,共计30个语种。支持context上下文能力,可转写5分钟以内的音频。
2026年6月16日

qwen3.5-ocr

千问文字提取模型,基于 Qwen3.5 架构,速度更快,效果更强。上下文长度扩展至 128K,支持多轮对话。信息抽取能力大幅提升,覆盖多种国内外卡证。详见文字提取。
2026年6月15日

kimi-k2.7-code

Kimi 迄今最智能的 Coding 模型(仅思考模式),在长上下文中更可靠地遵循指令,能以更高的成功率完成编程任务。支持文本、图片与视频输入,支持显式缓存与隐式缓存。详见 Kimi。

kimi/kimi-k2.7-code

月之暗面直供的 kimi-k2.7-code 模型。详见 Kimi-月之暗面。
2026年6月10日

qwen3.7-max-2026-06-08

Qwen3.7系列中规模最大、综合能力最强的Max模型,相较于5月20日快照增加了视觉模态理解能力,能够感知真实世界场景,具备多模态交互混合智能体能力。
2026年6月8日

pixverse/pixverse-v6-r2v

爱诗V6-参考生视频模型,参考多张图像生成视频。相较于v5.6全面升级,通用场景推荐使用。支持将一张多宫格分镜拼接图一键转化为视频。详见爱诗-参考生视频。
2026年6月1日

qwen3.7-plus、qwen3.7-plus-2026-05-26

千问3.7Plus系列,在强大文本能力的基础上全面升级了视觉-语言能力,同时保持了在编码、工具使用和生产力工作流方面的完整智能体能力。其核心特色为多模态交互混合智能体能力,能够感知真实世界场景、读取屏幕并操作 GUI、基于视觉参考生成代码、端到端导航移动应用。
2026年5月29日

vanchin/deepseek-v4-pro

由快手万擎直供的 DeepSeek 模型推理服务。详见 DeepSeek-快手万擎。
2026年5月28日

stepfun/step-3.7-flash

阶跃星辰直供的 Step 3.7 Flash 模型,Flash 档位新一代旗舰。在搜索、Agent、编码、多模态四大方向全面升级,深度检索与多模态图搜能力大幅增强,Agent 与工具调用能力显著提升,编码能力在 Flash 档位多项基准中表现优异,多模态理解能力对标头部旗舰。详见 Stepfun-阶跃星辰。
2026年5月25日

qwen3.7-max-preview、qwen3.7-max-2026-05-17

Qwen Max 系列模型快照。仅支持纯文本输入,默认开启思考模式。
2026年5月22日

qwen3.5-livetranslate-flash-realtime

Qwen3.5-LiveTranslate-Flash 的实时版本,一款高精度、高响应、高鲁棒性的多语言实时音视频同传大模型。依托 Qwen3.5-Omni 强大的基座能力,能听懂 60 种语言,会说 29 种语言。详见实时音视频翻译。
2026年5月21日

qwen3.7-max、qwen3.7-max-2026-05-20

Qwen Max 系列新一代旗舰模型。仅支持纯文本输入,默认开启思考模式,支持显式缓存,在编程、办公与生产力、长周期自主执行方面均能出色胜任各项任务。
2026年5月19日

MiMo-V2.5-Pro

小米直供的 MiMo-V2.5-Pro 推理模型,在通用智能体能力、复杂软件工程以及长程任务等方面提升显著。详见 MiMo。

ZHIPU/GLM-5.1、ZHIPU/GLM-5

智谱直供的 GLM-5、GLM-5.1 推理模型,适用于智能交互、企业应用及开发辅助等场景。详见 GLM-智谱。
2026年5月15日

正式上线

千问AI平台正式上线。