摘要:阶跃星辰发布 StepAudio 3 系列五款语音模型,Realtime 以 98.9% 居全球对话动态榜首;云知声发布 266B MoE 的 U2-Flash,单次仅激活约 10B,编程榜 64.6 超 GLM5.3-Flash。

国内模型这两天不约而同地押注了同一个词:效率。9 月 15 日,阶跃星辰发布新一代语音大模型 StepAudio 3 系列,一次性推出 Realtime、ASR、TTS、Gen、Music 五款模型,均已上线开放平台。官方称 Realtime 在 Artificial Analysis 对话动态榜以 98.9% 居全球第一,语音推理准确率 99.7%;ASR 非流式词错误率 1.7%,并列全球第一;Gen 可一次生成人声、音效、环境音与配乐,Music 支持 ABC 记谱法多轮交互创作。这套组合拳的意图很清楚:用覆盖"听—说—生成—作曲"的全栈语音能力,对标国际语音模型。

08_国产语音模型效率路线.jpg

同一天,云知声发布高密度智能模型 U2-Flash,走的是另一条更"工程化"的路线。它采用稀疏混合专家(MoE)架构,总参数约 266B,但单次推理仅激活约 10B(激活比例不到 4%),首字响应平均 3 秒以内,峰值吞吐最高 300 tokens/s。在 DeepSWE v1.1 编程榜单得 64.6 分,官方称超过 GLM5.3-Flash 与 DeepSeek-V4-Pro-0813;SWE-Bench Pro 61.6 分,较前代提升 10.5 分。模型已完成对主流国产算力平台适配,Agent 任务迭代步数减少 20%–30%,Token 消耗降低 20%–30%。

这两条线合起来的信号很明确:当算力越来越贵、电力越来越紧,"每兆瓦能产出多少有用的 token"开始比跑分更值钱。阶跃用全栈语音抢应用入口,云知声用"266B 总参、10B 激活"证明大模型可以既大又省。对国内开发者来说,这类高密度、低激活的模型更贴合真实的成本约束——毕竟多数团队的瓶颈不是"模型够不够聪明",而是"每次调用烧不烧得起"。在国产算力适配上做足功夫,也让它们比纯云端大模型更容易在信创和私有化场景里落地,这恰恰是 2026 年国内模型竞争的关键分水岭。

一个容易被忽略的细节是,云知声把"Agent 任务迭代步数减少 20%–30%"和"Token 消耗降低 20%–30%"并列作为卖点,说明国产模型的竞争焦点已经从"参数有多大"转向"完成任务要花多少"。这其实是更健康的指标——企业最终为 AI 付费,买的是"把事办成",不是"模型有多重"。阶跃和云知声走的不同路线(全栈语音 vs 高密度通用)也预示国内模型会分化成"垂直能力王"和"性价比底座"两类,前者吃场景,后者吃规模。对开发者选型的建议很直接:做语音交互产品看阶跃,做高并发 Agent 后台看云知声这类高密度模型。