大模型竞赛正在进入一个新阶段——比的不再是谁的参数更大,而是谁能在更小的体量里塞进更强的能力。
7月24日,蚂蚁集团旗下百灵大模型正式发布新一代原生混合推理模型Ling-3.0-Flash。总参数量124B,单次计算仅激活5.1B参数——这个体量放在今天的行业里不算大,但它的目标却一点不小:对标甚至超越参数规模达其2至3倍的行业领先模型。
一、124B对1T:一场“以小博大”的技术突围
Ling-3.0-Flash的直接对标对象,是百灵上一代1T级旗舰思考模型Ring-2.6-1T。
数字对比足够直观:总参数124B,仅为Ring-2.6-1T的12.4%;激活参数5.1B,仅为后者的8.1%。参数体量缩小了超过87%,但能力不仅没有缩水,反而实现了全方位对标甚至超越。
据官方公布的对比数据,Ling-3.0-Flash在12项基准测试中有11项超过了Ring-2.6-1T。
实现“小体量、高智能”的关键,在于模型底层计算架构的重新设计。Ling-3.0-Flash放弃了单纯堆砌参数的思路,从预训练阶段即采用原生混合线性注意力架构。具体来说,它以5:1的比例交替堆叠KDA线性注意力层与MLA层,并在Delta Rule的状态更新中引入细粒度对角门控,让模型在处理长文档和代码库时能更精准地记住关键信息。
同时,每个Token的专家激活比例从前代的1/32进一步压缩至1/64,带来了更高的“效率杠杆”。模型原生支持256K上下文窗口,并可无缝扩展至1M Token。
二、专为Agent设计:超10000个训练环境,让AI Agent真正“跑起来”
参数和架构是底层,真正的价值在于上层——Ling-3.0-Flash从一开始就不是为了在Benchmark上刷分而设计的。
蚂蚁集团将其定位为“专为生产级AI智能体工作流设计的新一代原生混合推理基础模型”。这意味着它关注的重点不是“能不能回答问题”,而是“能不能在真实业务场景中稳定交付结果”。
为此,百灵团队将模型的训练扩展到超过10000个可交互训练环境,并优化了复杂任务的自我纠错与长程规划机制。无论是在代码编写、复杂任务拆解,还是多源信息深度调研等场景中,Ling-3.0-Flash均展现出更强的自主闭环交付能力。
在工程配套上,百灵为Ling-3.0-Flash匹配了集群级分级缓存架构(SGLang HiCache + Mooncake),避免了长对话和多轮交互中的重复计算,将长输入下的首字响应延迟(TTFT)降低了60%至80%以上。在多智能体协同方面,升级后的架构允许不同Agent分工协作、相互校验,有效减少了单一模型的误判风险。
三、限时免费一周,随后正式开源
Ling-3.0-Flash已上线OpenRouter和Vercel AI Gateway。即日起至8月3日23:00(北京时间),用户可通过OpenRouter及百灵官方平台免费调用API。免费期结束后,模型权重将正式开源。
这也意味着,Ling-3.0-Flash正在完成一次从“内部自用”到“行业共享”的跨越——先让开发者免费试用验证效果,再开源权重让社区参与共建。
四、行业意义:大模型竞赛进入“智效比”时代
Ling-3.0-Flash的发布,释放了一个清晰的信号:大模型行业的竞争逻辑正在从“参数规模竞赛”转向“智效比竞赛”。
当越来越多企业开始把AI Agent接入真实生产环境,他们关心的不再是“这个模型有多少参数”,而是“跑一次任务要花多少钱、要多快、能不能稳定跑完”。Ling-3.0-Flash用124B总参数、5.1B激活参数的体量,实现了对万亿级旗舰的性能越级——这条路如果走通了,意味着“小模型干大事”不再是理想,而是可复制的工程现实。
蚂蚁百灵用一款“小体量、高智能”的模型,给出了自己的答案:大模型的未来,不在参数里,在效率里。



