摘要:8月5日,蚂蚁百灵开源Ling-3.0-flash原生混合推理模型。124B总参数、5.1B激活,在34项评测中15项第一,综合均分追平DeepSeek-V4-Flash。输出速度353 tokens/s,单次任务成本0.27元。同步支持昇腾0 Day适配与MIT开源协议。
8月5日,蚂蚁集团旗下百灵大模型正式开源新一代原生混合推理模型Ling-3.0-flash。124B总参数、5.1B激活参数,输出速度353 tokens/s,单次任务调用成本约0.27元。这款模型真正让人在意的不是参数数字本身,而是它用不到旗舰模型十分之一的算力,打出了旗舰级的表现。
“以小博大”:124B对标1T的底层逻辑
Ling-3.0-flash的总参数约为上一代旗舰Ring-2.6-1T的12.4%,激活参数仅为后者的8.1%。蚂蚁在34个评测维度中拿下了15个第一、19个第二,综合均分与DeepSeek-V4-Flash并列第一,领先万亿级旗舰Ring-2.6-1T近8分。
蚂蚁给它的定位不是“万能模型”,而是Agent工作流里的“高速执行节点”。在大模型应用从“单次问答”走向“多轮智能体协作”的当下,推理成本已经成为比模型能力更现实的约束。Ling-3.0-flash的设计逻辑是让模型在“足够强”的前提下,把“快、省、可落地”做到极致。
架构:混合注意力+1/64稀疏MoE
Ling-3.0-flash从预训练阶段就采用5:1比例交替堆叠KDA线性注意力层与MLA层。KDA在Delta Rule的状态更新中引入了细粒度对角门控,在处理长文档和大型代码库时能更精准地记住跨段落关键信息。每个Token的专家激活比例从前代的1/32进一步压缩至1/64。用蚂蚁自己的话说,追求的不是规模堆砌,而是“对每一寸算力与状态的高效压榨”。
性能验证:Artificial Analysis双优区域
在Artificial Analysis Intelligence Index中,Ling-3.0-flash得分38,较上一代Ling 2.6 Flash提升了24分。输出速度达到353 tokens/s。在“智能水平—任务成本”和“智能水平—任务耗时”两个维度上都进入了优势区域——每项任务的加权平均调用成本约0.04美元(约0.27元人民币),加权平均解码时间约1.4分钟。
开源与落地:三种部署方式
Ling-3.0-flash采用了MIT许可证,BF16原版和FP8量化版已同步上线Hugging Face和ModelScope。官方提供了三种落地选择:
API调用:最快接入方式,适合快速验证产品和上线Agent应用
单机私有化:MXFP4与INT4版本可在单台NVIDIA DGX Spark上完成端到端推理
高性能部署:在指定GPU配置下平均输出速率突破1100 tokens/s
模型支持25.6万Token上下文窗口,并已接入SGLang HiCache + Mooncake分级缓存架构,长输入场景下首字响应时间较从头计算降低60%至80%以上。
昇腾0 Day适配:国产算力同步跟上
Ling-3.0-flash开源的同步,华为昇腾完成了0 Day适配。在适配过程中,昇腾首次引入了CANN PyPTO算子编程框架,可大幅缩短复杂融合算子的交付周期。适配全面兼容昇腾A2、A3系列产品。一个国产模型在开源当天就能在国产芯片上跑起来——这件事本身,比任何榜单分数都更能说明问题。
当大模型竞赛从“谁能堆出更大参数”转向“谁能在有限算力下输出更高智能密度”,Ling-3.0-flash用124B总参数和0.27元的单次调用成本,给行业提供了一个新的参照系。



