摘要:8月13日,阿里正式开源Qwen3.8-2.4T-A95B模型权重,总参数2.4万亿、激活950亿,性能对标Anthropic Fable 5,推理成本仅为行业1/8。本文解析技术规格、性能数据与开源战略逻辑。
8月13日,阿里云“魔搭ModelScope社区”深夜发了一条消息:Qwen3.8-2.4T-A95B模型权重正式开放。
下载链接挂在ModelScope和Hugging Face上,谁都能下。
这不是一次普通的模型更新。这是Qwen-Max级别模型第一次开源权重。以前Max系列只有API,想用可以,掏钱。现在权重直接摆出来了。
2.4万亿参数,只激活950亿
Qwen3.8-2.4T-A95B总参数2.4万亿,采用稀疏混合专家架构。每个MoE层包含512个专家,每个Token选择10个路由专家,同时激活1个共享专家。单次推理只激活约950亿参数。
翻译一下:脑容量是2.4万亿的规模,但每次干活只调动950亿,剩下的暂时休眠。MoE架构干的就是这件事——把算力花在刀刃上。
原生支持262,144 Token上下文,可扩展至100万Token。100万Token什么概念?三体三部曲加起来大约90万字,折合下来差不多就是这个量级。一次性扔一整部小说进去,模型能从头读到尾。
模型延续了Qwen3.5的混合架构,重点提升编程、办公、科研和长周期Agent任务的端到端完成能力。
比肩Fable 5,不是说说而已
官方公布的评测覆盖编程Agent、通用Agent、专业工作和长上下文等方向。
具体数字:PaperBench得分93.0,Anthropic Fable 5是88.8。OSWorld-Verified得分86.1,Fable 5是85.0。AndroidWorld得分85.3。
也有不如的地方。SWE-bench Pro测试中,Qwen3.8-Max拿67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。
整体来看,各项结果互有高低。在Arena文本模型排行榜上,Qwen3.8-Max排名全球第二,仅次于Fable 5。
“比肩”这个词用得不算夸张——不是全面超越,是各有所长,整体在同一梯队。
成本是真正的杀手锏
性能对标Fable 5,价格呢?
Qwen3.8-Max API定价:每百万输入Token 2美元,每百万输出Token 6美元。国内价格是每百万输入12元、输出36元。
Fable 5的行业成本约50美元。6美元对50美元——阿里的推理成本差不多是行业的八分之一。
单次对话差几美元确实不明显。但如果你的业务每天调用百万级Token,这个差距就是真金白银。尤其当AI从单轮对话走向长周期Agent闭环时,反复调用工具、输出长程代码、不断试错——边际成本差直接决定了商业模型能不能跑通。
为什么突然开源Max
阿里Qwen系列2023年推出至今,开源模型不少,但Max系列一直是闭源旗舰,只支持API调用。
这次态度转弯,直接原因是DeepSeek。DeepSeek V4 Flash靠性能和低价引爆大规模调用之后,行业看清楚了一件事:开源+低成本能独立切出一块市场。
与其死守闭源API利润,不如开源抢生态。开源能降低采用门槛、扩大海外覆盖、促进跨多云和异构硬件部署。有能力的开源替代方案一旦出现,闭源模型就很难维持高API定价。
阿里同步开源的还有Qwen3.8-27B,一个更小、硬件门槛更低的版本。一边用Max冲击能力上限,一边用小模型铺开发者生态。
算力是阿里的底牌
成本能压到六分之一,光靠MoE架构和混合注意力机制不够。阿里手里还有一张牌——平头哥的自研芯片。
从AI芯片到CPU、网卡、存储主控,阿里自己控盘。7月,阿里云宣布灵骏真武M890超节点实例成功适配Qwen3.8,是国内首个能跑通超2万亿参数大模型的超节点。通过芯片、云平台与模型的全链路优化,Agentic推理场景中最多可实现1.5倍性能提升。
这是DeepSeek这类纯算法团队的短板。DeepSeek V4 Flash近期因访问量过大出现容量不足,报错频发。算法再强,算力基础设施跟不上,一样会卡脖子。
如果说DeepSeek代表了算法优化在极致成本控制上的极限,那阿里这次Qwen3.8-Max开源,代表的是国产模型在全场景应用与Agent生态上的突破。
Qwen3.8曾连续运行约16天,从零构建了一个名为oh-my-cli的开源项目,全程无人干预。自主编程不是Demo,是真实可用的框架,完整过程公开保存在GitHub上。
一个2.4万亿参数的模型,性能对标全球最强闭源模型,推理成本只有对手的八分之一,还把权重免费开放了。
这件事放在两年前,没人敢信。



