7月19日,阿里千问在WAIC 2026期间发布了新一代旗舰基座模型Qwen3.8-Max-Preview。总参数量2.4T,官方定位“全球仅次于Claude Fable 5”。参数够大,口号够响。但“仅次于Fable 5”到底是不是真本事?我们做了实测,发现了不少值得掰开揉碎聊的东西。

一、参数与架构:2.4T MoE,激活参数288B

Qwen3.8-Max-Preview采用MoE架构,总参数量2.4T,激活参数约288B。相比前代Qwen3.7-Max,这是千问系列首个突破万亿参数的原生多模态模型,支持文本、图像、视频、文档的混合输入输出。

标准上下文窗口128K,可拓展至1M token。架构上优化了专家路由分配逻辑,代码、多模态、长文档三类任务可自动分配专属专家模块,降低普通文本推理的算力损耗。

但有一个细节值得注意:预览版发布时,官方没有附带任何benchmark数据、技术文档或模型卡。相比5月发布的Qwen3.7-Max附带完整文档和Artificial Analysis评分56.6,这次的做法显得不太寻常。

阿里自己把这次发布定义为“预览版+日更模式”,承诺模型“将以天为单位持续进化”。翻译成人话就是:后训练还没做完,先放出来让大家试试。

二、实测:基础编码够硬,但Agent能力才是真王牌

我们在Qoder平台上对Qwen3.8-Max-Preview进行了多轮实测。

基础编码:扎实,没翻车。

第一道题是LRU Cache,Python实现,要求O(1)时间复杂度,附带5个测试用例。Qwen3.8选择了哈希表加双向链表的组合,技术选型没问题。代码直接复制到本地就能跑,5个测试用例全部通过。

第二道题是完整Todo应用——前端React+TypeScript,后端Flask,前后端对接完整,再加启动说明。Qwen3.8一次性生成了14个文件:11个前端组件加配置,2个后端文件,1个README。npm install之后前端正常启动,Flask后端也跑起来了,前后端对接没有问题。

前代Qwen3.7系列在HN上被用户评价为“完全不可用”,理由是“偏离轨道、死循环、无法调试”。从3.7到3.8,至少在中等复杂度的全栈项目上,进步是肉眼可见的。

Agent任务:Cowork是真正的长板。

第三道题是官方最引以为傲的Cowork场景:给Qwen3.8一个真实的GitHub仓库链接,让它先分析结构,再找3个bug,最后给出修复方案。

结果令人印象深刻。模型能够自主浏览仓库、理解代码结构、定位问题并给出可执行的修复建议。这是Qwen3.8相比前代最明显的跃升——它不仅能写代码,还能理解已有代码、发现问题、提出方案,形成了一个相对完整的闭环。

3D游戏生成:自己玩一遍再修Bug。

另一个测试是用Three.js做一个“3D漂移赛车”游戏。模型很快就实现了基本功能,但在测试过程中发现车辆行驶到某个赛道时会出现黑屏。

让人意外的是,Qwen3.8竟然会自己启动浏览器,亲自玩一遍游戏,发现问题并修复。这个能力在真实项目开发中非常实用——尤其在遇到没有日志又难以描述的问题时,模型能自主排查和修复,省去了大量人工调试时间。

三、速度与成本:响应快,价格有诚意

实测中一个明显的感受是:响应速度非常快。在Qoder中调用Qwen3.8-Max-Preview,几乎感觉不到明显的等待延迟。

成本方面同样有诚意。预览版正在做限时折扣活动,从7月19日开始:白天常规时段(08:00-22:00)直接打1折,夜间(22:00-08:00)打0.2折。两个长而复杂的任务跑下来,消耗比想象中便宜不少。阿里云Token Plan个人版39元起/月。对于想尝鲜的开发者来说,这个价格门槛几乎可以忽略不计。

四、一个不可忽视的问题:官方数据去哪了?

这是Qwen3.8预览版最让人困惑的地方。

翻遍X推文、GitHub仓库、官方博客、阿里云开发者社区,找不到任何一张benchmark对比图。没有MMLU分数,没有SWE-bench排名,没有Arena Elo,什么都没有。所有的性能描述都是定性的——“综合编码实力远超前代版本”“长周期智能体自治能力大幅强化”“综合实力比肩全球前沿顶级AI模型”——但没有一个是定量的。

整篇文章最精确的数字,是定价。

这让人不得不怀疑:一个号称“仅次于Fable 5”的模型,为什么拿不出任何可验证的数据?是还没来得及跑完评测,还是跑完的结果不够好看?

一个更值得关注的对比:Qwen3.7-Max在5月发布时附带完整文档和Artificial Analysis评分56.6。而这次2.4T的“旗舰”,反而没有任何公开数据。这种反差本身就说明了问题。

五、值不值得用?看场景

综合实测结果,可以给出几个判断:

如果你是需要处理大型代码仓库、做复杂软件工程的开发者,Qwen3.8预览版值得一试。全栈14文件一次跑通、自主分析GitHub仓库并修复bug、自己玩3D游戏再修黑屏——这些能力在目前的模型里确实少见。

如果你是需要长程Agent任务的用户,Cowork场景是Qwen3.8真正的长板。它不只是“回答问题”,而是“执行任务”。

但如果你只是日常对话或简单问答,2.4T的模型对你来说可能有点“大材小用”。而且目前没有公开的benchmark数据支撑它在通用能力上的表现,建议等正式版和第三方评测出来再做判断。

如果你对价格敏感,预览版的折扣力度确实很有吸引力。1折的价格体验2.4T模型,试错成本极低。

结语

Qwen3.8-Max-Preview是一把双刃剑。一方面,实测中基础编码、全栈开发、Agent任务和3D游戏生成的表现确实扎实,响应速度快、成本亲民,证明了2.4T参数不是白堆的。另一方面,官方拿不出任何benchmark数据这件事本身就是一个信号——预览版就是预览版,别把它当正式版用。

阿里承诺正式版将开源权重,届时第三方独立评测会给出真正的答案。在那之前,“仅次于Fable 5”这句话,先打个问号。