8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max。总参数量达到2.4万亿,采用MoE架构,激活参数约95B。这是千问系列中尺寸最大、性能最强的旗舰模型。

官方给出的定位很清晰:专为复杂长程任务、全栈代码工程、专业办公自动化、多模态深度融合四大核心场景设计。从“理解”到“执行”,从“短程交互”到“长程自治”——这是Qwen3.8-Max试图完成的跃迁。

编程能力:从零开始,16天搓出一个自进化智能体

编程能力是前沿大模型的核心指标之一。在权威CodeArena榜单中,Qwen3.8位居全球第四。

更值得关注的是它的自主编程能力。两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手;而如今,Qwen3.8可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人工干预。只需一句“创建一个自进化的智能体Harness”,Qwen3.8就像个资深工程师,从零开始自主搭建循环工程框架,编排智能体自动领取和执行任务。独立编程运行约16天后,它做出了一个Hermes Agent级别的、真实可用的自进化智能体框架“oh-my-cli”,目前已完全开源。

内部真实业务测评显示,较前代Qwen3.7-Max,代码工程能力提升22.8%,全栈代码开发完整性提升40%。

专业办公:数百种高频任务稳定交付生产级成果

Qwen3.8可胜任广泛的真实专业工作任务。面对完全不同的专业任务、评判标准和计算需求,通过真实环境和算力的联合强化学习扩展,实现了数百种高价值、高频专业任务的表现提升。在主流的智能体框架中均可稳定可靠地交付生产级成果。

专业办公能力较前代提升44.4%,复杂多轮智能体任务准确率提升35%,长文本幻觉率降低62%。原生支持100万Token超长上下文窗口,可一次性处理超长篇文档、完整项目代码、数百份企业合同。

多模态与智能体:原生融合,端到端交付

Qwen3.8-Max实现原生多模态深度融合,无需依赖外部模块,即可同步处理文本、图像、视频、文档等全类型数据。区别于“文本+图片简单拼接”的浅层多模态,模型可理解图文视频混合素材的深层逻辑。

在智能体能力方面,Qwen3.8-Max能够以极少的人工介入将复杂、开放的目标端到端完成并交付成果。在科研复现评测PaperBench等编程智能体评测中,较上代大幅提升28.2分,以93.0分录得评测新高。在OSWorld-Verified评测中,以86.1分位居主流模型首位。

定价与开源:比Opus 5便宜60%以上,下周开源

即日起,全球开发者都可通过千问AI平台获得Qwen3.8的API服务。国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元。国际价格仅为Anthropic Opus 5的40%与24%。

千问3.8-MAX模型权重将于下周开源。这是通义千问首次开源Max级模型,同步开源的还有Qwen3.8-27B。模型已接入阿里同步推出的Agent产品“千问办公”。

当行业竞争从基础模型性能转向智能体能力和复杂任务执行效率,Qwen3.8-Max的发布,正在把大模型从“回答问题”推向“交付成果”。