8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max。总参数量达到2.4万亿(激活参数95B),采用稀疏MoE架构与混合注意力机制的联合优化。这是千问家族迄今尺寸最大、性能最强的旗舰模型。
在权威第三方榜单Arena中,Qwen模型整体性能仅次于Anthropic的Claude系列,处于全球大模型第一梯队。Vision Arena视觉理解榜单上,Qwen3.8-Max排名全球第二。CodeArena编程榜单中位居全球第四。
编程能力:从“补全代码”到“交付项目”
两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手;而Qwen3.8-Max已经可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人工干预。只需一句“创建一个自进化的智能体Harness”,它就能像资深工程师一样,从零搭建循环工程框架,编排智能体自动领取和执行任务。独立编程运行约16天后,它做出了一个Hermes Agent级别的自进化智能体框架“oh-my-cli”,该项目现已完全开源。
在科研与竞赛场景中,该模型连续自主工作约125小时,成功复现AI Reasoning相关论文并进行四轮自我进化探索。它还在阿里云天池平台举办的WWW2025多模态对话意图识别挑战赛中,于24小时内击败了458支人类参赛队伍。
专业办公:数百种职业场景的提效利器
面对完全不同的专业任务、评判标准和计算需求,Qwen3.8-Max通过真实环境和算力的联合强化学习扩展,实现了数百种高价值、高频专业任务的真实表现提升。
具体案例更具说服力:一支法务助理团队在数百份法律文档中标注千余条相关条款需要一周时间,Qwen3.8-Max一小时内就能完成;一个篮球数据分析团队逐帧标注160小时以上的比赛录像,它数十分钟就能精准拆解8400多个攻防回合,一次性输出球员战术画像和教练报告;在量化投资领域,它能调度约330个子智能体完成约6000次因子回测。
在法务审查中,它一小时内完成了数百份文档1284条条款的标出。在芯片设计沙箱内,它历经约500轮交互将硬件门数由8298门精简至678门。在365天长周期电商经营模拟基准中,以416252元(4.16倍回报)的总资金成绩取得第一。
原生多模态:全程参与任务闭环
Qwen3.8-Max与很多“文本基座外挂视觉模块”的模型不同,其视觉能力深度融入任务全流程。图像信息不仅是输入素材,更全程参与任务规划、执行校验和自我修正,形成完整反馈链路。它能读懂200页的财报PDF、看懂超100小时的长视频,并将这些知识反馈到工作全流程。在无工具条件下的视觉推理BabyVision评测中,它取得82.0分,超出部分主流模型近两倍。在评估智能体电脑操作能力的OSWorld-Verified评测中,以86.1分位居主流模型首位。
定价与开源:性能对标Claude,价格仅为其四成
即日起,全球开发者可通过千问AI平台获得Qwen3.8-Max的API服务。国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元。海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元。输入与输出的国际价格仅为Anthropic Opus 5的40%与24%。
最受开源社区期待的权重文件将于下周上线——除Qwen3.8-Max外,轻量化版本Qwen3.8-27B将同步开放权重。这是千问首次将Max级别模型开源。模型已接入阿里同步推出的Agent产品“千问办公”。
当行业竞争从基础模型性能转向智能体能力和复杂任务执行效率,Qwen3.8-Max的发布正在把大模型从“回答问题”推向“交付成果”。



