摘要:今年九月,国内外厂商密集推出新一代大模型,发布周期由半年一更压缩至数天一旗舰。评价标准从“裸跑分”转向单位成本交付,模型寿命同步缩短,AI参与造AI正加速产业换代。
2026年的秋天,大模型行业迎来有史以来最密集的一次发布季。九月尚未过完,OpenAI、Anthropic、Google、DeepSeek、xAI、阿里、讯飞、阶跃星辰等国内外厂商已接连交出新一代模型。节奏之快,让下游开发者疲于跟进,也迫使行业重新思考评价模型的尺子该用什么刻度。

九月三日,OpenAI推出GPT-6 Astra,以约105万token上下文、12.8万token最大输出和五档推理强度,锚定“自主执行”的产品定位。十九天后,Anthropic在同一天推出Claude Opus 5.5,定价落在每百万输入4美元、输出20美元,较上一代Opus 5下降约四成,却在Terminal-Bench 4.0等智能体编码基准上拿下66.4%的领先成绩。Google的Gemini 3.8 Flash走“快与便宜”路线,吞吐超过每秒300个token,把中端生产负载的单价压到每百万token 1.5美元上下。国内一侧,DeepSeek于九月十日上线V4.1-Flash,采用全新的因果编码器—解码器架构,总参数5520亿的MoE模型在输入阶段激活80亿、输出阶段激活160亿,将KV缓存占用压低约75%;阿里Qwen3.8-Max-0902则以2.4万亿参数、100万上下文和代码方向的专项优化,发布即登上WebDev榜首。
多家机构梳理的时间线显示,今年初至九月下旬,Anthropic与OpenAI两家合计发布十四個旗舰,平均十九天一个;若将国内十家主要厂商纳入统计,上半年至少发布二十八个旗舰,平均九天多便有一个新模型露面。周期还在缩短——Anthropic下半年发布间隔已从上半年的四十六天压缩到二十六天。
发布越密,评价标准也在悄然换轨。某云厂商技术复盘指出,行业关注点正从“裸跑分”转向“单位成本下的交付能力”。与此同时,模型寿命同步缩短:OpenAI年内已发布九次弃用公告,涉及四十余个模型与功能,其中四月二十三日刚发的GPT-5.5将于十月十四日从ChatGPT与Codex下架,存活不足半年。对使用者而言,今天调好的提示词与智能体链路,其有效期可能撑不过一个发布周期。
这场速度竞赛的底层推力,是AI正在参与制造下一代AI。Anthropic披露,其模型独立主导的内部AI研发工作占比已从二月不足1%升至八月26%;OpenAI截至八月中旬投入的AI智能体工作日已达到人类研究员的三点一倍。当造模型的人把活计交给模型自己,迭代只会更快。对产业而言,真正的考题不再是“谁又刷了榜”,而是如何在持续换代的湍流中,建立一套稳健、可迁移、成本可控的工程底座。







