摘要:截至 2026 年 6 月我国日均词元调用量突破 500 万亿,旗舰模型近乎月度迭代,竞争焦点转向智能体落地与生态;腾讯混元 3 上线首周 Token 调用量为上一代的 68 倍。

500 万亿这个数量级,需要换算一下才有体感。

按每天 500 万亿 token 算,一年约 1.8 万万亿(1.8×10^17)token。如果按中文平均 1.5 token/字粗略折算,相当于每天处理约 333 万亿字。这个体量已经不是“技术尝鲜”能撑起来的,必须有大规模的真实生产调用在里面。

报道里另一个数字更能说明结构变化:腾讯混元 3 正式版上线第一周,Token 调用量是上一代混元 2 的 68 倍。

单周 68 倍不可能来自用户自然增长,只能是三类原因的叠加:一是被压抑的需求在能力达标后集中释放——上一代模型在某些场景不够用,用户在等;二是单次任务的 token 消耗量级变了——智能体式调用一次任务可能消耗几万甚至几十万 token,而对话式调用只有几百;三是价格下降解锁了原本不划算的用法。

16_日均词元500万亿封面.jpg

第二类原因最值得注意,因为它是范式变化的量化体现。报道也提到,当前竞争焦点已转向智能体落地与生态建设,推理算力需求随之爆发。智能体和聊天机器人的成本曲线完全不是一回事:聊天是一问一答,智能体是规划、调用工具、读结果、再规划,中间可能循环几十轮,每轮都带着累积的上下文。同一个“任务”,token 消耗差两三个数量级。

这解释了为什么全行业的算力需求增速远超用户数增速,也解释了为什么推理成本优化在今年变成了核心竞争力而不是加分项。

“旗舰模型几乎以月为单位更新”这句话背后是另一重压力。对企业用户来说,月度迭代节奏意味着:技术选型的有效期被压缩到季度级别;上一版模型上做的 prompt 精调可能在新版上不再最优;供应商的能力排序随时会变。应对办法不是频繁换模型,而是把模型层做成可替换的组件——统一抽象接口、维护自己的回归测试集、每次候选模型更新时用自己的评测集跑一遍再决定。

对国内技术团队还有一个现实利好:智谱 GLM-5.3-Flash 的公告里提到,它首次在大规模流量中由国产芯片集群提供算力支持。推理侧的国产化替代如果能在成本和稳定性上站住,对合规敏感行业的落地节奏影响会很直接。

顺着这个数据再往下想一层:token 用量的爆发对基础设施的要求,和用户数爆发完全不同。

用户数增长压力主要在接入层——并发连接、会话管理、限流。token 用量增长压力在计算层和显存上,而且智能体式调用的负载特征特别难伺候:请求时长方差极大(有的几秒,有的几分钟),上下文长度方差极大(几百到几十万 token),还带着强烈的突发性。传统按 QPS 做容量规划的方法在这种负载下几乎失效,必须转向按 token 吞吐和显存占用建模。

这也是为什么推理调度这两年成了独立的技术领域——连续批处理、分页注意力、前缀缓存共享、多级卸载,这些技术在两年前还是论文,现在是生产系统的标配。企业自建推理服务如果没上这些,成本可能是优化过的方案的三五倍。

对技术管理者的一条实际建议:把 token 消耗做成一等公民的可观测指标,和延迟、错误率并列。按业务线、按功能、按模型分别打标签统计,每周看趋势。原因很简单——AI 功能的成本是变动成本,而变动成本失控从来不是一次性爆发,都是慢慢涨上去的。等到财务来问的时候,往往已经涨了一个季度,而且没人说得清是哪个功能吃掉的。