摘要:8月7日,字节跳动被曝正在讨论训练超过5万亿参数的大模型,由项亮主导,算力需求高达百万张显卡。张一鸣在内部会上定调:反对蒸馏、编程只是短期方向,可接受阶段性落后但追求智能上限。豆包月活已达3.82亿。
国产大模型的参数量,正在从万亿级别向上猛探。
Qwen3.8-Max的2.4万亿、Kimi K3的2.8万亿已经被甩在身后——字节跳动正在讨论训练一个参数规模超过5万亿的大模型。如果落地,它将成为国内已知规模最大的AI模型。5万亿参数是什么概念?业界普遍认为,这是GPT-5.6或Opus 5级别的量级。
计划由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作推进。项亮2016年加入字节,曾负责机器学习中台AML团队;沈科2018年清华毕业后加入字节。两人都出自字节的“搜广推”体系。
项目目前仍处于早期讨论阶段,最终不一定会发布。但字节内部已经在认真算这笔账了。
算力账:10万张H100跑347天,或100万张显卡跑35天
5万亿参数的训练成本极其惊人。
以H100为基准测算,训练这样一个模型需要10万颗H100连续运行347天,或者100万张显卡跑35天。百万卡已经跨进GW级算力规模。
字节不可能一次性梭哈这么多算力,更合理的路径是用20到30万张显卡训练3到4个月,再加上准备和后训练等环节,至少需要半年到一年才能成型。
算力储备上,目前最充裕的仍是OpenAI——SemiAnalysis测算其握有约200万张显卡;Anthropic约62万张;DeepSeek只有约6万张,且不少还是相对落后的H20、H800。以字节的财力,喂饱一个5万亿参数的大模型不在话下。
张一鸣定调:不蒸馏、别被Coding牵着走
两周前的Seed全员会上,字节跳动创始人张一鸣罕见露面,对团队做了一次方向性的表态。
他的核心观点有两个。
第一,反对蒸馏。 张一鸣认为蒸馏能在短期内改善模型表现,但本质上仍是在复制Claude已有的能力——“沿着这条路走,最多只能不断逼近对方,很难真正实现超越”。字节内部目前对开源模型严禁蒸馏,甚至通过API检测等方式加强限制。他希望Seed可以从更底层的维度去构建AGI上的壁垒。
第二,编程只是短期热点,别被它牵着走。 他认可编程是当前的关键方向,所以要把火山引擎、飞书和豆包的资源整合到一起。但他也提醒团队:编程之外还有更多更大的机会。
张一鸣同时安抚了团队——训大模型本就是一件很难的事,不必过度焦虑。他明确一段时间内可以接受模型落后于行业,希望大家以追求智能上限为目标,期待Seed模型能力能跻身世界第一梯队。
为什么要冲到5万亿?一场“赌博”式的弯道超车
上半年,Seed的多模态模型取得了显著成绩:视频生成模型Seedance 2.0和图片生成模型Seedream 5.0 Lite声量一度超过业内同类模型。但同期发布的语言模型Seed 2.0,市场反响却较为有限。
几乎是同一时间,智谱开源的GLM-5被市场视为国内第一个能与Anthropic Opus系列比肩的模型;7月,月之暗面的Kimi K3发布,多项第三方评测认为它已接近海外闭源旗舰。
多位字节人士坦言,这正是字节讨论训练超5万亿参数模型的原因之一——与其在现有尺寸上继续追赶,不如把参数规模一次推到同行的数倍,争取领先位置。
一位接近Seed的人士直言,这“像一场赌博”。
商业回报:唯一的悬念
有了5万亿参数的大模型,豆包的能力做到GPT-5.6或Opus 5级别没什么悬念,智商能真正拉满。豆包目前月活已达3.82亿,是国内唯一月活过亿的独立AI应用。
但字节需要考虑的,可能还是商业上的回报。5万亿级大模型的训练和推理成本极高,后续C端产品上线、商业化落地的压力巨大。这笔天文数字的投入,能不能在落地端换来对等的收益,才是唯一的悬念。
过去几年,字节已经在AI方向投入了很多;未来,还会投入更多。2026年字节的AI基础设施资本支出预算已上调至2000亿元人民币,其中约850亿元专项用于AI芯片采购。从算力储备到战略决心,字节已经摆好了All in的姿势。
现在的问题是:这场“赌博”,能赌赢吗?



