摘要:字节跳动成立第三个AI一级部门“AI数据与安全”,由王赢磊负责,整合Global Data等团队,专注为多模态大模型提供全流程数据服务。在“不蒸馏”战略下,数据正取代算法成为模型竞争的核心变量。

8月11日,据36氪旗下“智能涌现”报道,字节跳动近期成立了一个新的一级部门——AI数据与安全,与Seed、Flow、抖音等部门平行。负责人是王赢磊(Adam Wang),此前担任TikTok平台责任团队负责人和TikTok直播负责人。

这是继2023年底成立Seed和Flow之后,字节围绕AI业务设立的第三个一级部门。

整合了谁

新部门的前身之一是TikTok创始团队成员傅越(花名Yuyi)于2023年组建的Global Data团队,原来大约百人规模。这个团队起初服务Dola(豆包海外版)和TikTok等国际业务,后来负责为Seed的模型训练做数据采购和质量管控。

除了Global Data,AI数据与安全还整合了集团数据中台DMC,以及Flow下属的AI数据平台AIDP。整合从2026年6月初启动,目前还在梳理架构、优化人员。

整合后的部门横跨基座模型到业务团队,核心职能是为字节所有大模型提供跨模态数据服务,覆盖数据生产全流程——标准制定、寻源采购、合成清洗、质量评测。

为什么要单设一个数据部门

直接原因是字节的“不蒸馏”战略。

7月底的Seed全员会上,张一鸣表态“坚决不蒸馏”。8月5日字节全员会上,CEO梁汝波说得更直白:“字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期”。

不蒸馏意味着什么?字节不能拿别人的模型输出做数据来训练自己的模型。所有训练数据都得自己采、自己合成、自己清洗。这需要一支庞大的数据团队来支撑。

字节在数据上的投入确实不小。据《智能涌现》此前报道,字节2026年初在世界模型和Coding模型训练上的数据预算已超千万美元级别。仅为Seedance视频模型做数据评测的团队就有上千人,每位算法工程师背后配着十多位数据同事。

Seedance 2.0的成功被多位从业者称为“一场数据的胜利”。这个结果让字节更加确信砸数据是值得的。

更大的背景

跳出字节来看,全球AI行业正在经历一个结构性变化:公开互联网数据快被穷尽了,模型竞争的核心变量正从算法和算力转向真实世界的高质量数据。

字节不是唯一在押注数据这条路的。Anthropic在2025年一年内为强化学习数据拨了超过十亿美元。硅谷数据服务公司Mercor的年化营收从2025年的5亿美元飙到2026年中期的20亿美元,其中91%来自OpenAI和Anthropic。腾讯过去六个月一直在以最高三倍的薪水资源挖角字节的数据员工。

数据稀缺的本质在于:大模型需要的不是公开网页上的文字,而是“过程数据”——专家如何解读模糊意图、如何搜索上下文、如何犯错并纠正的轨迹。这些东西不在开放的互联网上,藏在企业代码库和日常工作流程里。

字节这个新部门的成立,本质上是在解决一个越来越贵、越来越难的问题:当模型参数动辄万亿级别,谁来持续供应高质量的训练数据?

数据工程正在变成大模型的基础设施。字节把这件事提到一级部门的级别,逻辑上说得通。