摘要:字节跳动成立新一级部门“AI数据与安全”,由王赢磊负责,整合Global Data、DMC、AIDP等团队,为所有大模型提供跨模态数据服务。本文解析组织调整逻辑与行业背景。
8月11日,36氪旗下“智能涌现”援引多个独立信源报道:字节跳动近期成立了一个新的一级部门——AI数据与安全。
与Seed、Flow、抖音等部门平行。负责人是王赢磊(Adam Wang)。
这是继2023年底成立Seed和Flow两个AI一级部门后,字节围绕AI业务成立的又一个一级部门。
先说部门本身。
AI数据与安全不是凭空长出来的。它的前身之一是TikTok创始团队成员傅越2023年成立的Global Data团队,当时百人左右规模,最早服务Dola(豆包海外版)和TikTok等国际业务,后来开始承担Seed模型训练的数据采购和质量管控。
除此之外,新部门还整合了集团数据中台DMC,以及Flow下属的AI数据平台AIDP。整合从2026年6月初开始,目前还在梳理架构。
整合之后,这会是一个横跨基座模型到业务团队的庞大数据团队。核心职能是为字节所有大模型提供跨模态的数据服务,覆盖数据生产全流程:标准制定、寻源采购、合成清洗、质量评测。
那为什么字节要在这个时间点,把数据团队单独拎出来升格成一级部门?
直接原因是整合需求。过去几年,字节内部围绕数据长出了好几套班子——Global Data做国际业务数据,DMC做集团数据中台,AIDP做Flow的数据平台,Seed内部不同模型方向也各自建了数据团队。做的是同一类事,但各管一摊。整合是迟早的事。
深层原因比这个要重。
今年7月底的Seed全员会上,张一鸣表态:字节在大模型攻坚上“坚决不蒸馏”。8月5日字节全员会上,CEO梁汝波说得更具体:“字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。”
“不蒸馏”三个字,听起来像原则表态,落在业务上就是实打实的成本。
如果允许蒸馏,字节可以直接拿别人的模型输出做训练数据,省掉大量数据采买、清洗、标注、评测的投入。但张一鸣把这条路堵死了。所有数据都得自己搞——自己采购、自己合成、自己清洗、自己标注、自己评测。
那就需要一个足够大的团队来兜住这一切。
有多大?据《智能涌现》此前报道,仅Seedance的数据评测团队就有上千人。每一位Seedance算法工程师背后,往往配着十余位数据同事。而在世界模型和Coding模型的训练上,字节2026年初的数据预算已经超过千万美元级别,而且“如果觉得不够,可以随时追加预算”。
Seedance 2.0的成功,被多位从业者称为“一场数据的胜利”。这句话放在这个时间点看,不是事后总结,是方向确认。
还有一层外部因素。
全球AI行业正在经历一个结构性变化。当公开互联网数据被穷尽之后,模型竞争的核心变量正从算法和算力转向真实世界的高质量数据。Epoch AI的研究显示,语言模型的训练将在2026年到2032年间耗尽人类公开的文本数据。高质量语言数据可能2026年就会率先枯竭。
字节不是不知道这个趋势。把“AI数据与安全”提到和Seed、Flow平级的位置,等于正式承认:数据不再是算法团队的附属职能,它已经长成一个需要独立组织、独立预算、独立负责人的基础设施层。
Seed管模型,Flow管产品,AI数据与安全管理数据。字节AI的三级架构,至此补齐。
王赢磊的背景也值得说一句。他此前的职位是TikTok平台责任负责人和TikTok直播负责人。直播业务曾是TikTok最主要的营收来源之一。把做过最大营收业务的人调来管数据部门,字节对这个部门的定位,不是“支持部门”四个字能概括的。
张一鸣不让抄作业,字节只好自己编教材。编教材这件事,现在有了专门的编辑部。



