乐于分享
好东西不私藏

字节成立新的AI一级部门,主攻“数据”

字节成立新的AI一级部门,主攻“数据”

点/击/蓝/字  关/注/我/们

据36氪消息,近日字节跳动成立了一个新的一级部门——AI数据与安全,与Seed、Flow、抖音等部门平行,是一个横跨基座模型到业务团队的庞大数据团队,其核心职能是为字节所有大模型,提供跨模态的数据服务
字节的组织调整,背后是全球AI 行业的结构性变化——模型竞争的核心变量正从算法和算力,正转向真实世界的高质量数据。

8月11日,据公众号《智能涌现》从多个独立信源处获悉,字节跳动近期成立了一个新的一级部门——AI数据与安全,与Seed、Flow、抖音等部门平行,负责人为王赢磊(Adam Wang)。

这是继2023年底成立Seed和Flow两个AI一级部门后,字节围绕AI业务成立的又一个一级部门。负责人王赢磊此前为TikTok平台责任负责人和TikTok直播负责人。

这个新部门的前身之一,是由TikTok创始团队成员傅越(花名Yuyi)于2023年成立的数据团队Global Data,原来的规模在百人左右。这个精干的团队起初为Dola(豆包海外版)、TikTok等国际业务服务,而后负责为Seed的模型训练做数据采购和质量管控。团队内部设有产品经理、数据工程、采购、质检运营、安全合规等多个职能。

除Global Data之外,AI数据与安全部门还整合了多个此前分散的AI数据部门,包括集团数据中台DMC,以及Flow下属的AI数据平台AIDP等团队人员。

多位知情人士表示,这一部门的整合和正式成立从2026年6月初开始,而由于涉及多个部门整合,这些部门之间业务又多有重叠,当前字节还在不断梳理架构,优化人员。

数位接近该部门的人士告诉36氪,整合后的新部门,会是一个横跨基座模型到业务团队的庞大数据团队,其核心职能是为字节所有大模型,提供跨模态的数据服务团队的职责也覆盖数据生产全流程,包括标准制定、寻源采购、合成清洗、质量评测等。

根据字节的这次组织调整,我们看到了全球AI行业发生的结构性变化——当公开互联网数据被穷尽,模型竞争的核心变量正从算法和算力,转向真实世界的高质量数据。

字节的数据布局与全球数据军备赛

字节在AI数据上的投入非常坚决,这可追溯到Seed成立之初就定下“不做蒸馏”原则。

为支撑达到全球第一梯队的目标,字节构建了庞大的数据团队。

据《智能涌现》报道,仅为Seedance做数据评测的团队就有上千人,每位算法工程师背后有十余位数据同事支持,远超视频赛道头部创业公司数十人的规模。

Seedance 2.0的成功被多位从业者称为“一场数据的胜利”,进一步坚定了字节的投入。

首先是预算层面。在世界模型和Coding模型的训练上,字节2026年初的数据预算已超过千万美元级别,并且“如果觉得不够,可以随时追加预算”。

目前字节数据团队也已经采取赛马机制,团队内部按方向划分——世界模型、代码、高难学科等。在如今模型的商业逻辑日渐清晰的背景下,字节的每个数据项目,也需要核算ROI。

字节之外,各大厂都在加强数据投入。从去年开始真正发力大模型的腾讯,近半年来频繁以高达三倍的薪资从字节的数据团队挖人。

在全球范围内,随着算法架构带来的能力提升趋缓,数据已成为决定模型上限最重要的变量。

海外大模型公司的数据投入是国内的数倍,硅谷头部公司的外部数据预算正以每年数十亿美元量级膨胀。比如Anthropic,仅在2025年就为RL数据拨出了超过10亿美元的预算。

这使得数据成为了2026年硅谷增长最快的赛道之一。最典型的是硅谷明星公司Mercor,年化收入从去年的5亿美元涨到今年年中的20亿美元,其中91%来自OpenAI、Anthropic等头部模型公司,估值则飞涨至200亿美元,这家公司成立仅三年。

而数据价值引起全球瞩目的根本原因或许就在于互联网公开数据几近穷尽,模型训练正从公域转向私域而大量专业数据的采集,也就成了大模型公司新的争夺点。这次字节成立的新组织,也许正是为了应对新环境下的新竞争模式。

来源:整理自智能涌现(邓咏仪、周鑫雨)

20

26

阿幂塔

数据科技

求点赞

求分享

求喜欢