ARTICLE · 1032215
AI 与数据,谁成就了谁?
最近两年有一个现象越来越明显:一边是 AI 大模型需要"喂"进海量高质量数据,另一边是数据要素在 AI 的帮助下变得"更干净、更好用、更能流通"。2026 年国家层面的部署给出了一个更本质的说法——让数据要素与人工智能"协同演进、互促共进",用一句话概括就是:"场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值"。这不是两个赛道,而是一个正在加速转动的双向飞轮。这篇文章不堆概念,只讲清三件事:AI 与数据到底是什么关系、飞轮两侧各自发生了什么、以后该怎么判断。
01 先问对问题:这是"两条线",还是"一个飞轮"?
通常的讨论里,AI for DATA 和 DATA for AI 被拆成两件事:AI for DATA,用 AI 技术治理、标注、质检、分析数据,让数据更规范、更好用;DATA for AI,用高质量数据训练、微调、优化模型,让 AI 更聪明、更懂行业。
表面看是两条线,实际上是互为因果:没有高质量数据,AI 训练就是"无米之炊";没有 AI,数据治理和标注的成本高到难以规模化。
02 AI for DATA:用 AI 把数据"变好用"
AI 反哺数据,落点主要在五个环节:
1. 数据治理智能化:自动清洗、质量检测、元数据管理、数据目录自动构建,把过去靠人力的"数据搬家"变成"数据体检+自动整理"。
2. 数据标注降本增效:大模型辅助标注、人机协同、标注质量自动评估,直接催生并升级了数据标注产业。
3. 数据检索与交互:NL2SQL、对话式取数,业务人员用"大白话"就能查数据,大幅降低使用门槛。
4. 数据安全与合规:智能分类分级、自动脱敏、隐私计算,让数据"敢流通、能流通"。
5. 数据资产化加速:AI 辅助数据资产评估、定价、入表,让数据从"成本"变成"资产"。
数据治理、标注、质检的每一环,都在被 AI 重做一遍。
03 DATA for AI:用数据把 AI"养聪明"
数据喂养 AI 这一侧,正在成为国家级的产业主线:
1. 高质量数据集:2026 年 6 月,国家数据局发布《关于推进行业高质量数据集建设行动的实施方案》,这是国家层面首次对"数据赋能人工智能"作出系统性部署,围绕强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放开展六大行动。
2. 数据标注产业:2025 年国内数据标注市场规模约 117.53 亿元,预计 2026 年突破 150 亿元;国家已布局七大国家级数据标注基地,并将在 32 个城市布局第二批先行先试。
3. 数据供给机制:公共数据开放、数据交易、可信数据空间、数联网,正在打通"数据到模型"的管道。
4. 合成数据:在真实数据不足、隐私受限的场景,合成数据成为重要补充。
5. 训练数据合规:数据来源授权、版权、个人隐私,成为 AI 产业最敏感的合规议题之一。
高质量数据像燃料一样,不断把模型"喂"得更聪明。
04 政策与产业:双向奔赴已经不是口号,而是数字
截至 2026 年 6 月,全国已建成高质量数据集超 12 万个,总体量超 1565 拍字节;《中国数据产业发展报告(2026)》显示,2025 年我国数据产业规模达 6.78 万亿元,同比增长 15.7%,其中包含 AI 应用软件的数据类软件产品和包含词元服务的数据资源产品产值合计 4.99 万亿元、占比 73.6%;国家数据发展研究院测算,2024 年提供高质量数据集等专业数据产品的企业产值规模已超 2 万亿元,预计 2025 年超 2.3 万亿元;"人工智能+"行动与"模数共振"行动并行推进——"人工智能+"行动到哪里,行业高质量数据集的建设和推广就要到哪里。
05 一个被低估的真相:核心变量是"数据飞轮"
很多人以为,数据喂得越多,AI 就越强。这只说对了一半。
真正起作用的,不是"数据量",而是"高质量数据+场景闭环"形成的飞轮:场景提出需求,牵引数据;数据驱动模型,模型赋能应用;应用沉淀新数据、产生新价值,反哺更高阶的数据与模型。如果只有海量数据,没有真实场景和反馈闭环,数据就会"喂而不转",飞轮转不起来。这也是为什么国家反复强调"场景牵引"——飞轮的第一推动力,永远是真实业务场景
06 一套判断框架:以后怎么看数据与 AI 的关系
判断一个"数据×AI"项目是真机会还是伪需求,可以看四个变量:
数据质量:是不是高质量、可用、可持续更新的数据,而不是"数据烟囱"。
场景闭环:数据有没有进入真实业务场景,形成"用起来—反馈—改进"的闭环。
供给机制:数据能不能合规、可持续地供给。
合规边界:数据来源是否合法、授权是否清晰、隐私是否保护到位。
四个变量缺一不可:只有概念热度、没有场景闭环和数据质量的项目,大概率停留在"讨论层"。
回到开头的问题:AI 和数据,谁成就了谁?
答案是:它们互相成就,而且这种成就正在变成一个自我强化的飞轮——AI 让数据更好用,数据让 AI 更聪明;越多的场景用起来,越多的数据被沉淀,越强的模型被训练出来,反过来又能服务更多场景。
看懂这个飞轮的人,不会只追问"AI 会不会取代人",也不会只盯着"数据能不能卖钱",而是会问一句更关键的话:这个数据×AI 的飞轮,转起来了吗?