
AI时代,数据作为AI的燃料、基础、生产资料,决定了AI能力的上限与落地价值,没有高质量数据,算法、算力都无法发挥作用。去年一年,数据领域冒出来不少新名词:词元经济、数据飞轮、模数共振、可信数据空间……有些是国家数据局"盖章认证"的官方术语,有些是Gartner等国际机构推了多年的架构理念,还有些是互联网大厂造出来的新概念。本文将带读者一起盘点一下最热门的数据新词汇。

词元经济
词元是指大模型在处理文本、代码、图像、音频、视频等多模态信息时所采用的最小运算单元。每一次生成式人工智能的推理与响应,本质上均体现为词元层面的计算与流转。根据社科院介绍,“词元经济”可定义为在生成式人工智能运行与应用过程中,以词元为基础计量单位,围绕模型调用、信息处理、成本核算、服务定价及价值转化所形成的一整套资源配置方式与经济运行逻辑。词元经济的核心计量单位是“词元”,反映的是算力、算法与数据融合下的智能活动——其产出不仅包括信息传递,更涵盖大模型自主推理与生成所创造的新知识、新服务。
词元工厂
词元工厂,又称Token工厂,是人工智能时代将电力与数据转化为词元(Token)的算力数据中心或基础设施。2026年3月,英伟达CEO黄仁勋在GTC大会上首次提出“词元工厂”概念,他指出数据中心如今已经成为全天候运转的“词元工厂”,输入电力和数据,输出词元。黄仁勋同时提出了衡量其经济效益的核心公式:收入=每瓦词元数×可用千兆瓦数,将词元生产的效率与规模直接与收入挂钩。
模数共振
源于2026年4月29日工业和信息化部、国家数据局印发的《关于联合实施2026年“模数共振”行动的通知》。该行动旨在到2026年底基本形成‘数据-模型-场景应用’良性互促的循环,推动人工智能高水平赋能新型工业化。行动聚焦钢铁、石化化工、有色金属、建材、工业母机、汽车、医疗装备、电力装备、船舶、航空航天、家居、医药、生物制造、历史经典、电子元器件、消费电子、新型显示、软件、信息通信、网络安全等重点行业,兼顾传统产业转型升级、新兴产业培育壮大和未来产业前瞻布局。
可信数据空间
源自国家数据局发布的《可信数据空间发展行动计划(2024—2028年)》,提出到2028年建成100个以上可信数据空间的目标。可信数据空间是基于共识规则联接多方主体、实现数据资源共享共用的数据流通利用基础设施,具备数据可信管控、资源交互、价值共创三类核心能力,是支撑全国一体化数据市场的重要载体。
数据飞轮
数据飞轮是一种企业数智化升级模式,其核心是以数据消费为驱动力,旨在通过数据消费促进数据资产建设,同时利用优化后的数据资产反哺业务应用,从而形成从数据资产到业务应用的双向正循环。其理念在于促使企业重视数据消费,让业务流与数据流充分融合,以期解决数据中台建设中“重资产、轻消费”等问题。数据飞轮被视为对传统数据中台理念的继承与发展,强调以“用”促“建”,通过降低数据使用门槛,让更广泛的员工能够应用数据。
数据编织
数据编织被定义为下一代分布式数据管理架构,通过逻辑数据虚拟化技术整合数据仓库、数据湖、湖仓一体等异构存储系统,形成统一的数据操作平台。Gartner在2019-2022年间连续将其列为十大技术趋势,2022年更位列数据管理领域首位。2026年1月,国家数据局在《关于加强数据科技创新的实施意见》中首次提出“数据科技”概念,并将数据编织列为加强试验验证和规模化应用的关键技术方向之一。
数据网格
数据网格是去中心化、领域自治的数据全域互联架构,类比软件领域的微服务:不再把全公司数据统一汇总到中央数据湖 / 仓库,而是按业务域拆分、各域自产自销标准化数据产品,通过统一联邦标准互联互通,解决大型企业数据孤岛、中央数据团队瓶颈问题,是数据飞轮、词元工厂的底层数据底座。
合成数据
合成数据是指通过计算机算法生成的模拟数据,模拟真实世界的数据分布和特征。该技术生成方式包括基于生成对抗网络(GANs)、扩散模型、统计模拟等方法,应用于自动驾驶、医疗影像、金融反欺诈等领域,可用于降低数据采集成本并满足隐私合规需求。在具身智能等领域,由于训练数据需求量大,AI仿真合成数据被视为解决数据需求的途径之一。
数据沙箱
数据沙箱是一套以数据安全运用为核心的数据安全沙箱平台,其遵循“数据不动程序动、数据可用不可见”的安全理念,通过环境隔离、流程管控与安全审计等技术手段,在保障数据所有权的前提下实现数据的安全流通与价值释放。平台通常采用调试环境、生产环境与运行环境相隔离的架构,确保数据开发方及运用方不接触原始数据,实现数据所有权与使用权的分离。数据沙箱技术在政务、医疗、金融、公安等领域具有广泛应用前景。
---The End---
素材源自:数据资产赋能转型、工信部、国家数据局等

夜雨聆风