ARTICLE · 1067923
数据可下载,机器能理解吗?
数据可下载,机器能理解吗?
过去二十年,科学数据基础设施解决的是“数据在哪里”。于是建仓库、目录、DOI、搜索引擎。FAIR进一步问:能不能被发现、访问、互操作、复用?
AI时代又加一问:机器能不能在没有研究人员逐字段解释的情况下,正确理解这些数据?
这正是NHLBI测试LinkML Schema值得关注的原因。
假设两个实验室都提供血压数据。A写BP=120,B写SystolicPressure=16。人看说明文档能知道前者单位mmHg,后者kPa。但对AI系统来说,如果变量定义、单位、数据类型、实体关系和约束没有机器可解析的Schema,这两条数据根本不能直接互操作。
所以数据标准正在变化:PDF标准→元数据标准→机器可读Schema→机器可执行数据。
RDA推进Sample Type Classification又补了一层。Schema解决“字段什么意思”,Vocabulary解决“这个科学对象究竟是什么”,Provenance解决“数据怎么产生”,NEON新增的有效时间戳则回答“这条元数据什么时间范围内有效”。
连起来看,AI就绪科学数据的技术栈越来越清楚:科学数据→持久标识→元数据→受控词汇→机器可读Schema→出处→质量与不确定性→API→AI模型/Scientific Agent。
最值得注意的是最后一步。传统数据基础设施主要服务人,新的基础设施必须同时服务人和机器。人可以读30页说明书,可以理解Excel列名的特殊含义,也可以发邮件问数据生产者。Agent不能长期这样。它需要Schema知道结构,Vocabulary知道语义,Identifier知道对象,Provenance知道来源,API知道怎么访问,Permission知道自己能不能用。
所以AI-Ready真正深层的变化,不是把数据整理成Parquet、JSON或HDF5,而是把过去存在于科研人员脑中和说明文档里的隐性知识,转化成机器可以执行的数据规则。
如果继续发展到Scientific Agent,还需要增加机器可执行许可、机器可执行访问控制、工具描述、执行上下文和Agent出处。
最终形成:FAIR→高质量→分析就绪→AI就绪→机器可执行→Agent就绪。
未来衡量科学数据中心,除了多少PB、多少数据集、多少下载量,还值得加一组新指标:Schema覆盖率、标准词汇覆盖率、出处完整率、机器可读许可率、API可访问率、AI就绪率、Agent可调用率。
这可能比单纯增加数据量,更能反映AI for Science时代科学数据基础设施的真实能力。