夜雨聆风学习资料网

ARTICLE · 1067923

数据可下载,机器能理解吗?

数据可下载,机器能理解吗?

数据可下载,机器能理解吗?

过去二十年,科学数据基础设施解决的是“数据在哪里”。于是建仓库、目录、DOI、搜索引擎。FAIR进一步问:能不能被发现、访问、互操作、复用?

AI时代又加一问:机器能不能在没有研究人员逐字段解释的情况下,正确理解这些数据?

这正是NHLBI测试LinkML Schema值得关注的原因。

假设两个实验室都提供血压数据。A写BP=120,B写SystolicPressure=16。人看说明文档能知道前者单位mmHg,后者kPa。但对AI系统来说,如果变量定义、单位、数据类型、实体关系和约束没有机器可解析的Schema,这两条数据根本不能直接互操作。

所以数据标准正在变化:PDF标准→元数据标准→机器可读Schema→机器可执行数据。

RDA推进Sample Type Classification又补了一层。Schema解决“字段什么意思”,Vocabulary解决“这个科学对象究竟是什么”,Provenance解决“数据怎么产生”,NEON新增的有效时间戳则回答“这条元数据什么时间范围内有效”。

连起来看,AI就绪科学数据的技术栈越来越清楚:科学数据→持久标识→元数据→受控词汇→机器可读Schema→出处→质量与不确定性→API→AI模型/Scientific Agent。

最值得注意的是最后一步。传统数据基础设施主要服务人,新的基础设施必须同时服务人和机器。人可以读30页说明书,可以理解Excel列名的特殊含义,也可以发邮件问数据生产者。Agent不能长期这样。它需要Schema知道结构,Vocabulary知道语义,Identifier知道对象,Provenance知道来源,API知道怎么访问,Permission知道自己能不能用。

所以AI-Ready真正深层的变化,不是把数据整理成Parquet、JSON或HDF5,而是把过去存在于科研人员脑中和说明文档里的隐性知识,转化成机器可以执行的数据规则。

如果继续发展到Scientific Agent,还需要增加机器可执行许可、机器可执行访问控制、工具描述、执行上下文和Agent出处。

最终形成:FAIR→高质量→分析就绪→AI就绪→机器可执行→Agent就绪。

未来衡量科学数据中心,除了多少PB、多少数据集、多少下载量,还值得加一组新指标:Schema覆盖率、标准词汇覆盖率、出处完整率、机器可读许可率、API可访问率、AI就绪率、Agent可调用率。

这可能比单纯增加数据量,更能反映AI for Science时代科学数据基础设施的真实能力。

原文【数据晨报】科研数据开始为AI“重做一遍”:从LinkML到自动数据流水线,基础设施进入机器可用时代
北京,21分钟前,

相关学习资料