《Ecological Informatics》:A FAIR-compliant metadata template for ecosystem digital twins
编辑推荐:
整合异构的生态、地理和环境数据集对于构建生态系统数字孪生并推进预测性生态研究至关重要。然而,数据重用仍受到不一致、非机器可操作元数据的制约,这限制了跨研究基础设施的互操作性。为解决这一问题,研究人员在荷兰LTER-LIFE项目(该项目正在开发用于生态系统数字孪
整合异构的生态、地理和环境数据集对于构建生态系统数字孪生并推进预测性生态研究至关重要。然而,数据重用仍受到不一致、非机器可操作元数据的制约,这限制了跨研究基础设施的互操作性。为解决这一问题,研究人员在荷兰LTER-LIFE项目(该项目正在开发用于生态系统数字孪生的研究基础设施)中开发了一个符合FAIR原则(可发现性、可访问性、互操作性和可重用性)的元数据模板。研究方法结合了既有标准的模式交叉映射、专家咨询和社区反馈,以识别、协调并优先确定核心元数据字段。由此产生的核心模式定义了一个最小集,包含23个强制性元数据字段,分为七个主题部分,并映射到两个国际公认的元数据标准——DCAT-AP和ISO 19115。该模板在CEDAR Workbench中实现,生成机器可读的关联数据记录(JSON-LD),并通过BioPortal整合受控词汇表和本体服务以支持语义一致性。迭代测试和优化提高了清晰度、可用性及跨生态领域的适用性。初步测试表明,该模板可与元数据目录集成,实现可搜索条目的自动填充,并支持联邦化发现与重用。通过平衡简洁性与语义严谨性,该模板为记录异构数据集提供了统一的、数据集级别的基石,并支持其集成到数字孪生工作流中。此项工作展示了基于社区、基于标准的元数据解决方案如何将FAIR原则付诸实践,并为跨生态研究基础设施的生态系统数字孪生应用提供了可迁移的基础。
**论文解读文章**
**研究背景与问题**
生态系统数字孪生——真实世界系统的虚拟、持续更新副本——正成为生态学和环境科学中的变革性工具。通过整合计算模型、领域知识和多样化的数据流,它们使研究人员能够探索生态动态并在不同环境和气候情景下预测结果。然而,构建生态系统数字孪生依赖于整合异构数据源,包括物种观测、传感器时间序列、地理空间图层、气候模型输出和遥感产品。实现这种整合需要协调一致、语义丰富的元数据,以确保跨生物和非生物领域的可发现性、互操作性和重用性。尽管国际元数据标准(如生态元数据语言EML、达尔文核心DwC、ISO 19115、数据目录词汇表DCAT等)提供了基础,但生态和环境数据在标准采用方面存在碎片化,阻碍了通用元数据框架的建立。现有方法要么是领域特定的,要么受限于基础设施,要么基于复杂模式,难以在异构数据集之间转移。因此,需要一种统一的、轻量级的元数据框架,支持数据集级别的发现、访问和互操作性,并满足生态系统数字孪生工作流中机器可操作数据摄入的要求。
**研究内容与结论**
为填补这一空白,研究人员在荷兰LTER-LIFE项目(一个开发生态系统数字孪生综合研究基础设施的荷兰大型研究基础设施)中开发了一个符合FAIR原则的元数据模板。该模板通过自上而下的标准协调与自下而上的社区参与相结合的方法设计,包括元数据字段清单编制、核心模式定义、CEDAR Workbench平台实现以及通过试点测试进行迭代优化。最终模板定义了23个强制性元数据字段,分为七个主题部分(元数据溯源、资源标识、数据联系人信息、空间属性、时间属性、知识产权和分发),并映射到两个国际标准:DCAT-AP(18个字段)和ISO 19115(5个字段)。模板在CEDAR Workbench中实现,输出机器可读的JSON-LD格式,并通过BioPortal集成受控词汇表和本体服务。初步测试表明,该模板可与元数据目录(如GeoNetwork)集成,实现搜索条目的自动填充,支持联邦发现和重用。该模板通过平衡简洁性与语义严谨性,为记录异构数据集提供了数据集级别的一致基础,并支持其集成到数字孪生工作流中,从而将FAIR原则付诸实践,为跨生态研究基础设施的数字孪生应用提供了可迁移的解决方案。论文发表在《Ecological Informatics》。
**主要技术方法**
研究人员采用以下关键技术方法:
1. **模式交叉映射**:对FAIRsFAIR、PONDERFUL和FAIR-EuMon三个FAIR导向项目的元数据模式进行结构化交叉映射,提取74个候选字段,分析其实现跨度、基础标准和出现频率。
2. **专家咨询与社区调查**:通过LTER-LIFE年度会议分组会议、专家评审(10位涵盖生态学、生物多样性信息学、数据管理、计算机科学、地球观测和环境建模的专家)、在线调查(13份回复)和半日专家研讨会(15位参与者)收集反馈,确定核心字段集。
3. **CEDAR Workbench实现**:利用开源元数据创作平台CEDAR Workbench构建模板,集成BioPortal的受控词汇表和本体服务(如COAR访问权限词汇表、eLTER环境主题词表等),支持JSON-LD和RDF导出。
4. **试点测试与迭代优化**:由6位LTER-LIFE联盟成员(包括设计者和新用户)对真实数据集(长期野外观测、遥感时间序列、模型输出和遗留数据集)进行测试,通过结构化调查和讨论收集反馈,优化模板帮助文本、字段定义和受控词汇表。
**研究结果**
**3.1 元数据清单**
对三个FAIR导向项目的模式交叉映射得到74个候选字段,仅4%的字段为三者共有,82.5%为唯一字段。标准使用高度异质,项目特定标准占主导(35个字段),其次为ISO 19115(29个)、都柏林核心(15个)和DCAT(9个)。专家咨询将字段合并至54个,标准减至5个(DCAT-AP、ISO 19115、Humboldt扩展、达尔文核心和EML)。
**3.2 核心模式定义**
在线调查显示,元数据溯源、资源标识、数据联系人信息和知识产权等部分的字段最常被评为核心;基于此,专家研讨会将54个字段缩减为23个强制性字段,分属7个主题部分,标准进一步减至2个(DCAT-AP和ISO 19115)。测量信息、监测方案信息和分类覆盖被省略,因其不适用于所有LTER-LIFE数据集。
**3.3 模板实现**
在CEDAR Workbench中实现草案模板,包含7个主题部分、23个字段。6个字段通过BioPortal集成受控词汇表(如语言、资源类型、关键词、许可、访问权限和数据集格式)。其余字段允许自由文本输入以保持灵活性。
**3.4 试点测试与模板优化**
试点测试中,参与者指出帮助文本不清晰、某些字段不适用于所有数据类型(如点数据的空间分辨率)、关键词受控词汇表过于严格。据此进行优化,包括简化帮助文本、调整空间分辨率字段、将关键词改为开放文本字段等。最终模板可通过CEDAR获取,支持JSON-LD/RDF导出,每个字段有统一资源标识符URI。
**总结与讨论**
该模板的核心贡献并非提出新的通用标准,而是通过协调DCAT-AP和ISO 19115元素,在CEDAR中实现机器可操作的JSON-LD格式,为生态系统数字孪生提供数据集级别的发现、访问和摄入层。其核心字段支持数据集筛选、时空匹配评估、机器可解析访问以及更新与维护准备。与现有倡议(如LifeWatch ERIC、DataCite模式、BioDT、FAIR-EuMon、PONDERFUL、FAIRsFAIR、EDI、ODISSEI)相比,该模板轻量级、跨领域,避免了详细采样、测量和监测描述符的复杂性,同时保留了生态相关的时空属性。自动化路径包括与GeoNetwork目录集成、API/DOI元数据收获、以及AI辅助元数据提取。局限性在于不包含变量级语义、模型结构或工作流溯源,这通过模块化扩展(如基于达尔文核心、SSN/SOSA本体、ODM2、STAC、RO-Crate等)来解决。未来开发通过版本化的领域特定扩展进行,遵循社区工作组治理的路线图。
**研究结论翻译**
LTER-LIFE元数据模板提供了一个实用的、符合FAIR原则的、机器可操作的解决方案,用于在生态系统数字孪生工作流中整合异构生态数据集。通过将紧凑的、数据集级别的23个核心字段与DCAT-AP和ISO 19115等标准对齐,它支持跨研究基础设施的高效数据发现、访问和互操作性,同时保持日常使用的可行性。作为第一版基础,该模板有意优先考虑简洁性和跨领域适用性,而更丰富的领域特定语义将通过模块化扩展和链接框架实现。这种方法为生态数字孪生的互操作和可重用数据生态系统提供了可扩展的路径。