综述:基于时间序列数据重构可解释的因果网络动力学

《Physics Reports》:Reconstruction of interpretable causal network dynamics from time series data

【字体: 时间:2026年09月09日 来源:Physics Reports 27.5

编辑推荐:

   # 摘要 从多变量时间序列中重构因果动态网络是复杂系统科学中的基础性问题。然而,关键科学问题并非仅仅是因果检测,而是因果可解释性。可解释的因果性是建立可检验的机制假说、可迁移的预测以及基于原则的干预与控制决策的基础。在现实世界的复杂系统中,因果推断常受到噪声、缺失数据、高维

  

# 摘要

从多变量时间序列中重构因果动态网络是复杂系统科学中的基础性问题。然而,关键科学问题并非仅仅是因果检测,而是因果可解释性。可解释的因果性是建立可检验的机制假说、可迁移的预测以及基于原则的干预与控制决策的基础。在现实世界的复杂系统中,因果推断常受到噪声、缺失数据、高维度、非线性、时间延迟、异质性和部分可观测性的影响。经典的因果可解释方法能够产生显式的、可检查的量,如因果图、系数和支配方程。然而,这种方法论的转变提高了期望:AI扩展方法越来越多地需要恢复显式的因果机制,而非不透明的预测依赖关系,从而保持可解释性。本综述总结了基于时间序列数据的四种经典方法及其AI扩展版本,包括Granger框架、信息论度量、非线性状态空间/流形重构以及机制性微分方程学习。接下来,我们阐明了它们的动机、核心原理、可解释性的来源以及得出有意义结论所需的假设。最后,我们重点介绍了这些方法在气候学、神经科学、流行病学、金融学、社会科学、生态学和分子生物学中的代表性应用,并讨论了比较分析、开放挑战和未来研究方向。

# 引言

从观测时间序列中重构因果网络及其底层相互作用动力学,是复杂系统科学中的一个基础性逆问题[1]。这一挑战在气候系统建模[2]、神经科学[3]、流行病学预测[4]、金融市场关联分析[5]、社会网络演化[6]和生态系统稳定性评估[7]等科学和工程学科中具有深远影响。在这些系统中,集体行为从跨多个尺度的非线性相互作用中涌现;因此,系统级动力学不能通过分析孤立组分来理解。相反,这些底层相互作用表现为编码在多变量时间序列中的"时空足迹",这些序列成为理解不可观测因果相互作用的主要经验窗口[8]。从这些嘈杂、高维观测中提取鲁棒的因果信息,并重构支配系统的内在因果结构和动态规则,仍然是理解和预测复杂系统的一项持久挑战[9]。

在过去的几十年中,人们开发了多种经典方法用于从时间序列中重构因果动力学。这些方法涵盖统计关联和Granger因果框架[10]、信息论度量(如传递熵[11])、非线性状态空间技术[12]以及机制性微分方程推断方法(如SINDy[13]和动态模态分解DMD[14],[15])。支撑这些经典方法持久影响力的关键因素在于其内在可解释性,这与统计有效性对于因果检测同等重要。在大多数科学探究中,因果推断超出了仅识别"是否存在因果联系"的范围;它要求回答更为细微、与机制相关的问题:关键驱动变量是什么?它们在哪些方向上以何种程度施加因果影响?因果效应通过哪些中间路径传播?这些因果相互作用在哪些时间尺度上起作用?在什么假设下,推断出的因果性保持鲁棒?经典方法的一个突出优势是它们能够产生显式的、可追溯的、可证伪的因果见解:它们基于透明的、数学上严谨的假设,产生结构化模型或可量化度量。这些经典方法论植根于统计物理学、非线性动力学理论、控制论和计量经济学等成熟领域,因此为因果证据的跨数据集和跨条件比较提供了严格的基准。

然而,这种可解释性并非普遍保证。它通常依赖于简化假设或结构约束,而这些假设在现实世界的复杂系统中经常被违反。主要局限包括对系统架构的强先验知识的依赖、低维度约束以及对足够密集的、无噪声观测数据的需求。如果这些条件不满足——如在具有高维度、结构异质性、部分可观测性和普遍观测噪声的系统中——经典方法通常表现为统计效力、计算可行性和样本外可靠性的显著下降,并且更容易受到间接效应和混淆因素的影响。

相比之下,AI驱动的黑盒模型,特别是深度学习架构,在拟合高维和强非线性时间序列方面表现出无与伦比的性能和令人瞩目的计算效率。这些数据驱动方法尽管具有强大的预测能力,但往往建立在统计近似而非机制理解之上,导致因果机制透明度的严重不足。由于这种"黑盒"性质,它们通常难以支持以因果关系的"为什么"存在和反事实场景的"如果……会怎样"为中心的基本科学问题,这限制了它们在预测性能之外的科学解释效用。AI驱动方法的灵活性与经典因果技术可解释性之间的固有张力,已经成为蓬勃发展的"AI for Science"范式的核心动力,该范式寻求将机器学习的数据驱动灵活性与经典因果方法论的理论基础相整合。

令人鼓舞的是,在这两个领域的交汇处出现了一个有前途的前沿,专注于开发AI驱动的可解释因果动力学重构方法,利用经典和现代AI方法的互补优势。一方面,经典因果算法越来越多地与神经网络模块或可微分求解器整合,使其能够克服处理大规模系统、高噪声水平和强非线性的固有局限。另一方面,可解释性已从事后解释工具演变为模型构建的内置原则:当代AI模型纳入了物理约束、符号结构和因果先验,以增强透明度并确保与基本科学原理的一致性。

代表性进展,如稀疏神经随机微分方程、用于因果推断的物理信息神经网络(PINNs)和符号因果发现,已在包括气候模式预测、生物医学机制发现和金融风险传播分析在内的复杂系统中展现出令人鼓舞的性能。然而,这些成功尚未弥合核心科学差距:在大多数当前灰盒技术中,物理或领域特定的定律主要作为正则化学习的约束发挥作用,而非作为显式识别或验证的对象。因此,这些模型仍然保留着黑盒类型的约束。它们可能输出物理一致的方程片段或稀疏因果图,但推断出的结构不够模块化、可证伪,也无法直接映射到具体的物理、生物或社会经济机制。这推动了一个更明确的目标——可解释因果动力学重构:将科学知识整合到核心因果表征中,使学习过程能够产生显式的、可检验的机制,并理想地实现从先验定律到数据驱动因果推断、再回到对底层机制的改进理解的透明循环。

在此背景下,本综述聚焦于从时间序列中重构可解释的因果动力学,涵盖经典方法论和最先进的AI驱动方法。为了超越纯粹的方法论目录,我们围绕三个基础性问题组织这些技术:每种方法旨在检测何种因果概念?输出在何种意义上是可解释的?哪些核心假设(显式或隐含的)使得推断出的因果性具有意义和可推广性?通过澄清这些基础,我们系统地讨论了适用的应用场景、固有局限和潜在挑战,旨在将因果网络重构从简单检测推进到严谨的科学解释。最终,我们论证该领域正在成熟为一个"灰盒"时代,即经典机制可解释性与神经灵活性的系统融合范式,解决了一直限制复杂系统因果推断进展的长期权衡。

本综述分为八个部分。第1节介绍问题并阐述从时间序列数据进行可解释因果动力学重构的必要性。第2节建立基础,涵盖因果和可解释性的定义,以及网络动力学重构的概念框架。综述的核心部分(第3-6节)采用比较结构;我们不将经典和AI方法孤立处理,而是将它们组织成方法家族以突出其演化。在每一节中,我们系统地将成熟的经典范式与其现代AI扩展配对。具体而言,第3节聚焦于经典和AI驱动的统计关联和Granger因果方法;第4节回顾信息论方法;第5节考察非线性状态空间重构;第6节涵盖支配方程发现技术。在这一方法论综述之后,第7节通过气候科学、神经科学、流行病学、经济学、生态学和生物学中的代表性应用展示这些技术的实际效用。最后,第8节综合比较分析并概述该领域的开放挑战和未来方向。

# 因果性

在数据分析中,因果性并非唯一定义的。不同方法家族采用不同的因果操作性概念。因此,对同一数据集的分析在不同框架下可能产生不同的因果结论,而不一定意味着错误。结果的差异反映了底层因果定义和假设的不同。下文,我们总结了几个主要的因果定义,包括哲学中的因果性、因果性。

# 统计关联方法

在从时间序列中重构因果网络动力学时,基于关联的方法量化变量间的统计依赖关系,并将其编码在加权图中。历史上,基于关联的网络构建可以追溯到皮尔逊相关系数(积矩相关)作为变量间线性关联的度量[38]。此后,它扩展为多变量时间序列的广泛依赖度量系列,包括相关和协方差。

# 经典信息论方法

经典信息论方法通过测量变量间信息的流动和结构来量化因果关系。这些方法依赖于信息论度量,如熵、互信息及其扩展,以捕获依赖关系。本节中,我们回顾了三个代表性家族,包括互信息及其扩展、信息分解,以及传递熵及其扩展。

# 经典非线性状态空间方法

经典非线性状态空间方法从重构动力学的几何结构中推断因果性。用于因果重构的状态空间方法不依赖于模型拟合或参数估计。相反,它们通过量化重构动力学轨迹之间的结构和几何变换来评估因果影响。本节中,我们回顾了代表性家族,包括基于邻域的方法、交叉映射准则、干预性动力学因果性,以及。

# 经典机制性微分方程形式

经验动态数据可以以连续或离散时间采样,在某些状态下可能很好地由线性动力学近似,而在其他状态下则表现出强非线性行为;因此,已开发出各种经典机制性微分方程形式用于因果网络重构。本节中,我们聚焦于三个代表性模型家族:通过在操作点附近线性化动力学得到的连续时间线性网络模型、广义Lotka-Volterra。

# 气候系统

气候变化作为当今最紧迫的全球挑战之一,需要更好地理解决定性事件、遥相关结构和长期气候变率。可解释的因果推断为此提供了强大工具,特别是在区分线性与非线性影响机制、构建有向气候网络、分析多尺度耦合以及增强预测任务的可解释性方面。与传统基于相关的方法相比。

# 经典方法与AI驱动方法的比较

经典方法和AI驱动方法在从时间序列中重构可解释因果网络方面各有不同的优势和局限。经典方法在透明度和理论严谨性方面表现突出,而AI驱动方法在处理复杂数据方面提供了更优越的可扩展性和灵活性;它们之间的互补性推动了整合机制见解与数据驱动学习的新兴混合框架趋势。然而,两者之间存在一些差异。

# CRediT作者贡献声明

高祥云:写作——审阅与编辑、监督、资源、项目管理、经费获取、概念化。
孙小天:写作——审阅与编辑、写作——原稿、监督、概念化。
吴涛:写作——审阅与编辑、写作——原稿、监督、经费获取、概念化。
安苏芳:写作——审阅与编辑、写作——原稿。
安峰:写作——审阅与编辑、写作——原稿、监督。

# 利益冲突声明

作者声明他们没有任何已知的竞争性经济利益或个人关系可能影响本论文所报告的工作。

# 致谢

本研究得到了国家自然科学基金(编号72371229、72401043、12471457、92570202)、深地探测与矿产资源勘探——国家重点研发计划(编号2025ZD1007005、2025ZD1007000)、北京市社会科学基金(编号24DTR035)、国家社会科学基金重大项目(编号25&ZD199)、DAAD PPP资助(编号57705568)以及复旦大学引进人才科研启动基金的资助。

# 作者

高祥云 | 孙小天 | 吴涛 | 安苏芳 | 安峰 | 厉思扬 | 魏宏玉 | 张昱鹏 | Norbert Marwan | Jürgen Kurths
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号