《Signal Transduction and Targeted Therapy》:Artificial intelligence in biomarker discovery for diseases: diagnostic and therapeutic prospects
编辑推荐:
生物标志物是现代诊断与治疗学的核心,然而传统的发现方法受限于单模态分析、薄弱的机制基础以及低可重复性。人工智能(artificial intelligence, AI)能够整合复杂的多模态生物医学数据,但AI衍生的生物标志物向临床应用的转化仍不稳定。本综述审视
生物标志物是现代诊断与治疗学的核心,然而传统的发现方法受限于单模态分析、薄弱的机制基础以及低可重复性。人工智能(artificial intelligence, AI)能够整合复杂的多模态生物医学数据,但AI衍生的生物标志物向临床应用的转化仍不稳定。本综述审视了AI如何重塑跨疾病的生物标志物发现,重点关注生物学机制、验证要求及治疗整合。我们综合了分子、细胞、影像及数字生物标志物层面的证据,评估了包括经典机器学习(classical machine learning)、深度学习(deep learning)、图模型(graph-based models)、基础模型(foundation models)及因果推断(causal inference)在内的AI方法学。研究结果按照涵盖发现、外部验证、稳健性测试、临床效用及部署的流水线框架进行组织。AI能够识别反映细胞程序、组织重塑及疾病轨迹的多尺度特征。然而,许多生物标志物未能通过外部验证。采用基于网络建模、空间分析及机制约束的生物学锚定方法,可提高肿瘤学、心血管疾病、神经退行性疾病及代谢性疾病中的可解释性与治疗相关性。包含决策曲线分析(decision curve analysis)及前瞻性评估的验证框架,是证明超越预测准确性的临床效用的必要条件。AI的影响力将取决于其与严格验证及治疗路径的整合。通过从相关性模式识别转向机制知情、经临床评估的系统,AI能够支持下一代精准诊断与靶向干预。
主体内容总结
生物标志物模型与生物学原则(跨疾病关系)
分子生物标志物:基因组学/表观基因组学、转录组学、蛋白质组学/翻译后修饰、代谢组学/脂质组学
分子生物标志物仍是疾病分层与治疗靶向中最成熟且应用最广泛的类别。基因组变异可界定疾病风险与亚型定义,表观基因组调控则捕捉由发育、环境及疾病活动塑造的动态基因调控状态。在癌症、免疫介导疾病、心肺代谢综合征及神经退行性疾病中,单层生物标志物日益不足以解释表型异质性,这推动了整合多分子层面的多组学(multi-omics)策略。小分子代谢物与脂质种类作为整合生理学的敏感指标,反映通路通量、器官串扰、炎症状态及暴露史。然而,代谢物生物标志物面临队列效应、平台偏移、饮食/药物诱导的混杂以及临床现实环境中外部验证有限等常见陷阱。转录组生物标志物正从批量表达谱扩展到空间解析及单细胞读数,在保留组织架构与细胞状态背景的同时增强生物学可解释性。蛋白质组生物标志物因蛋白质及翻译后修饰(post-translational modifications, PTMs)更接近信号执行而极具相关性,但面临显著的分析复杂性与可重复性挑战。机制锚定(通路、细胞程序)与正交验证(独立平台、靶向检测)是实现真实世界应用的必要条件。
细胞与免疫生物标志物:免疫组库、单细胞状态、细胞因子程序与中性粒细胞胞外陷阱
细胞生物标志物反映了从“单分子因果”向紊乱细胞状态与组织生态系统的转变。单细胞分析能够区分免疫激活、耗竭、谱系转变及炎症程序,这些常跨越经典诊断类别。空间技术进一步保留组织背景,对依赖细胞邻域、屏障界面、微血管生态位或肿瘤-免疫地理学的病理至关重要。免疫组库提供跨感染、癌症、自身免疫及移植的适应性免疫动态定量特征,而细胞因子程序与固有免疫状态作为宿主反应的整体生物标志物。中性粒细胞胞外陷阱(neutrophil extracellular traps, NETs)是跨疾病炎症生物标志物轴的具体实例:它们将固有免疫激活与血管损伤、血栓形成及组织损伤相关联,并在系统性自身免疫与自身炎症疾病中具有明确治疗意义。细胞生物标志物很少是稳定的标量变量,而是成分性、状态依赖且背景敏感的,因此转化稳健性要求将生物学信号与技术变异(分割效应、解离伪影、抗体 panels、空间分辨率限制)仔细分离。
循环生物标志物:cfDNA/cfRNA、循环蛋白质/代谢物、液体活检范式
循环生物标志物提供对疾病生物学的微创访问,对纵向监测尤其有价值。游离细胞DNA(cell-free DNA, cfDNA)或RNA(cfRNA)及循环肿瘤DNA(circulating tumor DNA, ctDNA)可支持早期检测、微小残留病监测、反应评估及克隆演化追踪。其临床价值高度依赖前处理流程、分析灵敏度及临床背景(肿瘤负荷、脱落率、治疗时机)。在非肿瘤疾病中,循环蛋白质与代谢物因检测成熟度与实施可行性仍占临床主导地位,但常反映下游生理而非近端因果机制,导致在伴随疾病、药物及谱系效应干扰基线分布时泛化能力差。跨模态整合(如将循环信号与影像或组织来源分子状态配对)可在严格验证且避免泄漏的前提下改善生物学可解释性与稳定性。
细胞外囊泡/外泌体作为生物标志物载体
细胞外囊泡(extracellular vesicles, EVs)包括外泌体与微泡,携带反映细胞状态与细胞间通讯的多分子载荷,处于分子与细胞生物标志物的交叉点。然而,EV转化为生物标志物仍受限于分离方法异质性、共分离污染物(包括脂蛋白)、定量标准不一及实验室间缺乏共识。国际细胞外囊泡学会更新的MISEV2023共识指南扩展了从基础到先进方法的最低信息标准。对AI辅助发现而言,EV是高机会但高风险的模态:信号丰富且多层,但特征域对前分析变异高度敏感,使其成为验证阶梯(外部重复、稳定性分析、生物学锚定验证)的强测试案例。
影像生物标志物:影像组学、功能成像、定量影像流程
影像生物标志物在器官尺度实现组织结构与功能的非侵入性表型分析,可编码纤维化架构、血管重塑、代谢活性及病灶空间分布等临床相关异质性。影像组学(radiomics)与计算影像方法系统化了这一量化,但真实世界实施需严格控制扫描仪变异、采集协议、分割流程及跨中心协调。重要进展是“基础模型就绪”的影像生物标志物发现:在大规模影像数据集上预训练的自监督模型可学习可迁移特征表征,再适应特定生物标志物任务。然而,大规模验证仍是影像组学生物标志物的限制步骤,尤其在免疫治疗反应预测等高风险情境中,影像生物标志物只有在生物学锚定与前瞻性证据支持下才能成功。
数字生物标志物:可穿戴设备、被动感知、数字表型及与结局的关联
数字生物标志物源自可穿戴设备、智能手机及环境传感器产生的连续或高频数据流,将生物标志物科学扩展到计算生理学与行为表型分析,支持睡眠、活动能力、自主神经生理及症状动态的纵向监测。其转化吸引力在于可扩展性与时间分辨率。然而,“数字生物标志物”概念仍具异质性,定义差异直接影响研究设计、验证及临床获益声明。设备异质性、数据不完整性、行为混杂及社会经济偏差构成真实世界技术挑战,数字生物标志物在与可解释的生理构念或功能性结局匹配,并在现实应用条件下而非受控研究环境中证明可靠性时最具防御性。
“生物学合理性”框架:区分因果、机制与相关性生物标志物
生物学合理性是转化的守门人。许多生物标志物是追踪疾病负担但不参与疾病机制的预测性相关,此类标志物在风险分层等场景仍有临床用途,但当机制假设被夸大时,作为治疗指导或替代终点常失败。实用性合理性框架强调以下维度:跨队列与平台的一致性;与疾病进展的时间对齐;剂量-反应行为;对生物学过程而非技术伪影的特异性;以及与已知通路、细胞程序及组织背景的一致性。更强的机制支持来自遗传关联、扰动证据、信号空间定位及与因果假设匹配的纵向动态。
人工智能方法用于生物标志物发现
高维生物标志物数据的经典机器学习
许多生物标志物发现场景本质上是“小样本、大变量”情境。经典机器学习方法(正则化回归、支持向量机(support vector machine, SVM)、树集成、稀疏特征选择)因提供强归纳偏置并可配合稳定性分析而保持实用价值。其优势在不仅预测而且生成适合正交验证的候选列表时最为明显。然而,此类环境极易因泄漏、重复调参及结局选择而产生乐观预测,严格训练/验证分离与嵌套评估必不可少。另一个局限是可解释性膨胀:特征显著性或系数大小常被视为生物学证据,即使相关特征可互换且学习到的特征不唯一。
组学与单细胞数据的深度表征学习与自监督学习
深度学习(deep learning, DL)在生物标志物信号分布式非线性或输入非天然表格化(如阵列、图像、图)时最具优势。表征学习中模型学习捕捉生物学结构的可复用嵌入向量,可在有限标签下适应下游任务。在单细胞基因组学中,自监督学习(self-supervised learning, SSL)已成为利用大规模无标签数据的主要方式,但其收益并非跨任务均匀:SSL在需要跨批次、组织或实验设置迁移且下游任务标签有限时最有帮助。SSL不应被视为通用升级,其价值取决于预训练目标是否与生物学不变性对齐、批次结构是否主导嵌入空间、以及学习表征是否改善泛化而非仅压缩技术变异。
组学、影像与临床数据中的多模态学习
临床生物标志物很少孤立存在,常与影像、实验室值、纵向临床病程及文本背景联合解读。多模态机器学习旨在形式化这一整合,学习跨数据类型互补信息同时避免朴素拼接的陷阱。现代多模态流水线常以合并策略(早期、中期或晚期合并)定义,该选择极大影响缺失数据容忍度及能否学习跨模态交互。跨模态迁移学习尤为重要:利用大规模电子健康记录(electronic health records, EHR)数据集预训练组件,再迁移至配对的组学与临床小队列。多模态模型应围绕现实临床数据可用性(部分模态覆盖、异步采样、可变质量)设计,而非理想化的完整病例假设。
图神经网络与知识引导学习
许多生物标志物相关关系天然是关系型的,包括蛋白质-蛋白质相互作用、调控网络、细胞间通讯、通路图及基因-变异-药物-表型的多模态关联。图神经网络(graph neural networks, GNNs)支持在此类非欧几里得结构上学习,在单细胞任务中快速扩展。其对生物标志物发现最重要的优势是添加结构先验,可约束假设空间并在有限样本量下提高稳健性。机制感知架构显式编码信号或通路结构以鼓励生物学合理的计算,通过约束信息流经结构化交互图并配解释模块定位预测负责的图子结构,对靶点发现与治疗分类尤其有吸引力。
基因组学与生物医学中的基础模型与大规模预训练
在大规模生物数据上训练的基础模型正重塑生物标志物发现。基因组学中,以自监督目标训练的DNA“语言模型”可学习序列表征,改善分子表型与变异效应的下游预测。基础模型通过两种方式改变生物标志物工作流:一是减少对任务特异性标注数据集的依赖,支持有限监督下的微调或适配;二是推动从手工特征向学习表征的转变,改善泛化能力但增加审计需求——预训练语料库可编码批次、祖先或中心信号,除非显式控制,否则会以“生物标志物”形式出现。
用于生物标志物机制与靶点发现的生成式与模拟辅助方法
生成建模为生物学锚定的假设生成提供路径。在生物标志物发现中,生成模型可用于模拟反事实分子状态、预测扰动反应或提出与观察表型一致的分子模式。最可信的用途是与扰动数据集、因果结构或显式生物学约束相关联的,因为无约束生成可产生看似合理但缺乏科学基础的输出。生成与模拟辅助输出应默认视为假设生成而非证据。在验证阶梯中,此类模型主要在发现阶段贡献候选特征、潜在结构、通路假设或推定机制,超越此阶段需正交确认:内部分析一致性及防泄漏/记忆保护、跨独立数据集或中心的外部重复、扰动/亚组偏移/替代预处理流水线下的稳健性测试,以及证明生成假设改善临床有意义决策而非仅产生生物学合理结果。
可解释性、不确定性与“虚假机制舒适感”的风险
可解释性在生物标志物发现中至关重要,因为输出很少是最终决策,而是须经生物学验证的候选假设。然而,解释方法若被当作机制证据而非诊断工具,可制造虚假信心。事后可解释性对分诊与审计有用,但对相关特征、模型不可识别性及数据集偏移敏感,这些条件在组学中常规存在。实用原则是将可解释性视为须重复的证据:相同特征/通路是否在重采样、跨队列、跨平台及扰动下出现?解释应尽可能针对正交实验(如CRISPR扰动、蛋白质组验证、靶向检测)进行检验。
生物标志物类型与方法选择作为转化目标函数
没有单一AI方法对所有生物标志物模态最优。经典机器学习在小队列表格组学中仍强,尤其当优先可解释性与稳定性时;深度学习在输入高维结构化(阵列、图像、图)或有迁移学习/预训练可用时最合理;多模态学习在临床行动依赖异质证据流整合时不可或缺;图/知识引导学习在生物学先验能有效约束假设空间时最有价值。核心要求是方法选择与预期声明对齐——预测富集、诊断区分、生物学锚定的通路提名、靶点发现或治疗反应分类——每种声明需要不同证据标准,且被不同失败模式削弱。
机制性AI:将生物标志物映射至通路、靶点与治疗假设
从相关性特征到机制假设
大多数AI衍生生物标志物本质上是相关性的:它们识别与结局关联的模式,但不说明模式为何发生。相关性生物标志物虽有临床用途,但在指导治疗、预测反应机制或作为替代终点时脆弱。机制性生物标志物发现需要额外约束将特征与生物学过程关联。机制解释应整合计算证据与生物学合理性、扰动一致性及通路连贯性,而非仅依赖模式可解释性技术。
知识引导与通路约束的神经架构
一种机制建模方法直接将编译的生物学信息(信号通路、转录调控网络、代谢图)嵌入神经网络拓扑。节点对应基因或蛋白质,边反映已知相互作用,将信息流限制在生物学有意义的通路上。此类设计在样本量有限时增强可解释性与稳定性,因先验生物学信息降低模型灵活性。然而,通路数据库不完整、背景依赖且有时相互矛盾,因此知识引导模型应视为假设生成器而非确定性因果证据,并辅以允许发现新相互作用的数据驱动组件。
基于扰动的学习与因果信号识别
扰动数据集(CRISPR扫描、药物反应检测、细胞因子刺激实验)为分离因果因素与下游相关性提供关键杠杆。将预测学习锚定至经整理的生物学结构与实验扰动,可提供特征与可行动通路之间更可检验的桥梁。机制引导的图模型展示如何使生成或预测学习锚定于生物学结构,使特征归因与因果假设对齐而非仅产生事后叙述。