综述:人工智能在传统中医药中的应用:从多模态数据整合到药理研究与临床决策支持

《Pharmacological Research - Modern Chinese Medicine》:Artificial Intelligence in Traditional Chinese Medicine: From Multimodal Data Integration to Pharmacological Research and Clinical Decision Support

【字体: 时间:2026年07月05日 来源:Pharmacological Research - Modern Chinese Medicine CS3.4

编辑推荐:

  背景:传统中医药(Traditional Chinese Medicine, TCM)正日益与人工智能(artificial intelligence, AI)相融合,为数据驱动的研究、智能诊断、药物发现以及传统医疗系统的现代化创造了新的机遇。本综述总结了AI

  
背景:传统中医药(Traditional Chinese Medicine, TCM)正日益与人工智能(artificial intelligence, AI)相融合,为数据驱动的研究、智能诊断、药物发现以及传统医疗系统的现代化创造了新的机遇。本综述总结了AI赋能的TCM研究的最新进展,并强调了当前的挑战和未来方向。方法:采用结构化文献检索策略,使用PubMed、Google Scholar和SpringerLink数据库,检索时间为2010年1月至2025年1月期间发表的研究。布尔检索策略结合了传统中医药、机器学习(machine learning, ML)、深度学习(deep learning, DL)、自然语言处理(natural language processing, NLP)、知识图谱(knowledge graphs)和大语言模型(large language models, LLMs)等相关术语。筛选了与AI在TCM中应用相关的合格的中英文出版物,并进行了定性综合。结果:检索到的文献表明,AI应用在四个主要领域快速增长:多尺度TCM数据资源、AI驱动的研究与开发、AI辅助诊断和治疗以及大语言模型。AI方法已应用于辨证论治、舌诊和脉诊分析、处方推荐、质量控制、网络药理学(network pharmacology, NPM)、靶点预测和多模态知识整合。然而,在数据异质性、标准化、外部验证、可解释性、隐私和临床安全性方面仍存在局限性。结论:AI在加速TCM的现代化和全球转化方面具有巨大潜力,但成功实施将需要标准化的数据集、可解释的模型、前瞻性临床验证、强有力的治理以及与现有医疗系统的整合。未来进展预计将通过多模态学习、检索增强生成(retrieval-augmented generation, RAG)和以临床医生为中心的决策支持框架实现。
引言
传统中医药(Traditional Chinese Medicine, TCM)是一个古老的民族药理学体系,具有丰富的临床经验和大量天然治疗资源。TCM数据具有多维特征、大规模样本量和整体系统视角,这些特征使TCM区别于常规生物医学数据,同时也为计算解释带来了机遇和挑战。生物医学大数据技术的进步为多尺度TCM数据的标准化和整合奠定了坚实基础。高通量实验技术、多组学方法和网络药理学(network pharmacology, NPM)显著提高了组织、分析和解释多层次TCM信息的能力。智能计算方法与TCM大数据的结合在多个应用领域显示出巨大潜力,包括处方优化、草药质量评估以及先进AI技术的应用。代表性研究证明了AI在TCM研究和临床应用中的实用价值,例如基于人工神经网络(artificial neural network)的深度学习(deep learning, DL)模型用于预测副作用和优化处方选择,基于自然语言处理(natural language processing, NLP)的模型用于量化TCM处方的疗效,以及针对广泛TCM数据集训练的大语言模型(large language models, LLMs)在提取和组织领域特定知识方面表现出色。多模态TCM数据的日益可用促进了TCM与AI研究界之间的深入合作。本综述系统总结了多尺度TCM知识库,并重点介绍了AI赋能TCM研究和实践的主要应用场景,特别强调LLMs在推进TCM智能化、数据驱动现代化中的作用。
方法
本范围综述遵循系统综述和荟萃分析优先报告条目(Preferred Reporting Items for Systematic Reviews and Meta-Analyses, PRISMA)指南以确保系统严谨性和透明度。主要步骤包括:数据库选择、基于关键词的文献检索、去重、标题和摘要筛选、全文资格评估、标准化数据提取和纳入研究的主题综合。检索使用PubMed和中国知网(China National Knowledge Infrastructure, CNKI)数据库,检索期限为2010年1月1日至2025年1月30日。检索聚焦于四个核心领域:TCM多尺度数据资源、人工智能驱动的TCM研究与开发、AI辅助TCM诊断和治疗以及与TCM相关的生成式预训练变换器(generative pre-trained transformer)模型。采用组合关键词以最大化覆盖范围。两名独立评审员筛选标题和摘要,随后根据预先定义的资格标准评估全文文章,分歧通过讨论或咨询第三位评审员解决。使用Microsoft Excel 2021开发的标准化表格提取相关数据,包括文章标题、第一作者、出版年份、参考文献详情、研究设计和具体使用的TCM数据库。提取由两名调查员独立完成,分歧通过共识解决。纳入的研究进行描述性总结,TCM数据库分为两大类:多尺度TCM数据资源和与中国TCM相关的多组学数据资源。根据既定范围综述方法学,未对单个研究进行正式的质量评估。
文献检索策略
在PubMed和CNKI中进行结构化文献检索,检索期限从2010年1月1日到2025年1月30日。针对人工智能在TCM中的多个领域,开发了针对数据资源、AI辅助诊断、药物发现和LLMs的特定主题检索策略。PubMed的核心布尔检索策略包括:“Traditional Chinese Medicine” OR TCM OR “Chinese herbal medicine” AND “artificial intelligence” OR AI OR “machine learning” OR “deep learning” OR “neural network” OR “knowledge graph” OR “natural language processing” OR NLP OR “large language model*” OR LLM OR ChatGPT OR transformer。CNKI使用了等效的中英文关键词。还进行了针对新兴主题的额外集中检索,如LLMs和临床AI。语言限制为英文和中文出版物,符合条件的文件类型包括原创研究文章、综述、数据库报告和方法学研究。排除社论、信件、重复记录、缺乏足够信息的会议摘要、无法访问的全文以及与TCM或AI应用无关的非相关出版物。还手动筛选了关键论文的参考文献列表以确定其他相关研究。
TCM的多尺度数据资源
计算和生物医药信息学的进步大大扩展了与TCM相关的数据的深度和多样性,使复杂知识的系统组织和大规模分析成为可能。当代TCM数据库通过将处方、单味草药和临床症状与疾病、分子靶点和生物通路联系起来,充当传统医学知识与现代生物医学科学之间的关键接口。这种多层次整合为应用基于人工智能的分析方法研究TCM提供了基础。大多数TCM数据库采用标准化的多层数据管理和质量控制策略,权威的国家参考标准如《中华人民共和国药典》(2020年版)和《第四次全国中药资源普查》通常用作主要数据源。数据库如ETCM 2.0和TCMSP通过记录统一的中文和拉丁名称、植物来源和药用部位来标准化草药信息。化学成分数据通常使用国际公认的标识符进行注释,如PubChem化合物标识符(Compound Identifiers, CID)和InChIKeys,从PubChem、ChEMBL和ChemSpider等数据库获得。此外,化合物靶点和疾病相关基因的信息从DrugBank和Binding DB等资源中整理,而疾病基因关联则从MalaCards、人类表型本体(Human Phenotype Ontology)、OMIM和DisGeNET数据库中整合。除了结构和生物学注释外,还使用已建立的计算模型预测或计算药代动力学和类药性特性,包括分子量、亲脂性、氢键参数、口服生物利用度、半衰期和血脑屏障通透性。多尺度TCM数据库在促进证候标准化、TCM理论现代化和治疗创新方面也发挥了关键作用。平台如LTM-TCM、ETCM 2.0和TCMSSD提供了广泛的注释,将传统概念与现代生物医学解释联系起来,并已广泛应用于机制研究和药物发现研究。此外,还开发了针对疾病的TCM数据库以支持特定临床背景下的靶向研究,包括抗COVID-19治疗(TCM2COVID)、免疫肿瘤学(TCMIO)和阿尔茨海默病(TCM-ADIP)。几个数据库强调从文献中挖掘草药-化合物-靶点关系和药理转录组数据。资源如DCABM-TCM、TM-MC 2.0、TCMBank、HIT 2.0和HERB整合了实验证据和大规模文献整理,以促进生物活性成分的识别及其分子机制。其他平台如TCM-Mesh和TCM-Suite不仅记录了处方、草药、成分、靶点和疾病之间的关联,还提供内置工具用于自动化网络药理学分析,实现机制探索、天然产物筛选、配伍分析和网络可视化。同时,基因组学和多种组学数据库的发展显著增强了研究TCM分子基础的能力。这些资源整合了与药用植物和草药配方相关的基因组、转录组、蛋白质组和代谢组数据,为天然产物发现、靶点识别和质量控制提供了宝贵支持。总体而言,多尺度和多组学TCM数据资源的不断扩展和整合为解读TCM疗法背后的复杂机制提供了坚实的基础。
AI与多尺度数据在TCM研发中的整合
人工智能技术与多尺度TCM数据的融合极大地改变了该领域的研究和开发策略,特别是在发现生物活性天然产物和阐明其分子机制方面。通过整合化学、生物、药理学和临床数据集,AI驱动的方法为解读TCM配方及其治疗效果背后的复杂相互作用提供了系统框架。这个数据驱动范式不仅增强了机制理解,而且加速了新候选药物和靶点的识别。尽管代表性多尺度数据资源存在差异,但在范围、更新频率、管理质量和转化效用方面存在实质性差异。大型综合数据库如TCMSP、ETCM、HERB和SymMap通常提供更广泛的草药、化合物、靶点和疾病关联的覆盖,使其在网络药理学和系统水平研究中非常有用。临床导向的资源可能对处方分析和证候研究提供更强相关性,而较小或专门的数据库可能提供特定草药或分子机制的更深入注释。然而,一些平台仍然受到条目过时、验证不完整、命名法异构、对已充分研究草药的发表偏倚以及与实际临床结果联系不足的局限。因此,数据库的选择应取决于预期的研究问题,优先考虑最近更新和透明管理的资源。
天然产物靶点发现
识别天然产物的分子靶点是理解TCM处方药理学基础和促进现代药物开发的关键步骤。AI赋能的策略通过结合机器学习(machine learning, ML)、深度学习(deep learning, DL)、配体相似性筛选、药效团建模、基因表达谱、网络推断、CRISPR筛选和单细胞多组学技术,扩展了传统的靶点发现方法。这些互补的方法能够更全面的靶点预测和通路分析,从而桥接传统经验知识和现代分子药理学。基于配体相似性的方法仍然是天然产物靶点预测的常用方法,数据库和工具如Swiss Target Prediction和SuperPred利用二维和三维结构相似性推断潜在蛋白靶点。基于ML和DL的配体预测模型已经发展到更高的准确性和可扩展性。TCMSP数据库采用系统动力学与治疗(Systems Dynamics and Therapeutics, SysDT)模型,该模型集成了随机森林和支持向量机算法来预测化合物靶点相互作用。DL框架如DeepPurpose和DeepDTA通过支持多种数据输入格式和建模化合物与靶点之间的复杂非线性关系进一步提高了预测性能。多组学驱动的方法也成为靶点发现的强大工具,与TCM的整体和系统哲学相一致。单细胞和批量多组学分析整合了基因组、转录组、蛋白质组和代谢组数据,以前所未有的分辨率揭示靶点通路和生物学效应。网络推断方法通过建模化合物、靶点、疾病和生物通路之间的复杂相互作用提供了额外的洞察层。通过构建分子相互作用网络,这些方法能够系统预测天然产物的新靶点和治疗适应症。尽管每种方法各有优势,但它们也存在固有的局限性,涉及数据覆盖、模型可解释性、实验成本和网络完整性。因此,TCM研发中的最佳靶点发现通常需要整合多种AI赋能的方法并结合实验验证以确保可靠性和转化相关性。
虚拟筛选
天然产物长期以来一直是治疗药物的主要来源,TCM衍生的成分在现代药物发现中继续发挥关键作用。然而,传统的高通量实验筛选方法通常劳动密集、昂贵且耗时。基于人工智能(AI)的虚拟筛选(virtual screening)策略的整合显著加速了从天然产物库中识别有希望的药物候选物。基于结构的虚拟筛选(structure-based virtual screening, SBVS)受益于蛋白质结构预测技术的最新进展。AlphaFold3的引入大大提高了三维蛋白质结构的准确性和可用性,使得更可靠的对接分析和靶向筛选工作流程成为可能。基于配体的虚拟筛选(ligand-based virtual screening, LBVS)代表了一种不需要详细靶点结构信息的替代策略。这种方法包括药效团建模、亚结构和片段搜索、定量构效关系(quantitative structure-activity relationship, QSAR)建模、分子指纹匹配和基于ML/DL的预测技术。除了结构和配体策略外,整合多组学数据和药代动力学过滤的虚拟筛选方法也日益受到关注。数据库如ETCM 2.0、BATMAN-TCM 2.0和HERB为组学驱动的筛选和吸收、分布、代谢、排泄和毒性(absorption, distribution, metabolism, excretion, and toxicity, ADMET)过滤提供了宝贵资源。混合筛选策略整合SBVS和LBVS已证明通过利用两种方法的互补优势增强了预测性能。AI驱动的组合药物筛选的最新发展进一步扩展了虚拟筛选在联合疗法中的应用。
TCM质量控制
与常规西药相比,TCM的特点是涉及多成分、多靶点和协同相互作用的复杂治疗系统。这种内在复杂性代表了TCM的核心优势,但也对建立标准化、准确和符合理论的评价体系提出了重大挑战。中药的药理作用与其传统药性密切相关,包括四气(寒、凉、温、热)、五味(辛、甘、酸、苦、咸)、归经和毒性特征。AI的最新进展使得这些传统上定性的概念的定量建模成为可能。深度学习预训练策略已应用于大规模TCM配方数据集,通过学习来自草药组成和传统理论的复杂特征表示来预测药性和治疗效果。机器学习方法使用分子指纹和ADME相关特征来识别与归经相关的关键化学决定因素。图神经网络(graph neural networks, GNNs)模型已被开发来捕捉化合物的局部和全局结构特征,揭示草药成分与其相应归经之间的潜在关联。除了内在药性外,TCM的质量受到采收条件、炮制技术、真伪鉴定和质量标志物(quality markers, Q-markers)确定的强烈影响。AI驱动的生物信息学方法为研究这些因素如何影响草药成分和功效提供了新工具。整合基因组、转录组和表观遗传数据的综合分析已成功用于建模药用植物的关键农艺性状,证明了多组学方法进行质量评估的可行性。基于代谢组学的研究进一步揭示不同的炮制和水煎方法可显著改变草药化学成分。此外,基于自然语言处理(NLP)的模型已用于预测最佳炮制和水煎持续时间。TCM配方代表多成分系统,其中治疗效果来自活性成分或功能部分的集体贡献。AI赋能的策略整合深度学习、网络药理学、多组学分析和虚拟筛选已显著加速了Q-markers的发现。总之,将AI技术纳入TCM质量控制实现了从基于经验的评价向数据驱动、机制导向评估的转变。
诊断和治疗
TCM诊断主要基于四种经典诊断方法:望、闻、问、切。这些方法强调全面评估外部表现,如面色、舌形态、身体姿势、声音特征和呼吸音,以及评估内脏功能以确定疾病模式并指导个体化治疗策略。AI在提高初步和回顾性研究的诊断准确性方面显示出潜力。随着AI的快速进步,特别是知识图谱构建、卷积神经网络和基于变换器的架构,数据驱动的诊断系统能够从大规模TCM数据集中学习,并产生可与专家级表现相当或超过的诊断结果。这些技术减少了主观偏见,支持更精确和个性化的处方决策,从而提高了临床可靠性和一致性。症状辨证是TCM诊断和治疗的核心原则,服务于个性化治疗干预的基础。现代生物医学研究同样认识到阐明症状-疾病关系对理解疾病机制和识别治疗靶点的重要性。AI驱动的方法能够通过整合TCM理论与临床和分子数据来系统建模这些关系。知识发现方法利用电子病历、经典文本和管理数据库来提取症状、证候和疾病之间的潜在关联。AI技术还被广泛应用于四诊参数的定量分析。在望诊中,深度学习模型经过训练可从医学图像中识别舌形、颜色、纹理和苔特征,在症状分类和辅助早期疾病筛查中实现高精度。在脉诊中,机器学习和深度学习算法被用于分析脉搏波信号,提高脉诊分类和疾病预测的客观性和可重复性。此外,多标签学习和信号处理技术已被引入来分析闻诊和问诊数据,支持临床环境中语音、声音和症状询问模式的标准化建模。TCM处方通常根据君臣佐使的层次配方原则构建。网络药理学(network pharmacology, NPM)已有效促进针对特定疾病的草药配方靶向筛选。AI驱动的方法已广泛应用于TCM-症状关联分析、TCM治疗现代药理机制调查和TCM知识与电子健康记录(electronic health records, EHRs)数据的整合。几个计算平台已被开发来支持数据驱动的处方推荐。例如,SoFDA和ETCM 2.0采用基于相似性的算法,包括Jaccard和余弦相似性度量,来辅助疾病诊断和推荐具有可比治疗效果的处方、草药或成分。类似地,SymMap平台利用统计测试方法根据其预测的治疗相关性优先排序和过滤候选成分。同时,ML和DL模型整合TCM知识库、症状描述和临床数据,使用嵌入技术编码异构信息,并使用自然语言处理(NLP)方法定量表示不同的TCM概念。代表性深度学习系统进一步证明了真实世界数据整合的有效性。FordNet是一个处方推荐框架,训练于从超过20,000份电子健康记录中提取的表型信息。此外,结合症状文本数据与结构化临床数据集已被证明可提高生成处方的专业性和临床相关性。TCMM数据库结合了知识图谱增强和多跳推理以支持处方生成和症状相关靶点预测。此外,双分支引导策略结合候选注意力模型(dual-branch guidance strategy combined with a candidate attention model, DGSCAM)从症状-处方数据对中提关键特征。考虑到TCM诊断也严重依赖症状辨证分析,包括面部和舌象,基于视觉变换器(visual transformer)架构和多标签分类的多草药推荐框架从真实面部和舌图像生成处方模式,密切模仿真实的临床实践。
TCM导向的大语言模型(LLMs)
TCM包含了一个庞大而复杂的知识体系,源自古代医学文本、现代临床记录、实验证据和分子机制研究。将这一知识与当代人工智能技术,特别是大语言模型(large language models, LLMs)相结合,为推进TCM研究和临床实践创造了新机会。LLMs能够从非结构化文本数据中进行大规模表示学习,并为知识提取、推理和生成提供强大工具,从而支持跨多个TCM场景的智能应用。自然语言处理的最新进展由大型预训练变换器模型驱动,包括GPT、BERT、RoBERTa、T5和DeBERTa,这些模型最初在广泛的一般语言语料库上训练,随后针对特定领域任务进行微调,如问答、对话系统和知识检索。通过采用预训练和基于指令的微调范式,以及检索增强生成(retrieval-augmented generation, RAG)策略,这些模型可以有效适应TCM的专业语言和概念特征,同时最小化重新训练所需的计算资源。几个专门为TCM定制的大语言模型已被开发出来,以支持知识查询、临床决策辅助和处方推荐。例如,TCMChat是使用涵盖多个标准化TCM场景的定制数据集构建的,包括知识库查询、阅读理解、实体识别、医疗案例诊断和草药或配方推荐。建立在Baichuan2-7B-Chat基础模型之上,并通过预训练和监督微调进行改进,TCMChat在多种评估指标中表现出良好的性能。类似地,Lingdan-TCM-Chat和Lingdan-PR使用大量经典医学文本、教科书和临床数据进行微调,以提高临床问答和处方指导的准确性。LLMs在实际临床对话和辅助诊断应用中也显示出有希望的结果。MedChatZH使用基于LLaMA框架的变换器解码器架构开发,在中国医学文献上预训练,并使用精心策划的医学指令数据集进行微调。该模型在ROUGE和相关指标评估中优于几个基线对话系统。此外,图形增强和特定领域的LLM框架,如OpenTCM、CPMI-ChatGLM和ZhongJing,整合了结构化知识图谱、带注释的处方记录和专有医学数据集,旨在提高推理准确性、信息检索和交互式咨询能力。超越基于文本的应用,多模态大语言模型的最新进展为TCM创造了新机会。通过整合文本数据与舌图像、面象图像、脉搏波信号、语音录音和电子健康记录,多模态LLMs可以更好地模拟TCM的四诊方法。然而,尽管这些领域适应的LLMs展示了令人鼓舞的进展,但其当前评估应谨慎解释。幻觉现象可能产生看似合理但不正确的证候解释、处方或草药-药物相互作用建议。许多模型输出缺乏可追溯性,使临床医生难以验证建议是否基于权威证据。基准膨胀可能发生,当性能指标来源于不反映现实世界复杂性的狭窄或内部构建的数据集时。此外,训练语料和评估语料之间的领域数据污染和重叠可能高估泛化能力。独立外部验证跨机构、患者群体和临床环境仍然有限。医生-模型一致性是另一个关键考虑因素,因为可接受的语言响应仍可能与专家临床推理不同。因此,未来的TCM LLM评估框架应扩展到准确性指标之外,包括可解释性、来源引用、不确定性报告、安全边界测试、隐私保护和临床医生参与可用性研究。RAG知识基础响应和治理机制可能有助于减轻一些风险,但这些系统应主要被视为决策支持工具而非自主临床代理。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号