炎症相关胃癌表观遗传学的全球知识结构与主题演化:基于多数据库科学图谱、嵌套潜在狄利克雷分配与独立非负矩阵分解验证的研究

《Frontiers in Immunology》:Global knowledge structure and thematic evolution in inflammation-associated gastric cancer epigenetics: a multidatabase science-mapping study with nested latent Dirichlet allocation and independent NMF validation

【字体: 大 中 小 】 时间:2026年09月25日 来源:Frontiers in Immunology 7.0

编辑推荐:

  摘要专业翻译 背景: 炎症相关的表观遗传调控将微生物暴露与慢性黏膜损伤同胃癌发生、免疫重塑、分子异质性及治疗耐药联系起来。既往科学图谱研究通常仅依赖单一文献数据库,可能引入特定平台所致的覆盖偏倚。 方法: 研究人员检索了Web of Science核心合集(W

  
摘要专业翻译 背景: 炎症相关的表观遗传调控将微生物暴露与慢性黏膜损伤同胃癌发生、免疫重塑、分子异质性及治疗耐药联系起来。既往科学图谱研究通常仅依赖单一文献数据库,可能引入特定平台所致的覆盖偏倚。 方法: 研究人员检索了Web of Science核心合集(WoSCC)、PubMed和Scopus,时间范围为2000年至2026年7月,检索词采用针对胃恶性肿瘤、炎症和表观遗传调控的协调概念。各数据库筛选后分别获得1,407条WoSCC、1,073条PubMed和1,935条Scopus记录。记录经协调处理,并按DOI、PMID、标准化标题、发表年份及作者信息去重。所得多数据库语料采用CiteSpace、VOSviewer和R进行分析。嵌套潜在狄利克雷分配(LDA)分析保留在内部一致的WoSCC子集上:1,406条记录经相关性筛选后,808条进入最终主题模型。作为独立稳健性分析,研究人员对全部2,933篇唯一出版物的标题与摘要文本应用了非负矩阵分解(NMF)。 结果: 三次检索共获得4,415条记录,去除1,482条重复后得到2,933篇唯一出版物。语料涵盖885种来源,年增长率为14.7%,2021年达到峰值346篇。标准化国家数据显示中国贡献最大(1,549篇),而美国具有最强的国际连通性(总链接强度[TLS]为405)。南京医科大学以70篇成为产出最多的机构,Toshikazu Ushijima以25篇成为最高产作者。多数据库关键词图谱识别出胃癌、microRNA、细胞增殖、信号转导、凋亡、炎症、DNA甲基化、肿瘤微环境、STAT3和长链非编码RNA为核心概念。突现检测显示早期集中于DNA甲基化、幽门螺杆菌和RNA干扰,随后出现跨癌种及功能性术语。基于WoSCC的六主题LDA模型在流行度上保持均衡(15.93%–18.26%),并显示幽门螺杆菌-炎症-癌前病变及DNA高甲基化-沉默主题显著下降,同时免疫-lncRNA、微生物群/病毒相关ncRNA及外泌体ncRNA-细胞因子主题增长。对完整多数据库语料的独立NMF分析恢复了大致一致的主题域,涉及幽门螺杆菌相关炎症、ncRNA相关信号、免疫与外泌体微环境过程以及DNA甲基化相关表观遗传调控。 结论: 多数据库整合显著扩展了可观察文献范围,并表明研究关注点正从感染相关甲基化广泛转向以ncRNA为中心、涉及免疫、微环境及耐药相关的调控系统。国家层面的合作比机构及作者层面的整合更为广泛。嵌套LDA分析量化了主题注意力的长期再分配,而对完整多数据库语料的独立NMF验证支持了主要主题域的稳健性。

论文解读

一、研究背景与问题

胃癌是一种由微生物暴露、慢性炎症、宿主易感性、体细胞改变及表观遗传重编程共同塑造的异质性疾病。表观遗传机制能够将环境及炎症信号转化为不改变DNA序列的持续性转录变化,涉及DNA甲基化、组蛋白修饰、染色质重塑及非编码RNA网络,进而影响恶性转化、谱系可塑性、免疫逃逸、侵袭、转移及治疗应答。过去二十余年间,该领域从早期集中于CpG岛高甲基化、启动子沉默及幽门螺杆菌慢性感染所致的表观遗传场缺陷,逐步扩展至EB病毒相关甲基化、分子分型、microRNA、长链非编码RNA、环状RNA、竞争性内源RNA网络、细胞外囊泡、肿瘤免疫及系统治疗耐药等方向。
然而,文献量的激增和机制多样性的扩大,使传统叙述性综述难以完整重建该领域的全球架构与时间演化。科学图谱技术可刻画出版增长、合作网络、关键词架构及新兴研究前沿,概率主题模型则能从标题、摘要和关键词中推断潜在主题。但既往科学图谱研究通常依赖单一文献数据库,而WoSCC、Scopus与PubMed在期刊收录、生物医学索引、作者地址结构及引文元数据方面存在差异,单一数据库设计可能过度代表特定平台的期刊或术语。因此,本研究旨在通过多数据库整合、嵌套主题建模与独立算法验证的三层互补分析框架,系统重建炎症相关胃癌表观遗传学的全球知识结构与主题演化,并评估主要潜在主题在不同分析层面的稳健性。

二、研究设计与主要技术方法

研究人员采用回顾性研究-on-研究设计,于2026年7月14日至21日检索WoSCC、PubMed和Scopus三个数据库,覆盖2000年1月1日至检索日期。检索策略采用协调概念块,分别涵盖胃恶性肿瘤、炎症及表观遗传调控,并以AND逻辑组合以提高概念特异性。纳入标准限定为英文期刊论文和综述,排除撤稿及撤稿通知。三个数据库分别导出1,407、1,073和1,935条记录。
去重采用分层策略,依次依据精确DOI匹配、精确PMID匹配、标准化标题加发表年份、以及结合第一作者和来源信息的高相似度标题匹配。重复组的互补元数据被合并而非丢弃,每条合并记录保留数据库来源标签。WoSCC和Scopus的引文计数分别保留,不进行加总。
分析工具包括CiteSpace 6.4.R2用于国家、机构和作者层面的合作网络分析,VOSviewer用于关键词共现、时间叠加和密度图谱,R用于描述性指标、增长曲线拟合和主题建模。嵌套LDA分析限定在内部一致的WoSCC子集,1,406条记录经相关性筛选后808条进入最终模型,文档-词项矩阵包含808篇文档、2,315个词项和77,004个非零条目。LDA模型在K=4至K=12间比较困惑度、UMass连贯性、最小主导主题规模、随机种子稳定性及实质性可解释性,最终选定K=6、种子7。独立NMF验证应用于全部2,933篇唯一出版物的标题与摘要共有文本字段,采用TF-IDF加权、坐标下降和Frobenius损失、NNDSVD初始化,以六分量方案作为匹配分辨率的对照。

三、主要研究结果

3.1 多数据库语料、重叠与出版增长
三次检索共获得4,415条记录,去重后得到2,933篇唯一出版物。其中614篇被三个数据库共同收录,253篇被恰好两个数据库共享,2,066篇仅被单一数据库收录。Scopus贡献最大的独有部分(1,118篇),其次为WoSCC(656篇)和PubMed(292篇)。出版物分布于885种来源,年产出从2000年的3篇增至2021年峰值346篇,估计年增长率为14.7%。探索性累积逻辑模型接近约3,228篇的渐近线,年度生命周期模型估计拟合峰值在2021.4附近,提示快速扩张后可能转向成熟期,但近期下降需谨慎解读,因2026年为部分年份且存在索引滞后。
3.2 国家与地区合作
国家网络包含175个节点和76条链接,密度为0.005,最大连通分量含47个节点。中国以1,549篇成为最大贡献者,美国以413篇居次,其后为日本、伊朗、意大利等。美国具有最高总链接强度(TLS=405),而中国为240,表明出版体量与国际连通性并不等同。英国、伊朗、德国和意大利也显示出相对产出的较强协作连通性。
3.3 机构合作
机构网络包含216个节点和87条链接,密度为0.0037,最大连通分量仅含10个节点,是最为碎片化的合作层级。南京医科大学以70篇居首,其后为中南大学、伊斯兰阿萨德大学、山东大学等。伊斯兰阿萨德大学在领先机构中具有最高TLS(204),日本国立癌症中心平均出版年份较早(2013.39),与其在胃黏膜甲基化和幽门螺杆菌相关表观遗传风险研究中的长期贡献一致。
3.4 作者生产力与合作
作者网络包含265个节点和95条链接,密度为0.0027,最大连通分量含17位作者。Toshikazu Ushijima以25篇成为最高产作者,其次为Milad Ashrafizadeh和Ali Zarrabi各20篇。Zarrabi具有最高TLS(108)。早期平均出版年份表征了与经典甲基化和胃黏膜风险研究相关的作者,而多个高连通ncRNA团队的平均出版年份在2021年之后。
3.5 关键词架构与主题热点
多数据库关键词网络显示密集的概念核心,将胃癌与ncRNA调控、细胞增殖、信号转导、凋亡、基因表达、炎症、DNA甲基化、转移及肿瘤微环境相连。标准化词频以胃癌(2,613篇)、microRNA(1,301)、细胞增殖(922)、信号转导(871)和凋亡(799)领先。时间叠加显示幽门螺杆菌和DNA甲基化的平均出版年份较早,而肿瘤微环境、细胞迁移、上皮-间质转化、lncRNA、IL-6及耐药相关术语集中于近年。
3.6 关键词突现与研究重点变化
25个最强突现词追溯了早期对胃病索引、实验模型、感染和表观遗传调控的重视。最大突现强度见于priority journal(99.85;2004-2020)、humans(82.60;2003-2014)、cell line(61.35;2007-2018)、Helicobacter pylori(53.73;2003-2015)、RNA interference(51.93;2008-2018)和DNA methylation(47.18;2001-2013)。中期包括NF-kappa B、upregulation、proliferation等信号和恶性表型相关词。最近突现为非小细胞肺癌、胶质母细胞瘤和胶质瘤等跨癌种术语,反映方法转移和索引溢出而非胃癌特异性主题更替。
3.7 LDA模型选择与分配特征
K=6被选为最终折中方案,此时困惑度为861.73,UMass连贯性为-1.544,最小主导主题规模为93篇文档(11.51%),平均随机种子稳定性为0.546。文档级诊断显示大量混合主题成员关系,中位主导主题概率为0.343,中位归一化熵为0.917,在保守审查阈值下94.06%的文档被标记为混合主题记录,这被解释为预期的主题重叠而非模型失败。
3.8 六个潜在主题与概率加权流行度
最终模型产生六个可解释主题:主题1为幽门螺杆菌驱动的慢性炎症与癌前黏膜进展;主题2为免疫相关lncRNA特征与预后分层;主题3为炎症相关DNA高甲基化与肿瘤抑制基因沉默;主题4为微生物群/病毒相关ncRNA调控与生物标志物及精准医学;主题5为ncRNA介导的STAT3/NF-kappa B信号在肿瘤进展与耐药中的作用;主题6为外泌体ncRNA-细胞因子串扰在免疫重塑、转移和干性中的作用。概率加权流行度在主题间均衡,主题5最大(18.26%),主题3最小(15.93%),2.33个百分点的范围表明多样化主题生态而非单一主导范式。
3.9 潜在主题的时间演化
纵向主题组成显示研究注意力分布发生显著转变。主题3在早期文献中占主导但大幅收缩,从早期约45%降至2026年约11%。主题1在2000年代中期达到峰值后下降。主题2在2010年代中期后增长最强,2020-2021年前后趋于平稳。主题4长期增长,2026年超过20%。主题6近年加速。主题5呈非单调轨迹,2019-2020年前后达到峰值后回落。
3.10 统计趋势
文档计数加权回归确认主题1和主题3显著下降,分别每十年下降5.62个百分点(95% CI,-7.62至-3.61;FDR校正P=1.00×10-5)和9.53个百分点(95% CI,-11.37至-7.69;FDR校正P=1.26×10-9)。主题2、4、6显著增长,分别每十年增加5.03、4.06和4.24个百分点。主题5每十年增加1.81个百分点,但置信区间跨越零,确认其升降轨迹不宜用单一线性斜率概括。
3.11 主题间相对关系
CLR调整分析显示主题5与主题6之间最强的正相关(r=0.22,P<0.001),将细胞内ncRNA-STAT3/NF-kappa B耐药机制与外泌体ncRNA-细胞因子及转移过程联系起来。主题1与主题3和主题4呈弱正相关。最强的负相对关联在主题1与主题5之间(r=-0.57,P<0.001),这些值代表固定六主题组成内的相对分配,不表示生物学拮抗或互斥。
3.12 独立多数据库NMF验证
对全部2,933篇出版物的标题和摘要应用六分量NMF,识别出六个可解释分量:ncRNA相关信号与治疗研究;增殖、迁移、侵袭及STAT3相关信号;幽门螺杆菌感染、炎症与胃癌发生;预后lncRNA与免疫相关谱;外泌体、免疫与肿瘤微环境相互作用;以及DNA甲基化、启动子高甲基化、CpG相关调控及EBV相关表观遗传过程。这些分量与WoSCC LDA模型恢复的主要生物学域广泛一致,但并非严格一一对应,表明独立NMF模型再现了主要主题域的同时以不同方式划分了某些跨领域概念。

四、讨论与结论总结

讨论部分指出,多数据库整合的核心价值不仅在于扩大文献覆盖,更在于证明数据库选择会实质影响可观察的文献计量结构,而主要主题域在独立分析途径中仍广泛可辨。仅614篇出版物被三个来源共同收录,Scopus贡献1,118篇独有记录,表明单一数据库分析会遗漏大量可观察文献。中国在出版体量上占主导,美国具有最强的国际连通性,而机构与作者层面的合作高度碎片化,最大连通分量仅分别占4.6%和6.4%,提示国际可见性与实验室间整合不足并存,可能助长重复的单中心生物标志物研究和不足的外部验证。
早期突现词及主题1和主题3的下降轨迹将幽门螺杆菌相关炎症、启动子高甲基化和肿瘤抑制基因沉默确认为该领域的基础范式,但其相对份额下降不应被解读为生物学重要性降低,而是这些机制已成为成熟解释框架,日益嵌入多组学分类、液体活检开发和风险分层。近年增长的主题2、4、6表明研究重点从孤立表观遗传病变转向相互作用的调控生态系统,ncRNA将转录调控与细胞因子信号、免疫细胞状态、上皮可塑性、细胞外囊泡通讯和药物应答相连。主题5与主题6的正CLR关联在生物学上合理,因为细胞内STAT3/NF-kappa B信号、IL-6家族细胞因子、外泌体货物、干性、转移和耐药常在整合机制研究中共同出现,但该关联是文献性和组成性的而非因果性的。
研究结论翻译如下:整合WoSCC、PubMed和Scopus产生了包含2,933篇出版物的语料库,并表明单一数据库分析将遗漏可观察文献的相当大比例。该领域的研究关注已从幽门螺杆菌相关炎症、启动子高甲基化和肿瘤抑制基因沉默,转向涉及microRNA、lncRNA、微生物与病毒相互作用、STAT3/NF-κB信号、细胞外囊泡通讯、肿瘤免疫和治疗耐药的更多元化主题。中国在出版体量上领先,而美国表现出最强的国际连通性;机构和作者层面的合作仍高度碎片化。嵌套六主题LDA模型量化了筛选的WoSCC语料库内不同的长期主题轨迹,而对完整2,933篇出版物的独立NMF分析恢复了大致一致的主题域。这种跨模型趋同支持主要主题结构在更广泛数据库覆盖和不同主题建模框架下的稳健性,但不应被解释为WoSCC子集在统计上代表整个语料库的证明。总之,多数据库科学图谱、嵌套LDA分析和独立NMF验证为表征成熟基础、识别活跃转化界面以及优先开展炎症相关胃癌表观遗传学的多中心验证提供了可复现框架。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号