RSV-A G基因单倍型解析揭示宿主内跨分支共传递信号:基于澳大利亚与美国深度测序数据的发现与验证

《Virologica Sinica》:Recurrent intrahost G-gene haplotype structures suggest potential co-transmission in RSV-A

【字体: 大 中 小 】 时间:2026年10月11日 来源:Virologica Sinica 4.7

编辑推荐:

  摘要专业翻译 呼吸道合胞病毒(RSV)是全球婴幼儿住院的主要原因之一。其分子流行病学依赖于共有序列(consensus sequence)G基因分析,而该策略仅能捕获每次感染中的优势病毒。深度测序揭示了每个宿主内部更为丰富的变异。将这些变异相互关联,可为传播提

摘要专业翻译 呼吸道合胞病毒(RSV)是全球婴幼儿住院的主要原因之一。其分子流行病学依赖于共有序列(consensus sequence)G基因分析,而该策略仅能捕获每次感染中的优势病毒。深度测序揭示了每个宿主内部更为丰富的变异。将这些变异相互关联,可为传播提供更精细的视角。本研究从两个独立的RSV-A深度测序数据集(澳大利亚,n = 37;美国,n = 72)中重建了G基因单倍型(haplotype)。研究人员利用读段水平的连锁信息进行定相(phasing),随后将每个单倍型置于全局系统发育树上。超过90%的样本携带多个单倍型,且这些单倍型常分布于不同的系统发育分支。每个数据集中均存在一个占主导地位的跨分支配对:C4+C6出现在23/37(62%)的澳大利亚样本中,C18+C21出现在26/72(36%)的美国样本中。这两个配对的出现频率显著高于按月份和地区匹配的随机置换预测值(两者P = 5.0 × 10-5)。突变概率计算表明,反复出现的宿主内从头突变(de novo mutation)不太可能完全解释这些模式,尤其是C4+C6中五个连锁位点的组合(概率 ≤ 5.36 × 10-15)。预先存在的单倍型被重复共同引入(co-transmission)提供了更简洁的解释,而传播链采样可直接对此进行检验。所有分支定义位点均定位于G-HVR2区域。在所检查的全球共有序列G基因集合中,优势分支状态可被检出,而次要分支组合在既定标准下未被检测到。单倍型解析分析因此将亚共有序列多样性转化为具有连锁关系的、可解释的流行病学信号。

论文解读文章

一、研究背景与科学问题

呼吸道合胞病毒(RSV)是引起全球婴幼儿急性下呼吸道感染、住院甚至死亡的首要病原体,同时也可导致老年人,尤其伴有慢性心肺基础疾病者出现严重呼吸道疾病。RSV的分子流行病学长期依赖共有序列(consensus sequence)G基因分析,即通过逐位点取多数等位基因的方式生成代表样本的单一序列。这一策略虽在基因型分类和全球谱系传播追踪中发挥了重要作用,但存在固有局限:共有序列并不必然对应样本中任何一条真实病毒RNA基因组的序列,且会完全排除低于多数频率的变异。因此,基于共有序列的监测无法反映单个感染内部真实的病毒群体结构。
深度测序技术使研究人员得以在单个感染水平上观察病毒群体。基于单核苷酸变异(iSNV)的研究揭示了低频变异、等位基因频率动态以及可能的传播瓶颈信号。然而,单点iSNV分析存在根本性缺陷:它仅能报告各位点上的变异频率,却无法判断不同位点的变异是存在于同一条病毒基因组还是分散于不同基因组上。缺乏单倍型(haplotype)层面的信息,iSNV只能停留在孤立的位点观察层面,无法揭示感染内病毒群体的组织方式。
此外,一个悬而未决的问题是宿主内单倍型多样性能否通过传播得以维持。流感病毒和SARS-CoV-2的研究表明,呼吸道病毒传播常受狭窄的遗传瓶颈限制。但RSV可能并非如此极端:一项成人攻毒研究估计其有效传播瓶颈下限约为25个病毒粒子,这为少数变异与优势变异共同传播提供了可能。因此,感染内的病毒群体结构可能并非仅由当前感染期间的新发突变产生,也可能反映了采样前已分化单倍型的共同引入。这一可能性此前未在RSV-A中得到系统检验。
基于上述背景,本研究旨在通过单倍型解析分析,回答三个核心问题:RSV-A感染中的G基因宿主内变异是否组织为共存的单倍型;这些单倍型间的系统发育关系更支持宿主内新发还是预先存在单倍型的共同引入;单倍型水平信息能为共有序列监测补充什么。

二、研究设计与主要技术方法

研究人员采用发现-验证(discovery-validation)设计,分析两个独立的公开RSV-A深度测序数据集。发现数据集来自澳大利亚(BioProject PRJNA1037681),包含2022年5月至8月在悉尼采集的37个质量过滤样本,以Nextclade分支A.D.3.1为主。验证数据集来自美国(BioProject PRJNA1130896),包含2023年10月至2024年4月在俄勒冈州和华盛顿州采集的72个样本,涵盖13个Nextclade分支,以A.D.1.5和A.D.5.2为主。两个数据集在采样时间、地理和分支组成上的差异为检验宿主内共现模式的可重复性提供了独立条件。
主要技术流程包括:使用fastp进行读段预处理和质量控制;以BWA-MEM比对至RSV-A参考序列EPI_ISL_412866;保留参考基因组至少90%位点覆盖度≥200×的样本;以bcftools生成共有序列并用Nextclade进行分支分型;以LoFreq进行宿主内iSNV检测,筛选条件为位点深度≥200×、链偏倚评分≤30、样本内频率≥3%;对重复出现的iSNV进行Pearson相关共变筛选(|r|>0.8);使用CliqueSNV v2.0.3进行G基因单倍型重建(snv-illumina模式,-tf 0.03,-t 10),并进行参数敏感性分析;以MAFFT比对、IQ-TREE构建最大似然树(ModelFinder选模,1000次超快自举);以TreeCluster v1.0.5进行局部分支分配(澳大利亚阈值0.010,美国阈值0.015);通过月份-地区分层置换检验(20,000次)评估跨分支配对富集显著性;以简化突变概率模型评估宿主内从头突变的可能性;从Nextstrain平台获取12,382条全球共有序列G基因序列进行背景匹配分析。

三、主要研究结果

共变位点揭示澳大利亚数据集中多单倍型共存
在澳大利亚数据集中,每个样本平均检测到5.1个G基因iSNV,等位基因频率集中于频谱两端(58.5%低于20%,40.4%高于80%)。23个重复检测位点中20个定位于G-HVR2。其中nt 5510、5520、5544、5558和5563五个位点在样本间重复出现并呈现协调的等位基因频率变化。单倍型重建在35/37(94.6%)样本中鉴定到至少两个G基因单倍型,且重建的单倍型数与测序深度无显著相关(Spearman's ρ = -0.023)。跨越多个候选共变位点的读段显示出与重建单倍型一致的多位点核苷酸组合,提供了读段水平连锁支持。
共存的澳大利亚单倍型形成非随机的跨分支组合
在系统发育树上,35个多单倍型样本中有29个(82.9%)的单倍型被分配到两个或更多分支。C4+C6是最常见的跨分支配对,出现在23个样本中,且全部属于A.D.3.1分支并在每个采样月份均有检出。月份-地区分层置换检验显示,观察到的C4+C6计数(23)显著超出零分布(均值10.66,95%零区间6-15,P = 5.0 × 10-5),表明该配对并非随机共现。
美国数据集验证了多单倍型共存和非随机跨分支组合
美国数据集的分支多样性更高但每样本iSNV数更少(中位数3)。等位基因频率仍集中于两端,位点同样集中于G-HVR2。67/72(93.1%)样本含至少两个单倍型,且单倍型数与深度无显著相关(Spearman's ρ = 0.082)。C18+C21是最常见的跨分支配对,出现在26个样本中,集中于A.D.1.5分支,跨六个采样月份和两个地区。置换检验显示观察计数(26)显著超出零分布(均值9.23,95%零区间5-14,P = 5.0 × 10-5)。两个数据集的观察-期望比分别为2.16和2.82。
共有序列遗漏次要分支G-HVR2组合
两个优势配对的分支定义位点均位于G-HVR2。C4和C6在aa287、aa290、aa298和aa303处存在差异(对应nt 5510、5520、5544、5558和5563,其中nt 5563为同义突变);C18和C21在aa294和aa304处存在差异(对应nt 5531和5561)。这些位点具有高测序深度、高碱基和比对质量、低链偏倚评分及接近读段中心的位置分布。在全球共有序列G基因搜索中,优势分支单倍型(澳大利亚C4 23/23;美国C21 26/26)均找到相似背景且携带相同G-HVR2状态的匹配序列,而次要分支单倍型(澳大利亚C6 0/23;美国C18 0/26)未找到任何匹配。

四、讨论与结论总结

讨论部分围绕三个核心问题展开。第一,随机独立共感染难以解释重复出现的跨分支配对:置换检验表明,在控制月份和地区结构后,C4+C6和C18+C21的出现频率均显著超出随机预期。第二,宿主内从头突变不太可能是主要解释:单倍型树未显示预期的样本特异性聚集模式,同一分支包含来自多个样本的单倍型;简化突变概率计算显示,C4+C6五个连锁位点在最有利于突变的假设下(突变率10-4,14个复制周期)概率至多为5.36 × 10-15,C18+C21两个位点对应估计为1.96 × 10-6。第三,预先存在单倍型组合的共同引入是更简洁的解释,这与RSV约25个病毒粒子的传播瓶颈估计相符,但需传播链采样直接检验。
研究还指出,分支定义位点集中于G-HVR2的72-nt重复序列第二拷贝。C4+C6中的aa298与已报道的正选择位点aa274同源,C18+C21中的aa304直接落在已报道的正选择位点上。C18+C21中的aa294与第一拷贝中推定的O-糖基化位点aa270同源,高频率单倍型在该位点携带脯氨酸而低频率单倍型保留丝氨酸,提示不同的O-糖基化潜力,可能影响抗原表位暴露。
研究结论为:RSV-A宿主内G基因多样性组织为共存的单倍型而非独立的单点变异,两个独立数据集中超过90%的样本携带多个单倍型。这些单倍型占据不同的系统发育分支并形成重复出现的跨分支组合。这些组合是否被共传递仍需直接检验。分支定义位点集中于G-HVR2的重复区域,该区域同时含有正选择信号和推定O-糖基化位点,提示潜在的抗原相关性。共有序列比较能检测优势分支变异但遗漏对应的次要分支单倍型组合,揭示了当前RSV分子流行病学的实际局限。未来结合长读段测序、传播链采样和功能实验的研究,可检验单倍型组合是否在自然传播事件中得以维持以及编码差异是否具有生物学后果。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号