《Nature Genetics》:Predictive design of tissue-specific mammalian enhancers that function in the mouse embryo
编辑推荐:
增强子(enhancer)控制动物体内的组织特异性基因表达。尽管深度学习(deep learning)已使哺乳动物细胞系和非哺乳动物模式生物中的增强子预测与设计成为可能,但仍不清楚这些方法是否能在体内哺乳动物基因组和组织的调控复杂性中发挥作用。在此,研究人员提
增强子(enhancer)控制动物体内的组织特异性基因表达。尽管深度学习(deep learning)已使哺乳动物细胞系和非哺乳动物模式生物中的增强子预测与设计成为可能,但仍不清楚这些方法是否能在体内哺乳动物基因组和组织的调控复杂性中发挥作用。在此,研究人员提出一种通用策略,用于设计在小鼠中可靠发挥作用的组织特异性增强子。研究人员利用深度学习在精选的染色质可及性数据上训练紧凑的卷积神经网络(CNN),并通过迁移学习(transfer learning)在已验证的人类和小鼠增强子上进行微调。在这些模型指导下,研究人员为小鼠胚胎的心脏、肢体和中枢神经系统(CNS)设计了15个合成增强子,所有这些增强子均在其预期靶组织中具有活性。这些结果表明,仅从DNA序列即可可靠推断哺乳动物增强子功能,从而能够利用中等规模训练集实现组织特异性合成增强子的预测性从头设计。这项工作为体内哺乳动物基因表达的可编程控制建立了一个通用框架,为功能基因组学、合成生物学和基因治疗开辟了新途径。
**论文解读:预测性设计小鼠胚胎中组织特异性增强子**
**研究背景与目标**
增强子(enhancer)是动物组织特异性基因表达的关键调控元件。虽然深度学习(deep learning)已在哺乳动物细胞系和非哺乳动物模式生物中实现了增强子预测与设计,但此类方法能否在哺乳动物基因组和组织的体内调控复杂性中有效运作,仍是未解之谜。因此,研究人员旨在开发一种能够在小鼠体内可靠设计组织特异性增强子的通用策略。
**研究总体与意义**
研究人员利用深度学习在ATAC-seq(转座酶可及染色质测序)染色质可及性数据上训练紧凑卷积神经网络(CNN),并通过迁移学习(transfer learning)在已验证的人类和小鼠增强子上微调,进而设计出15个针对心脏、肢体和中枢神经系统(CNS)的合成增强子。所有设计序列均在其预期靶组织中具有活性。这项工作证明,仅从DNA序列即可可靠推断哺乳动物增强子功能,并能从中等规模训练集出发实现组织特异性合成增强子的从头设计。该研究发表于《Nature Genetics》,为体内基因表达的可编程控制建立了通用框架,对功能基因组学、合成生物学和基因治疗具有重要意义。
**关键技术方法**
研究人员使用了来自先前发表的小鼠E11.5胚胎心脏、肢体和脑组织的ATAC-seq数据,以及VISTA增强子浏览器中经实验验证的人类和小鼠增强子序列。方法上,首先训练序列到可及性(sequence-to-accessibility)模型,采用DeepSTARR CNN架构预测DNA可及性;然后通过迁移学习在VISTA增强子上微调,得到序列到活性(sequence-to-activity)模型。利用梯度引导的Ledidi框架联合两个模型进行序列优化,生成候选合成增强子。最后,通过位点特异性转基因报告系统(LacZ染色或双荧光报告)在E11.5小鼠胚胎中验证体内活性。
**研究结果**
**1. 序列到可及性模型的训练与验证**
研究人员在心脏、肢体和中脑组织ATAC-seq数据上训练了序列到可及性模型。模型在未参与训练的基因组区域上准确预测DNA可及性,染色体18上的皮尔逊相关系数(PCC)≥0.76,全染色体测试集上PCC≥0.88,并能捕获共享和组织特异性ATAC-seq峰。成对组织间比较显示,模型能稳健预测差异染色质可及性(PCC≥0.62),为后续增强子活性建模奠定了基础。
**2. 迁移学习构建序列到活性模型**
利用VISTA增强子数据库中的已验证增强子,通过迁移学习微调模型,并以阳性预测值(PPV)为主要指标。尽管每个组织的已验证增强子数量有限(311–432个),模型在未用于训练的序列上达到了≥70.6%的PPV。此外,由于中脑活跃增强子大多也在其他CNS亚区活跃,中脑模型可用于设计泛CNS增强子。模型还能有效拒绝随机序列和不可及基因组序列。相比之下,仅使用ATAC-seq数据或直接训练(无迁移学习)的模型表现较差,PPV降低20.9%–52.1%,凸显了两步迁移学习的价值。迁移学习还改变了多种转录因子(TF)基序的贡献分数:维持或增强重要性的基序对应组织发育关键因子,如心脏的MEF2、肢体的TWIST1和CNS的SOX3;重要性下降的基序则对应广谱表达的因子(如CTCF)。
**3. 合成增强子的设计与体内验证**
利用Ledidi框架,研究人员为每种组织设计了大量候选序列,并选出5个高评分且具有组织特异性的序列(共15个)进行体内验证。这些序列与小鼠或人类基因组无显著相似性(BLAST E值>0.05)。在E11.5小鼠胚胎中,通过位点特异性转基因报告实验检测其活性,结果显示全部15个合成增强子均在其目标组织中可重复活跃(至少3个独立胚胎有信号)。其中4/5的心脏增强子仅心脏特异,4/5的CNS增强子仅CNS特异,而5个肢体增强子除肢体外在其他TWIST1表达的中胚层组织中也显示较弱活性,与TWIST1功能一致。
**4. 基于推断标签的扩展设计**
为减少对实验验证增强子的依赖,研究人员尝试利用基因组特征推断活性标签,包括:远离启动子和CTCF结合位点的ATAC-seq峰、同时标记H3K27ac和H3K4me1的ATAC-seq峰,以及组织特异性ATAC-seq峰。将这些推断标签用于迁移学习后,模型预测能力显著优于仅基于可及性的模型,其中组织特异性ATAC-seq峰效果最佳,接近使用VISTA标签的模型。交叉验证表明,此类模型设计合成增强子的成功率至少可达60%。
**5. 亚区域特异性增强子设计**
针对CNS亚区,研究人员采用对比法设计前脑和中脑特异性增强子:要求目标亚区高评分,同时压制其他CNS亚区评分。所得两个前脑增强子均在前脑活跃,但其中一个在肢体有明显脱靶活性;两个中脑增强子中一个无活性,另一个因报告构建体发生419 bp重复而无法解读。尽管如此,对比设计显著降低了非目标CNS亚区(特别是脊髓)的活性,证明亚区特异性设计在原则上是可行的,但需要更专用的数据和模型。
**讨论与结论**
研究发现,哺乳动物增强子功能充分编码于DNA序列中,能够被模型学习并用于从头设计体内发挥功能的组织特异性增强子。模型不仅能区分功能性增强子与其他可及区域,还能从头发现相关TF基序及高阶基序语法,如已知的GATA、TWIST1、SOX,以及新发现的ATTCA样基序(CNS)和LMX1B–TWIST1复合协调基序(肢体)。该研究无需庞大模型或大规模MPRA数据集,紧凑CNN加上易得的染色质谱和每组织数百个真实增强子即可实现稳健设计;基因组特征也可替代部分已验证增强子用于迁移学习。
该研究聚焦于单个增强子在标准化报告子和启动子环境中的设计,而天然位点中的增强子输出可能受启动子身份、染色质环境和更高阶基因组背景影响。方法也未覆盖多增强子调控架构、更多细胞类型与动态过程,以及更广的序列解空间。未来体内高通量检测技术可进一步提升设计的规模与精度。
研究结论:哺乳动物增强子功能在DNA序列中具有足够的信息,可被学习并用于从头设计体内组织特异性增强子。该工作建立的通用框架为可编程控制哺乳动物体内基因表达开辟了道路,对功能基因组学、合成生物学和基因治疗具有重要价值。