
-
生物通官微
陪你抓住生命科技
跳动的脉搏
TE_Bench:用于可移动元件注释流程的基础基准测试工具
《Mobile DNA》:TE_Bench: a foundational benchmarking workflow for transposable element annotation pipelines
【字体: 大 中 小 】 时间:2026年07月17日 来源:Mobile DNA 4.2
编辑推荐:
摘要背景用于在DNA序列中识别可移动元件(TEs)的计算机分析方法仍在不断发展中。尽管已有许多TE注释流程被公布,但它们之间的方法差异往往不够透明,从而导致结果不一致。随着新方法的出现,人们越来越需要一种具有信息量且可重复的策略来评估这些流程的性能。结果我们开发了TE_Bench
用于在DNA序列中识别可移动元件(TEs)的计算机分析方法仍在不断发展中。尽管已有许多TE注释流程被公布,但它们之间的方法差异往往不够透明,从而导致结果不一致。随着新方法的出现,人们越来越需要一种具有信息量且可重复的策略来评估这些流程的性能。
我们开发了TE_Bench,这是一种用户友好的TE注释基准测试工作流,可简化数据生成与可视化过程,便于系统地比较不同注释流程的性能。TE_Bench能够自动模拟包含从数据库中人工生成的TEs的DNA序列,也可接收用户提供的真实数据,以此衡量测试流程相对于参考注释检测TEs的能力。为适应不同起点的用户,TE_Bench以Snakemake工作流的形式提供多种选项。它生成的数据可用于确定特定任务应使用哪种TE注释流程,或通过揭示现有流程的缺陷为未来的改进提供依据。我们通过使用模拟和真实的DNA序列对EDTA、RepeatModeler2和Earl Grey进行基准测试,展示了TE_Bench在这两种场景下的实用性。利用模拟数据,我们分析了TE类别和嵌套结构等变量对注释质量的影响;而使用真实数据,则探讨了读取类型和映射方法是否会影响后续的注释结果。在默认配置下,RepeatModeler2和Earl Grey的表现相似,均优于EDTA。
TE_Bench是一种可扩展的开源工作流,支持社区利用模拟的真实数据或实际基因组来进行TE注释的基准测试。该工具可通过https://gitub.com/hkania/TE_Bench获取。
用于在DNA序列中识别可移动元件(TEs)的计算机分析方法仍在不断发展中。尽管已有许多TE注释流程被公布,但它们之间的方法差异往往不够透明,从而导致结果不一致。随着新方法的出现,人们越来越需要一种具有信息量且可重复的策略来评估这些流程的性能。
我们开发了TE_Bench,这是一种用户友好的TE注释基准测试工作流,可简化数据生成与可视化过程,便于系统地比较不同注释流程的性能。TE_Bench能够自动模拟包含从数据库中人工生成的TEs的DNA序列,也可接收用户提供的真实数据,以此衡量测试流程相对于参考注释检测TEs的能力。为适应不同起点的用户,TE_Bench以Snakemake工作流的形式提供多种选项。它生成的数据可用于确定特定任务应使用哪种TE注释流程,或通过揭示现有流程的缺陷为未来的改进提供依据。我们通过使用模拟和真实的DNA序列对EDTA、RepeatModeler2和Earl Grey进行基准测试,展示了TE_Bench在这两种场景下的实用性。利用模拟数据,我们分析了TE类别和嵌套结构等变量对注释质量的影响;而使用真实数据,则探讨了读取类型和映射方法是否会影响后续的注释结果。在默认配置下,RepeatModeler2和Earl Grey的表现相似,均优于EDTA。
TE_Bench是一种可扩展的开源工作流,支持社区利用模拟的真实数据或实际基因组来进行TE注释的基准测试。该工具可通过https://gitub.com/hkania/TE_Bench获取。