生物医学研究可重复性危机:系统性障碍与多方行动方案
《Journal of General Internal Medicine》:Reproducibility in Biomedical Research: A Systems Prescription
【字体:
大
中
小
】
时间:2026年10月03日
来源:Journal of General Internal Medicine 4.1
编辑推荐:
丰富的公共数据集和现代计算能力已经彻底改变了生物医学研究。科学家们如今只需几次点击就能获取全球的大量信息,并在几秒内完成复杂分析。然而,这些进步也带来了研究者自由度的提升和出错的机会,引发了人们对可重复性日益增长的担忧——即新的研究者使用与原研究者相同的数据和方法能否获得相同
丰富的公共数据集和现代计算能力已经彻底改变了生物医学研究。科学家们如今只需几次点击就能获取全球的大量信息,并在几秒内完成复杂分析。然而,这些进步也带来了研究者自由度的提升和出错的机会,引发了人们对可重复性日益增长的担忧——即新的研究者使用与原研究者相同的数据和方法能否获得相同结果的能力。尽管这些批评本身也是科学前所未有开放性的产物,但它们凸显了在一个日益复杂的研究领域中,需要更可靠的质量保障。我们目前处于什么位置?为了解说当前的实践情况,我们调查了《JAMA》《JAMA Internal Medicine》和《JAMA Pediatrics》三个月内原始调查报告和研究论文(N = 134篇)的代码共享和数据共享情况(在线补充材料)。仅4%的出版物共享了代码,5%在公共仓库中共享了数据。另有10%的稿件列出代码可应要求提供,而86%则表示无法提供。同样,16%报告了公开数据但未在复制包中提供,39%标注数据可应要求提供,40%则列明数据无法提供。为什么96%的论文不共享代码,95%不共享数据?这些普遍存在的缺失指向的是系统性失败,而非孤立的个人选择。可重复性受到培训差距、基础设施局限以及错位激励的阻碍。我们描述了这些障碍,并提出针对研究者、期刊编辑和资助方的行动方案。可重复性的障碍最根本的障碍是培训。生物医学研究越来越需要代码,但生物医学课程很少教授最佳编程实践。(例如,本文的作者们都没有在课程或培训中被教导如何测试代码。)编写能够按预期运行的代码本身就十分困难,即使是受过训练的软件开发工程师也不例外,更何况是临场学习的研究人员。在实践中,编程通常被委托给一位研究者或一个小团体,往往是学生或初级人员,且缺乏监督。协作者可能会审查输出结果,但正式的代码审查或测试极为罕见。其次,医学学术界对于可重复性标准仍然模糊不清。即使团队实施了内部审查流程,这些流程也很少在稿件中进行说明,这与对数据来源和统计方法的仔细记录形成鲜明对比。标准也被排除在期刊用来指导方法学报告的检查清单(如CONSORT、CHEERS)之外。第三,为公众传播而准备数据和代码需要花费时间和努力,而研究者缺乏投入的激励。在发表论文的压力下,很容易将公开编目数据和代码的事情排到次要位置,尤其是当同行也都跳过这一步的时候。美国国家卫生研究院(NIH)现在要求竞争性申请中涉及产生科学数据的申请必须提交数据管理和共享计划。然而,NIH并不监督实施情况,且要求不涵盖使用二级数据来源的研究。对代码被滥用和审查的担忧也加剧了这种缺乏激励的问题。作者可能担心代码会被误解或用于非预期目的。例如,作者可能担心用于识别跨性别受益者研究的算法会被用来歧视跨性别患者。随着大型语言模型的兴起,作者可能担心对知识产权的控制有限。作者可能害怕,共享数据和代码会使他们面临比其他选择不公开资源的同行更多的批评。潜在措施研究者从软件工程借鉴的三种实践可以显著减少研究中的编码错误:代码测试、代码审查和重复编码。这三种做法都需要培训和实践,我们强调需要将其纳入正式的生物医学研究课程,并制定研究专用的报告标准。生物医学研究者通常依赖两个隐含的检查:代码能够无错误运行,以及输出结果符合预期。然而,这两者都是临时性的且容易受到确认偏误的影响,因为研究者更有可能仔细检查产生意外结果的代码。在代码测试中,软件工程师采取更加系统化的方法,定义每个函数的预期行为并编写测试来验证给定输入是否产生正确的输出。作为研究中的一个示例,当将人年级别的数据聚合到个人级别时,可以编写一个测试来确认唯一个体的数量是否得到保留。设计能够预判潜在问题的测试是一项需要实践的技能,但一旦得到良好的实施,就可以发现其他情况下难以捕捉的错误。代码审查,即由未参与编写代码的人仔细检查数据清洗和分析代码,是第二道防线。尽管这在软件工程中是标准做法,但在学术研究领域仍然罕见。其价值不仅在于捕捉错误,还在于它所施加的纪律:预期同事会阅读代码时编写的代码往往更加整洁且文档更完善。虽然行业最佳实践涉及频繁审查小规模的代码单元,但在学术环境中,在项目结束时审查完整的分析流程可能更为可取。此外,代码审查还有助于为代码的公开发布做准备。最后,重复编码,即多位研究者独立地对同一分析进行编码,是最耗资源的方案,但也是最严格的。当两位研究者编写代码回答同一个问题却得到不同的答案时,这种差异可能反映的是编码错误。然而,也可能揭示了不同的分析假设:如何处理缺失值或排除哪些观测值。无论哪种情况,这种分歧都具有信息价值,暴露了bug和隐藏的判断题。大型语言模型(LLMs)在解释、批评和编写代码方面的能力日益增长,对于降低上述三种实践的负担具有巨大潜力。除了降低初始代码开发的负担(以及对代码的专有倾向)之外,LLMs还可以帮助生成测试、标记常见错误、充当初步代码审查者或协助重复编码。对这些工具的创造性应用可以使当前实践与最佳实践之间的差距不那么令人望而生畏。期刊编辑和资助方如果没有制度性的强化,个人实践的作用有限。作为生物医学研究的实际标准制定者,期刊编辑处在提高代码和数据共享要求的有利位置。虽然强制执行代码共享(例如在修订稿件阶段)是一个起点,但一些期刊做得更多。《American Economic Review》要求作者提交包含代码和数据的复制包。当数据非公开时,作者必须指明是否可以提供一个私有版本供数据编辑或指定的第三方复制者使用。《Bioinformatics》要求对新软件、算法和代码进行同行审查。为减轻人工审查者的负担,期刊还可以考虑使用人工智能驱动的审查工具。最后,资助方也有其角色:为复制包提供资源、支持高风险分析的重复编码,并在必要时协调共享基础设施。例如,资助方可以支持开发用于复制依赖受限数据来源(如Medicare理赔数据)的研究的基础设施,也许可以通过采用符合HIPAA标准的LLM编码支持工具来实现。结论对于个人和研究团队来说,可重复性的障碍可能很大,但并非不可克服。本文概述的实践——测试、审查和共享代码——已在其他领域得到证明,并可以日益得到人工智能工具的支持来降低采用成本。标准化这些实践不仅关乎严谨性;它是加强科学结果的可信度和公共可信度的具体机制。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号