临床预测模型研究中代码共享与可复现性的大语言模型辅助范围综述

《Nature Medicine》:AI-assisted scoping review of code sharing in clinical prediction model research

【字体: 大 中 小 】 时间:2026年10月10日 来源:Nature Medicine 52.5

编辑推荐:

  临床预测模型(clinical prediction models, CPMs)日益用于支持诊断与预后决策,因而可复现性对于评估其可靠性与泛化能力至关重要。分析代码(analytical code)可支持对这些过程的独立评估,但文献中代码可及性仍有限。本范围综

临床预测模型(clinical prediction models, CPMs)日益用于支持诊断与预后决策,因而可复现性对于评估其可靠性与泛化能力至关重要。分析代码(analytical code)可支持对这些过程的独立评估,但文献中代码可及性仍有限。本范围综述(scoping review)量化了代码共享现状,为制定TRIPOD-Code这一面向代码可用性与可复现性的报告指南提供依据。研究人员开发了大语言模型(large language model, LLM)辅助流程,用于筛选引用TRIPOD或TRIPOD+AI的文章、提取仓库链接,并依据14项预定义可复现性特征评估所获仓库。在3967篇文章中,482篇(12.2%)包含代码共享声明。共享比例因期刊与国家差异显著。仓库评估显示可复现性特征异质性明显。这些发现强调:除代码可用外,还需明确文档、依赖规范和可执行结构等要求。强化这些实践可提升临床预测模型研究的可用性,并支持其在真实世界临床场景中的部署。
研究背景方面,临床预测模型(clinical prediction models, CPMs)现广泛用于诊断与预后决策,模型进入实践前必须具备可独立评估的有效性、跨队列可复现的性能以及支持真实世界转化的透明度。用于数据预处理、模型开发、参数选择与调优、性能评估的分析代码(analytical code)是方法学审查与结果复现的关键,但已发表预测模型底层代码的可及性仍不常见。FAIR原则、EQUATOR Network与期刊及资助方的数据和代码可用性声明推动了计算透明,TRIPOD与2024年更新的TRIPOD+AI改善了报告完整性,但TRIPOD+AI虽鼓励共享分析代码,却未明确仓库结构、文档与可复现性标准,预测模型研究中代码共享的实际程度与质量此前未被系统研究。更广泛生物医学文献显示代码共享稀少,且声明可用常不等于真正可运行;已有研究多聚焦Jupyter笔记本或劳动密集型人工评审,难以扩展到大规模异质语料。因此,研究人员开展本项研究,目的是在引用TRIPOD或TRIPOD+AI的研究中量化代码可用性并评估共享仓库特征,为TRIPOD-Code扩展指南提供实证基础。论文发表于《Nature Medicine》。
关键技术方法方面,研究人员以2025年8月11日前PubMed中引用TRIPOD Statement与TRIPOD+AI Statement的文献为起点,去重后保留可通过PubMed Central Open Access API获取的全文,由大语言模型(large language model, LLM)按预定义结构化方案筛选是否开发、更新或验证多变量预测模型,并提取代码可用性声明与仓库链接;样本为符合标准的3967篇文章及后续380个可表征仓库。仓库通过支持GitHub、GitLab、Zenodo、OSF等提供方的自建工具拉取,按文件树、README与代码文件全量、其他文件截断的规则转为文本,再由LLM依据TRIPOD-Code执行委员会确定的14项仓库特征做结构化抽取;文章级与仓库级均设人工标注子集验证,文章筛选加权F1为0.97,仓库链接抽取准确率92.3%,仓库特征加权F1为0.83。
Results部分中,Code sharing显示3967篇中有482篇(12.2%)共享代码;代码共享随年份上升,每出版年 odds ratio(OR)为1.12(95% CI 1.07–1.18),2015年6.3%、2024年14.5%、2025年15.8%;引用TRIPOD+AI者共享率29.2%,高于TRIPOD的11.4%(OR 3.20),校正出版年后仍为2.61。中国占发表量最大(32.4%),芬兰、比利时、以色列共享比例最高。期刊间差异显著,71本含超10篇的期刊中17本共享率为0%,Nature Communications、npj Digital Medicine、PLOS Digital Health、PLOS Medicine最高。代码声明多见于数据可用性小节、方法小节与补充材料,措辞高度异质,94.4%仅出现一次。Repository characteristics显示447个仓库链接中27个指向不支持提供方,38个无法解析,最终380个入库;83.4%在GitHub;80.5%有README但仅52.1%说明用途与预期输出,42.4%为模块化结构,依赖规范37.6%,带版本约束21.6%,许可35.3%,出版链接36.8%,引用信息19.5%,测试3.9%,硬件需求8.4%,含数据或样例数据37.1%,286个随机性仓库中64.3%固定随机种子。Python与R最常见,Python年OR 1.31、R年OR 0.85,Python于2023年超过R,2025年占半数以上。
Discussion部分指出,代码共享在预测模型研究中仍不普遍,可用性上升并不等于可复现;高共享率期刊多有明确代码政策,但政策存在不等于执行充分,作者需提供可文档化代码,期刊需明确“充分共享”的边界,TRIPOD-Code Delphi流程将共识界定必备、推荐或情境依赖项。TRIPOD+AI因含鼓励代码可用条目(item 18f)而共享率近三倍于TRIPOD,说明结构化报告指南可改变作者行为。标准化代码可用性声明利于发现与评估;仓库常成档案件而非可复用资源,无许可会带来法律不确定并阻碍复用。预测模型进入临床后,外部验证常出现性能下降与亚组偏差,而训练评估对软件版本、随机种子和实现细节敏感,因此强化代码共享不仅关乎研究可复现,也关乎临床转化可靠性。局限性包括LLM辅助分类不完美、队列限于引用TRIPOD/TRIPOD+AI且PMC开放获取,可能高估广义预测模型文献的共享率。
研究结论部分译为:本大规模范围综述提供了引用TRIPOD或TRIPOD+AI的预测模型研究代码共享实践的仓库级评估。代码共享仍相对少见,仅12.2%的研究报告可获取代码;代码可用性随时间增加,但期刊与国家间持续存在显著异质性;直接检查仓库表明代码可用并不稳定转化为可复现性,许多仓库缺乏复用相关特征,如文档、依赖规范和许可。可用性是可计算可复现性的必要非充分条件。期刊间差异可能反映编辑期望与学科背景不同;高共享率期刊均有代码共享指导,但政策本身可能不足,需作者与期刊共同承担责权。TRIPOD+AI引用者共享率约为TRIPOD三倍,支持报告指南影响作者行为。标准化声明可提升可发现性;许多仓库只是存档制品而非可复用计算资源,许可缺失会阻碍复用。鉴于预测模型在临床中的作用上升,外部验证中性能退化和亚组偏差使可复现性尤为关键。本研究首个大规模仓库级评估表明,应把期望从“是否共享代码”推进到“如何共享代码”,在文档、依赖规范、许可与结构层面建立更清晰标准,为TRIPOD-Code扩展提供实证基础,并凸显期刊、资助方与报告框架在推动有意义可复现代码共享中的关键角色。

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号