
-
生物通官微
陪你抓住生命科技
跳动的脉搏
TripodAI:一种用于评估AI预测模型论文TRIPOD+AI指南依从性的透明自动化工具的开发与验证
《BMC Medical Informatics and Decision Making》:Development and validation of an automated rule-based tool for assessing TRIPOD?+?AI reporting adherence in artificial intelligence prediction model studies
【字体: 大 中 小 】 时间:2026年09月24日 来源:BMC Medical Informatics and Decision Making 5.5
编辑推荐:
摘要背景人工智能(AI)和机器学习预测模型越来越多地应用于临床研究,但其可信度依赖于透明、完整且可重复的报告。尽管已推出TRIPOD + AI指南,但其27个条目的依从性手动评估仍耗费大量人力,此前也未有经验证的自动化工具用于此目的。目的开发并严格验证一种透明、基于规则的自动
人工智能(AI)和机器学习预测模型越来越多地应用于临床研究,但其可信度依赖于透明、完整且可重复的报告。尽管已推出TRIPOD + AI指南,但其27个条目的依从性手动评估仍耗费大量人力,此前也未有经验证的自动化工具用于此目的。
开发并严格验证一种透明、基于规则的自动化工具(TripodAI),用于评估AI预测模型论文中TRIPOD + AI 27项报告指南的依从性。
TripodAI是一个开源的基于规则的Python包,可检测TRIPOD + AI报告要素并对每个条目发出二元(是/否)的适当性判断。参照标准为从一份涵盖255项AI临床预测模型研究的父集元流行病学普查中抽取的70项研究子样本,此前已进行双重提取和仲裁(评分者间κ = 0.611,原始一致性84.5%)。内部验证将TripodAI与手动参照标准在1,890个条目级配对中进行比较;随后从同一父集普查中额外抽取一组70项研究的留出外部验证集(1,890个条目级配对)进行评估。一致性通过百分比一致率和Cohen's κ进行量化;诊断性能(准确率、敏感度、特异度、精确率、F1分数)以手动审核为参照标准进行计算。
在内部验证中,总体百分比一致率为86.0%,Cohen's κ为0.705(95%置信区间:0.639–0.771),表明一致性较高。二元诊断性能(n = 1,766)显示准确率为0.881,敏感度为0.925,特异度为0.777,精确率为0.906,F1分数为0.915。对于标准化方法学条目,表现最佳(例如,算法类型指定,κ = 1.000;研究场景与招募,κ = 1.000);对于数据可用性(κ = 0.227)和特征选择方法(κ = 0.278),表现最弱。在同一父集普查中抽取的70项留出外部验证集上,外部验证证实了这些发现:百分比一致率为85.1%,Cohen's κ为0.691(95%置信区间:0.627–0.756),准确率为0.860,敏感度为0.903,特异度为0.759,精确率为0.899,F1分数为0.901——表明从内部验证到外部验证的衰减极小。
TripodAI是一款透明的基于规则的自动提取工具,与独立手动审核之间达成高度一致性,且具有高敏感度和可接受的特异度。尽管尚不适合完全自主使用,尤其是针对数据可用性声明,但该工具可作为人机协同决策支持系统,在系统综述、元研究和期刊编辑流程中对TRIPOD + AI依从性进行大规模评估时可靠地发挥作用。
不适用。
人工智能(AI)和机器学习预测模型越来越多地应用于临床研究,但其可信度依赖于透明、完整且可重复的报告。尽管已推出TRIPOD + AI指南,但其27个条目的依从性手动评估仍耗费大量人力,此前也未有经验证的自动化工具用于此目的。
开发并严格验证一种透明、基于规则的自动化工具(TripodAI),用于评估AI预测模型论文中TRIPOD + AI 27项报告指南的依从性。
TripodAI是一个开源的基于规则的Python包,可检测TRIPOD + AI报告要素并对每个条目发出二元(是/否)的适当性判断。参照标准为从一份涵盖255项AI临床预测模型研究的父集元流行病学普查中抽取的70项研究子样本,此前已进行双重提取和仲裁(评分者间κ = 0.611,原始一致性84.5%)。内部验证将TripodAI与手动参照标准在1,890个条目级配对中进行比较;随后从同一父集普查中额外抽取一组70项研究的留出外部验证集(1,890个条目级配对)进行评估。一致性通过百分比一致率和Cohen's κ进行量化;诊断性能(准确率、敏感度、特异度、精确率、F1分数)以手动审核为参照标准进行计算。
在内部验证中,总体百分比一致率为86.0%,Cohen's κ为0.705(95%置信区间:0.639–0.771),表明一致性较高。二元诊断性能(n = 1,766)显示准确率为0.881,敏感度为0.925,特异度为0.777,精确率为0.906,F1分数为0.915。对于标准化方法学条目,表现最佳(例如,算法类型指定,κ = 1.000;研究场景与招募,κ = 1.000);对于数据可用性(κ = 0.227)和特征选择方法(κ = 0.278),表现最弱。在同一父集普查中抽取的70项留出外部验证集上,外部验证证实了这些发现:百分比一致率为85.1%,Cohen's κ为0.691(95%置信区间:0.627–0.756),准确率为0.860,敏感度为0.903,特异度为0.759,精确率为0.899,F1分数为0.901——表明从内部验证到外部验证的衰减极小。
TripodAI是一款透明的基于规则的自动提取工具,与独立手动审核之间达成高度一致性,且具有高敏感度和可接受的特异度。尽管尚不适合完全自主使用,尤其是针对数据可用性声明,但该工具可作为人机协同决策支持系统,在系统综述、元研究和期刊编辑流程中对TRIPOD + AI依从性进行大规模评估时可靠地发挥作用。
不适用。
生物通微信公众号