《Diagnostics》:Machine Learning-Based Sex Estimation from Computed Tomography-Derived Pelvic Morphometric Measurements in a Contemporary Turkish Population
编辑推荐:
摘要翻译:背景/目的:性别推断是法医生物学特征图谱的基本组成部分,骨盆被广泛认为是最具性别二态性的骨骼元素。本研究旨在利用计算机断层扫描(computed tomography, CT) derived 的形态测量指标量化当代土耳其样本中的骨盆性别二态性,并评
摘要翻译:背景/目的:性别推断是法医生物学特征图谱的基本组成部分,骨盆被广泛认为是最具性别二态性的骨骼元素。本研究旨在利用计算机断层扫描(computed tomography, CT) derived 的形态测量指标量化当代土耳其样本中的骨盆性别二态性,并评估多种机器学习(machine learning, ML)算法在性别分类中的性能。方法:由一名观察者对201例个体(男性101例,女性100例)的CT重建图像进行14项骨盆测量;其中按分层抽取的30例亚组(男性15例,女性15例)由同一观察者及第二名观察者重复测量,以评估观察者内和观察者间信度。训练并评估了四种有监督机器学习分类器——逻辑回归、线性判别分析(linear discriminant analysis, LDA)、随机森林和支持向量机(support vector machine, SVM)——采用分层10折交叉验证及独立的30%留出测试集。结果:14项测量中13项在性别间差异具有统计学意义(p < 0.05)。所有14项测量的观察者内信度均为优秀(组内相关系数ICC = 0.943–0.998),观察者间信度为良好至优秀(ICC = 0.834–0.996),最低值出现在耻骨长度。交叉验证分类准确率为98.0%(随机森林)至99.0%(逻辑回归、LDA和SVM),对应的交叉验证AUC值为0.991–0.994;逻辑回归、LDA和SVM在独立留出集上均达到100%准确率(AUC = 1.000)(随机森林:96.7%,AUC = 0.999)。髋臼宽度被确定为单一信息量最大的预测指标(单变量曲线下面积= 0.972),其次为髋臼高度、耻骨下角、坐骨长度、骨盆出口横径和坐骨大切迹角。结论:这些研究结果表明,CT derived 的骨盆形态测量指标与机器学习分类相结合,可在土耳其法医学背景下提供高度准确且可复现的性别推断方法,并支持制定针对特定人群的法医人类学案件工作标准,但有待独立外部验证;本研究所报告的分类和效应量估计在重复交叉验证和超参数优化下保持稳定。
论文解读:基于CT骨盆形态测量与机器学习的土耳其人群性别推断研究
一、研究背景与问题
性别推断是法医人类学构建生物学特征图谱的核心环节之一,年龄和身高的后续估计往往依赖于性别特异性标准,因此错误的性别判定会在个体识别过程中传播误差。在可供使用的骨骼元素中,髋骨被认为是最具性别二态性的部位,其形态受到双足行走与分娩之间进化张力的塑造。传统的形态观察方法虽然在有经验的操作者手中快速且准确,但本质上是主观的,观察者缺乏训练时分类错误率上升。形态测量方法对线性与角度测量进行统计分类,相对较少依赖观察者经验,并能提供透明、可量化的分类准确率估计。多层螺旋CT(MDCT)的整合使得无需骨骼化处理即可获得三维骨重建图像,并能够建立大型当代参考样本。已有研究反复确认耻骨下角和骨盆横向径线是最具二态性的单项测量指标,多变量组合的骨盆测量可以达到接近或100%的交叉验证分类准确率。然而,不同人群的二态性特征大小和相对排序存在差异,反映了遗传背景、环境和时代变化对骨骼形态的综合影响。非人群特异性标准会降低分类准确率,因此需要建立人群特异性骨盆标准。土耳其人群的相关数据刚刚开始出现,既往研究或未在同一研究中结合较大规模CT测量面板、多种机器学习架构的系统比较、正式的观察者信度评估和可供临床使用的单变量切割点。本研究旨在弥补这一空白。
二、研究内容与结论
研究人员从土耳其伊兹密尔一家医院获取了201例骨盆CT检查(男性101例,女性100例),排除了骨折、手术史或先天/获得性骨盆异常病例。由一名有20年经验的观察者完成所有14项骨盆测量,另取30例分层随机子集进行重复测量以评估信度。研究测量了骨盆入口横径、出口横径、髋骨高、髂骨宽、坐骨长、耻骨长、耻骨联合长、髋臼高、髋臼宽、骶1椎体横径、骶骨前宽、骶骨前高、耻骨下角和坐骨大切迹角。四种机器学习分类器——逻辑回归、线性判别分析、随机森林和支持向量机——在分层10折交叉验证和独立30%留出集上进行了评估。结果显示,14项测量中13项存在显著性别差异,仅骶骨前宽无显著差异。观察者内信度优秀(ICC 0.943–0.998),观察者间信度良好至优秀(ICC 0.834–0.996),耻骨长度信度最低。交叉验证准确率范围为98.0%(随机森林)至99.0%(其他三种模型),独立留出集上逻辑回归、LDA和SVM达到100%准确率,随机森林为96.7%。重复20次交叉验证和嵌套超参数优化确认性能稳定。特征重要性分析显示髋臼宽度是最强预测因子,其次为髋臼高度、耻骨下角、坐骨长度、骨盆出口横径和坐骨大切迹角。单变量分析中,髋臼宽度AUC最高(0.972),切割点为50.9毫米。该研究表明,CT derived 的骨盆形态测量结合机器学习分类可为土耳其法医背景提供高度准确和可复现的性别估计方法,支持建立人群特异性标准。
三、主要关键技术方法
本研究采用的技术方法包括:从64层CT扫描仪获取骨盆三维骨重建图像;基于Franklin等人的 landmarks 方案定义14项骨盆形态测量;使用组内相关系数评估观察者间和观察者内信度;应用四种监督机器学习分类器(逻辑回归、LDA、随机森林、SVM),采用Z-score标准化和scikit-learn Pipeline避免数据泄漏;通过分层10折交叉验证和独立30%留出集评估泛化能力;使用随机森林特征重要性、SHAP值、标准化逻辑回归系数和LDA判别系数评估预测因子贡献;利用Youden指数推导单变量切割点;通过Bootstrap留出袋验证切割点乐观度。样本来自土耳其伊兹密尔Tepecik培训与研究医院2014年6月至2016年7月的回顾性CT检查。
四、结果分述
4.1 样本特征与性别差异:研究样本男女年龄匹配良好,14项测量中13项性别差异显著,女性耻骨下角、坐骨大切迹角和骨盆出口横径更大,男性髋臼、坐骨等尺寸更大。仅骶骨前宽无显著差异。
4.2 信度评估:所有测量观察者内ICC达优秀水平,观察者间除耻骨长度为良好外其余均为优秀,表明测量协议具有高度可重复性。
4.3 机器学习分类性能:四种分类器交叉验证准确率98.0–99.0%,AUC 0.991–0.994;独立留出集上逻辑回归、LDA和SVM均达100%准确率,随机森林96.7%。McNemar检验显示分类器间无显著差异。补充指标(平衡准确率、F1分数、MCC)进一步证实高分类性能。
4.4 稳定性与敏感性分析:20次独立重复交叉验证准确率变化极小,嵌套网格搜索优化超参数未产生实质改进,表明性能来自数据本身可分性而非特定划分或参数选择。
4.5 特征贡献与单变量切割点:髋臼宽度在随机森林重要性中排名第一,SHAP分析确认其向男性分类贡献最大。单变量AUC最高为髋臼宽度(0.972),其次为坐骨长度(0.961)、髋臼高度(0.958)、耻骨下角(0.955)和坐骨大切迹角(0.950)。Bootstrap验证显示切割点准确率仅有1–3个百分点的乐观偏差。
五、讨论与结论
与西方澳大利亚、日本和南非人群相比,土耳其人群的耻骨下角绝对值较窄(女性83.4° vs 日本112.7°、西方澳大利亚89.4°),但性别二态性模式一致。不同人群非显著变量各不相同,进一步支持骶骨性别二态性不稳定。与土耳其两项既往研究(DSP2软件验证和机器学习应用于耻骨下角)相比,本研究提供了更大测量面板、四种架构系统比较、正式信度评估和单变量切割点。传统上认为耻骨下角和坐骨大切迹是最强判别指标,但机器学习模型突出髋臼尺寸的作用,可能反映了非加性交互效应,但需专门分析验证。局限性包括单中心样本、中度多重共线性、年龄相关重塑的横断面局限、人群特异性限制等。总体结论:CT骨盆形态测量结合机器学习在土耳其人群中达到近乎完美的性别分类准确率,观察者间信度良好,为法医人类学案件提供了人群特异性参考标准,未来需多中心和外部验证以推广至常规实践。