《Frontiers in Endocrinology》:Clinical evaluation and predictive model development of AI-based non-invasive embryo selection in in vitro fertilization patients
编辑推荐:
背景:胚胎筛选仍然是决定体外受精(IVF)成功率的关键因素之一。传统胚胎分级主要依赖形态学评估,存在观察者间差异和预测准确性有限的问题。人工智能(AI)的最新进展使得非侵入性系统能够分析胚胎学及形态动力学特征,从而改善胚胎筛选和生殖结局。目的:评估基于AI的非
背景:胚胎筛选仍然是决定体外受精(IVF)成功率的关键因素之一。传统胚胎分级主要依赖形态学评估,存在观察者间差异和预测准确性有限的问题。人工智能(AI)的最新进展使得非侵入性系统能够分析胚胎学及形态动力学特征,从而改善胚胎筛选和生殖结局。目的:评估基于AI的非侵入性胚胎筛选系统的临床有效性,并为接受辅助生殖治疗的患者开发IVF结局预测模型。方法:在一家三级生育中心开展了一项回顾性队列研究,纳入2020年1月至2024年12月期间的300个IVF周期。临床、人口学、胚胎学及AI衍生数据均从电子病历和实验室数据库提取。主要结局为临床妊娠;次要结局包括植入、持续妊娠、活产及模型性能。采用准确率、敏感性、特异性、精确率、F1分数和受试者工作特征曲线下面积(AUC-ROC)评估机器学习算法(逻辑回归、随机森林、支持向量机、梯度提升和神经网络)。结果:共分析了300个IVF周期和742枚胚胎。植入率、临床妊娠率、持续妊娠率和活产率分别为60.7%、56.0%、51.3%和48.7%。较高的AI衍生胚胎评分与改善的结局显著相关。临床妊娠率随AI评分类别逐级递增,从18.5%(评分<55)升至74.0%(评分≥85,p<0.001)。多变量逻辑回归确定母亲年龄(AOR=0.92;95% CI:0.88–0.97)、抗缪勒管激素(AMH)(AOR=1.18;95% CI:1.04–1.34)、高质量囊胚(AOR=2.41;95% CI:1.54–3.78)和AI评分≥85(AOR=3.67;95% CI:2.12–6.35)为临床妊娠的独立预测因子。所开发的AI模型表现出优异的性能,准确率为84.3%,敏感性为82.1%,特异性为79.8%,AUC-ROC为0.89。结论:基于AI的非侵入性胚胎筛选对生殖结局具有显著的预测价值,且在识别高植入潜力胚胎方面优于传统评估方法。AI衍生的胚胎评分与临床妊娠成功独立相关,该模型展现出优异的区分度和校准度。这些发现支持将AI辅助胚胎评估整合到当代IVF实践中,并强调其在增强个体化生殖保健方面的潜力。
**基于AI的非侵入性胚胎筛选在IVF中的临床评估与预测模型开发——论文解读**
不孕症是影响全球数百万夫妇的重大公共卫生挑战,与显著的心理、社会和经济负担相关。体外受精(IVF)作为辅助生殖技术(ART)的核心手段,自1978年首例试管婴儿诞生以来已广泛应用。IVF成功与否高度依赖胚胎质量与精准的胚胎筛选。传统胚胎评估主要基于形态学分级,如卵裂球数目、对称性、碎片程度、囊胚扩张、内细胞团及滋养层形态等,但该方法具有主观性强、观察者间变异大、静态观察难以捕捉动态发育特征等局限。因此,探索更客观、可重复且无创的胚胎筛选方法成为生殖医学领域的研究热点。近年来,人工智能(AI)技术被引入胚胎评估领域,通过分析静态图像或时差成像(time-lapse)序列中的形态学与形态动力学特征,有望提高胚胎筛选的准确性。然而,多数已有研究聚焦于算法开发和内部验证,缺乏真实世界临床环境下的效果评价,且将AI衍生参数与人口学、临床及胚胎学特征整合构建预测模型的研究尚少。本研究旨在评估基于AI的非侵入性胚胎筛选系统的临床效能,并开发用于预测IVF结局的模型。
研究人员采用回顾性队列研究设计,在一家三级生育与辅助生殖技术中心进行,纳入了2020年1月至2024年12月期间行IVF/卵胞浆内单精子注射(ICSI)治疗的300个周期。数据来源于电子病历、IVF实验室数据库、胚胎学报告及AI胚胎评估平台。纳入标准为年龄20–45岁、接受胚胎移植且有完整临床、胚胎学、AI评估及随访资料的患者;排除临床记录不完整、AI数据缺失、移植周期取消、卵母细胞捐赠或代孕周期、实验性治疗方案及失访者。最终共分析300个周期和742枚具有完整时差成像及AI评估数据的胚胎。主要结局为临床妊娠,次要结局包括植入、生化妊娠、持续妊娠、活产及模型性能。研究人员采用多种机器学习算法,包括逻辑回归、随机森林、支持向量机(SVM)、梯度提升和人工神经网络,以7:3比例随机划分训练集和测试集,并采用分层五折交叉验证进行超参数优化。模型性能通过准确率、敏感性、特异性、精确率、召回率、F1分数及受试者工作特征曲线下面积(AUC-ROC)评估,并用校准图和Hosmer-Lemeshow检验评价校准度。
研究结果如下:**3.1 参与者特征**:共纳入300个IVF周期,患者平均年龄(32.8±4.6)岁,其中46.7%处于30–34岁年龄段,原发不孕占62.0%,平均体质指数(BMI)为25.6±3.8 kg/m2,不孕年限平均5.2±2.7年。训练集和测试集基线特征无显著差异。**3.2 临床和生殖特征**:平均抗缪勒管激素(AMH)为3.1±1.4 ng/mL,基础卵泡刺激素(FSH)为7.8±2.1 IU/L,平均获卵数11.2±4.1个,成熟卵母细胞9.4±3.5个,受精卵数7.8±2.9个,受精率69.6%。**3.3 胚胎学特征**:742枚胚胎中,形态学分级为高质量286枚(38.5%)、中等质量313枚(42.2%)、低质量143枚(19.3%)。同一形态学等级内部存在显著的植入结局异质性,凸显传统评估的局限。**3.4 AI胚胎评估结果**:AI评分范围为22–98,平均76.4±12.8,约70%的胚胎评分高于70。按阈值分为优秀(≥85)192枚(25.9%)、良好(70–84)324枚(43.7%)、中等(55–69)161枚(21.7%)、差(<55)65枚(8.7%)。**3.5 植入与妊娠结局**:植入率60.7%(182例),生化妊娠率58.7%(176例),临床妊娠率56.0%(168例),持续妊娠率51.3%(154例),活产率48.7%(146例)。**3.6 AI评分与临床结局的关系**:临床妊娠率随AI评分类别递增——评分≥85组为74.0%,70–84组为60.2%,55–69组为39.1%,<55组仅为18.5%,差异有统计学意义(χ2=42.6,p<0.001)。**3.7 成功IVF结局的预测因子**:多变量逻辑回归显示,产妇年龄(调整后比值比[AOR]=0.92;95% CI:0.88–0.97)、AMH水平(AOR=1.18;95% CI:1.04–1.34)、高质量囊胚(AOR=2.41;95% CI:1.54–3.78)及AI评分≥85(AOR=3.67;95% CI:2.12–6.35)均为临床妊娠的独立预测因子。**3.8 AI预测模型性能**:模型准确率84.3%,敏感性82.1%,特异性79.8%,精确率81.4%,F1分数81.7%,AUC-ROC为0.89。**3.9 ROC曲线与模型验证**:AUC为0.89(95% CI:0.85–0.93),校准图显示预测概率与观测概率良好吻合,Hosmer-Lemeshow检验p=0.47,提示校准度良好。**3.10 特征重要性分析**:AI胚胎评分对预测贡献最大,其后依次为囊胚质量、产妇年龄、AMH水平和受精率。
讨论部分指出,AI评分与临床结局之间存在剂量-反应关系,提示AI系统能够捕获传统形态学评估无法察觉的细微特征。与既往研究一致,AI辅助评估可降低主观变异,提高标准化水平。模型良好的区分度(AUC 0.89)和校准度表明其具有临床决策支持潜力。基于AI的胚胎选择可能有助于优化胚胎排名,支持选择性单胚胎移植策略,并可能降低治疗周期数和总体费用。然而,本研究为单中心回顾性设计,样本量有限,模型泛化性需通过前瞻性多中心外部验证确认。与传统机器学习方法相比,先进深度学习架构(如3D-CNN、CNN-LSTM等)可直接从图像学习时空特征,但需要更大标注数据集和更强计算资源,且可解释性较差。未来研究应侧重于多中心外部验证,统一结局定义,并评估AI对累积活产率及成本效益的实际影响。结论方面,本研究证实基于AI的非侵入性胚胎筛选与改善的IVF结局显著相关,其预测价值超出传统胚胎分级方法。较高的AI胚胎评分独立关联于临床妊娠率增加,所构建模型显示出优秀的区分度和校准度。这些结果支持AI辅助胚胎评估在提高胚胎筛选客观性、准确性和个体化方面的潜在作用;但由于模型为单中心回顾性开发,其性能尚不能假设可推广至不同人群和实验室条件。未来必须进行前瞻性、地理和临床多样化的独立生育中心严格外部验证,评估其判别力、校准度、临床实用性、可重复性及对植入率、累积活产率、工作流程和成本效益的影响,只有在真实世界验证成功后才能推荐其用于IVF实验室的常规临床决策。