摘要
背景
酒精使用障碍(AUD)的广泛相关性因素(例如人口统计学特征、社会经济地位[SES]、脑科学特征、遗传学因素)通常表现为效应量较小,且研究往往相互独立进行。新颖的多变量非线性方法可能有助于刻画AUD的多面相关性特征并识别其最强预测因子。
方法
本研究利用梯度提升机(GBMs),基于以下5个领域内的特征(n=440个)对UK Biobank(N=12,178)中的AUD进行分类:(1)人口统计学特征(n=12)、(2)社会经济地位(n=18)、(3)非成瘾物质相关心理健康(n=55)、(4)非酒精类物质使用(n=6)、(5)生物学特征(n=342)。我们利用可解释人工智能(xAI)来刻画各特征对模型性能的贡献及其异质性,以及各领域特征对模型性能的集体贡献程度。
结果
在样本外保留测试集(n=6,089)中,我们的模型对终生AUD分类表现良好(AUC=0.80)。值得注意的是,特征重要性分析表明,人口统计学特征(年龄、性别、收入)、物质使用情况(是否曾经吸烟或使用大麻)以及心理健康问卷(社交孤立)对AUD分类最具信息量。梯度提升机显著优于线性模型,且变量间存在显著的非零两两交互效应,提示AUD表型可能因收入和性别不同而存在异质性。此外,逐步纳入神经影像和遗传数据作为特征,对AUD分类产生了虽小但一致的提升,效应量分布在多个变量中(基于整体模型分类的增益为0%–2%)。这表明生物学特征在超越心理和人口统计学指标方面对AUD分类仍具有重要作用,尽管仅凭单一选定脑区的分类能力可能有限。
结论
考虑非线性关系的多模态多变量方法可能改善我们对AUD相关性因素的理解。特别是,纳入与人口统计学因素的交互效应以及整合跨生物学特征的信息,可能进一步提升模型性能。
图文摘要
利益冲突
作者声明不存在利益冲突。
数据可用性声明
支持本研究结果的数据可在UK BioBank公开获取:https://www.ukbiobank.ac.uk/about-our-data/。



