《Journal of Biomedical Informatics》:Predicting healthy weight status from physical activity and dietary intake: A time-aware data mining pipeline
编辑推荐:
摘要
目的:开发并评估一种时间感知的数据挖掘流水线,该流水线整合了基于加速度计的身体活动(Physical Activity, PA)、静态饮食摄入和社会人口学因素,以预测健康体重状态(Healthy Weight Status, HWS),并识别对HWS
摘要
目的:开发并评估一种时间感知的数据挖掘流水线,该流水线整合了基于加速度计的身体活动(Physical Activity, PA)、静态饮食摄入和社会人口学因素,以预测健康体重状态(Healthy Weight Status, HWS),并识别对HWS具有预测重要性的特征。
方法:研究人员提出TimePAD(Time-Based Physical Activity and Dietary Intake data mining),一种三阶段预测流水线,整合基于时间的PA表征、静态饮食摄入和社会人口学变量,以预测HWS类别。阶段1推导出强度特异性的小时PA序列,并利用基于掩码自监督学习(Self-Supervised Learning, SSL)重建训练的Transformer编码器学习一天中的时间PA嵌入。阶段2将学习到的PA嵌入与静态饮食变量和来自食物频率问卷(Food Frequency Questionnaire, FFQ)的参与者特征相结合。阶段3训练预测模型,并根据其对HWS的预测重要性对预测因子进行排序。TimePAD在一个包含206名青少年(10–16岁)的真实世界数据集上进行评估,该数据集包含7天连续腕戴式加速度计数据、FFQ记录和社会人口学属性,采用10折交叉验证并与基于ARIMA的特征工程基线进行比较。
结果:TimePAD在HWS预测中实现了82.90%的准确率和67.92%的F1分数,优于最佳基线(基于ARIMA的PA特征+饮食,准确率77.51%)。在实验中,一天中的时间轻度PA(Light PA, LPA)特征始终被列为重要预测因子。其他关键特征包括一天中的时间中高强度活动(Moderate-to-Vigorous Activity, MVPA)和久坐(Sedentary, SED)水平、Tanner分期、每周总睡眠时间、年龄(月)、每周水果摄入量、每周蔬菜和豆类摄入量以及含糖饮料摄入量。
讨论:TimePAD贡献了一种流水线,用于从可穿戴PA时间序列中的一天中时间结构学习,并将其与静态饮食和背景数据整合,以进行预测和特征分析。研究结果表明,LPA可能与HWS存在显著关联,需要进一步关注和调查以更好地理解LPA在整体健康结果中的作用。这说明TimePAD在结合饮食摄入背景建模PA以塑造健康行为方面的潜在益处。
论文解读文章
**研究背景与问题**
全球健康领域指出,缺乏身体活动(Physical Activity, PA)和不良饮食是导致肥胖及2型糖尿病等非传染性疾病的主要风险因素。青少年肥胖率持续上升,迫切需要理解如何通过日常PA模式和饮食维持健康体重。现有研究多采用聚合指标(如日均PA总量)或仅关注中高强度活动(Moderate-to-Vigorous Activity, MVPA),忽视了PA在一天中不同时间的分布特征,且PA与饮食的联合分析仍较少。此外,深度学习在PA与饮食联合预测体重健康状态(Healthy Weight Status, HWS)中的应用有限。因此,研究人员提出一种时间感知的数据挖掘流水线TimePAD,旨在从可穿戴加速度计数据中提取时间维度的PA特征,并与静态饮食摄入和社会人口学因素整合,以预测青少年HWS并识别关键特征。该论文发表在《Journal of Biomedical Informatics》。
**主要关键技术方法**
研究人员采用三阶段流水线TimePAD:第一阶段,将原始加速度计数据预处理为每小时、每种强度(久坐SED、轻度LPA、中高强度MVPA)的时长和回合数序列,利用基于掩码自监督学习(SSL)重建的Transformer编码器提取一天中时间PA嵌入;第二阶段,将学习到的PA嵌入与来自食物频率问卷(FFQ)的静态饮食变量及社会人口学特征(如年龄、性别、Tanner分期)拼接;第三阶段,使用支持向量机(SVC)等分类器进行HWS二分类预测,并通过支持向量机递归特征消除(SVM-RFE)评估特征重要性。数据集来自新喀里多尼亚206名10–16岁青少年,包含7天腕戴式加速度计数据、FFQ记录和社会人口学信息。
**研究结果**
- **Time-based PA features(时间基PA特征)**:通过对比Transformer编码器、LSTM自动编码器和TCN自动编码器的重建损失(MSE),Transformer在SED(0.1286)、LPA(0.0856)和MVPA(0.0987)上均获得最低验证损失,证实其能有效提取时间基PA模式。
- **HWS prediction and feature importance(HWS预测与特征重要性)**:在10次随机试验中,SVC(线性核)在准确率、F1分数和灵敏度上均优于NuSVC、KNN、XGBoost和AdaBoost,最佳配置达到准确率82.90%、F1分数67.92%。特征重要性排名显示,一天中时间LPA特征被一致列为最重要的预测因子,其次为MVPA、SED、Tanner分期、年龄、每周水果摄入、含糖饮料摄入等。
- **Comparison across PA modelling strategies(PA建模策略对比)**:与无PA特征、静态PA特征(日均MVPA)、端到端Transformer、ARIMA基线等相比,TimePAD(Transformer编码器PA+社会人口学+饮食)在所有特征组合中取得最高预测性能,显著优于ARIMA基线的77.51%准确率。
- **Post-hoc TimePAD pipeline analyses(事后分析)**:SMOTE敏感性分析显示,50:50比例下F1分数和灵敏度最高;亚组分析表明,TimePAD在男孩中表现优于女孩,工作日PA数据略优于周末,交叉亚组评估提示学习到的PA表征具有一定跨情境迁移能力。
**讨论与结论**
讨论部分指出,时间基PA模式(尤其LPA)对HWS预测的重要性超过传统聚合指标,这与近期关于LPA与体成分关联的研究一致。饮食摄入(如果蔬、含糖饮料)和发育阶段(Tanner分期)的加入进一步提升了预测效能。研究局限性包括:深度学习模型可解释性不足、数据集仅来自单一队列。未来工作需结合事后可解释性方法,并在更广泛人群中验证。
结论:研究人员提出TimePAD,一种利用无监督表征学习从加速度计数据中提取时间PA特征并整合静态饮食摄入以预测HWS的流水线。结果表明,时间感知的PA特征提取能更有效揭示各强度水平PA模式,凸显了LPA的重要性,并为可穿戴行为数据在生物医学信息学中的应用提供了新方法。