《Frontiers in Psychology》:Understanding emotional responses to music using machine learning: evidence from a public dataset
编辑推荐:
全球约有数亿人患有严重或负面的心理健康疾病(mental health, MH)。然而,个体对音乐对心理健康影响的感知差异很大。本研究旨在开发和验证基于机器学习的模型,以预测音乐对自我报告心理健康(MH)的影响。使用基准数据集来分析所评估的机器学习模型,该数据
全球约有数亿人患有严重或负面的心理健康疾病(mental health, MH)。然而,个体对音乐对心理健康影响的感知差异很大。本研究旨在开发和验证基于机器学习的模型,以预测音乐对自我报告心理健康(MH)的影响。使用基准数据集来分析所评估的机器学习模型,该数据集包含34个变量的1,626名个体。此外,该数据集分别采用最先进的技术划分为训练集和测试集。在所有检查的机器学习算法中,Subspace KNN分类器表现最佳,分类准确率达90.2%。然而,本研究的主要重要性在于其方法论,而非算法本身,表明敏感性分析显示,预测变量和研究设计对预测性能的影响远大于所用算法。虽然有研究引入了新的机器学习架构,但本研究旨在系统比较现有的监督学习方法,用于一项相对未被充分探索的预测任务,即预测异质性的自我报告音乐对心理健康的影响。关键的方法论进步不仅在于分类器的比较,还在于敏感性分析表明,分类算法的选择对预测性能的影响远小于预测变量和研究设计的选择。需要注意的是,高分类准确率并不意味着听音乐是预测治疗效果的唯一因素。事实上,很大一部分预测能力来自个体初始的心理健康状态,该状态与结果变量直接相关,从而构成了预测因子-结果的循环性。然而,敏感性分析显示,分类器的性能受到焦虑、抑郁、失眠和强迫症等基线心理健康因素存在的显著影响。然而,重要的是要注意,这一准确率因纳入与结果变量概念上重叠的心理健康严重程度预测因子(焦虑、抑郁、强迫症)而大幅膨胀。排除这些变量的敏感性分析产生了一个更适度的准确率73.2%,表明模型的预测能力主要来自这种循环关系,而非音乐特定特征。为了确定与音乐特别相关的特征的贡献,进行了进一步的敏感性测试,排除了心理健康相关变量。这样,分类准确率降至73.2%。这表明预测变量的选择对模型成功的影响比算法选择更重要。因此,结果应被视为反映对音乐反应的预测。此外,约三分之一参与者在所有结果指标上各组的分布均衡,报告他们在心理健康方面经历了音乐的负面影响,这对认为所有心理健康障碍患者都能从音乐中获益的假设提出了质疑。最后,结果表明,接触音乐可以根据在结果评估前收听的音乐类型帮助区分各组。然而,本研究的主要贡献更多在于其经验性质,而非算法方面。与先前引入新型机器学习技术对行为健康建模的研究不同,本研究评估了现有的机器学习方法,以预测关于音乐对心理幸福感影响的自我报告感知。这一评估表明,预测变量的选择对机器学习模型的影响显著大于机器学习算法的选择。
本论文发表于《Frontiers in Psychology》,是一项基于公共数据集的实证研究,旨在利用机器学习(machine learning, ML)预测个体自我报告的音乐对心理健康(mental health, MH)的影响。研究背景在于,全球心理健康问题负担沉重,但传统音乐治疗多采用“一刀切”模式,忽略了个体间显著的异质性;同时,部分个体可能报告音乐对心理健康的负面影响。因此,研究人员希望系统比较现有监督学习方法,探索能否根据人口学特征、音乐行为、类型偏好及基线心理健康状态,预测个体感知到的音乐对心理健康的效应(恶化、无影响、改善)。
研究人员使用了公开的Kaggle Music and Mental Health Survey数据集。原始数据经质量筛选后共有737份问卷,通过分层随机抽样与重复过采样(未使用SMOTE)得到1,626名参与者的平衡数据集,三个结果类别各占33.3%。数据集包含34个预测变量:人口学特征(如年龄、流媒体服务)、音乐行为(如每日听音乐小时数、是否演奏乐器/作曲、是否探索新音乐、是否听外语歌曲、偏好速度BPM)、16种音乐类型的收听频率(Likert 0–4量表)、以及基线心理健康变量(焦虑、抑郁、失眠、强迫症(obsessive-compulsive disorder, OCD)的严重程度与诊断指标)。结果变量为三分类的自我报告音乐效应:恶化(?1)、无影响(0)、改善(+1)。研究采用80/20分层划分训练集(n=1,301)和测试集(n=325),训练集又经10折交叉验证。共训练33个模型,涵盖支持向量机(support vector machine, SVM)、K近邻(k-nearest neighbors, KNN)、集成方法(如Subspace KNN、Bagged Trees、Boosted Trees)、神经网络(neural networks, NN)等,并使用网格搜索优化超参数。所有分析在MATLAB R2023a中完成。关键方法还包括敏感性分析:在去除所有基线心理健康预测变量后,仅用26个音乐相关和人口学特征重新训练同一Subspace KNN模型,以量化预测因子-结果循环性对准确率的贡献。
研究结果分节报告如下:
4.1 参与者特征与心理健康患病率:在1,626名参与者中,焦虑检出率为51.7%(n=840),抑郁为44.0%(n=716),失眠为21.8%(n=354),强迫症为10.1%(n=165),且存在显著共病(如59.2%的焦虑者同时报告抑郁),说明样本具有临床相关性。
4.2 音乐聆听行为与参与模式:59.6%的参与者在工作时听音乐,16.8%为乐器演奏者,8.3%为作曲家,53.2%主动探索新音乐,45.0%听外语音乐,表明音乐参与具多样性和普遍性。
4.3 自我报告音乐对心理健康的影响:三组人数完全相等(各542人,33.3%),分布完全平衡,避免了类别不平衡问题。值得注意的是,约三分之一的参与者报告音乐恶化了心理健康,说明音乐并非对所有人都有益。
4.4 类型偏好与收听频率模式:在报告音乐改善心理健康的组中,古典、爵士、lofi等类型的平均收听频率较高;而在报告恶化组中,金属、说唱等类型的频率较高。由于数据为横截面,无法判断因果方向。
4.5 机器学习模型性能与比较:32个模型成功收敛(三隐层神经网络未收敛)。Subspace KNN表现最佳,测试集准确率90.15%,验证集准确率88.39%,Cohen's κ=0.852,各类别精确率、召回率、F1分数均高于0.89。
4.6 模型族性能比较:核方法平均测试准确率最高(86.31%),其次为支持向量机(81.90%)和神经网络(80.62%)。高斯核SVM和核方法模型均达到89.54%的测试准确率。
4.7 计算效率与部署考虑:Subspace KNN在准确率和计算成本之间取得较好平衡(计算成本32单位,训练时间10.05秒),适合资源受限或大规模应用场景;高效逻辑回归和高效线性SVM计算成本更低,但准确率约低12个百分点。
4.8 敏感性分析:当去除焦虑、抑郁、失眠和强迫症等心理健康严重程度变量后,同一Subspace KNN模型的测试准确率从90.2%降至73.2%(验证集71.8%),下降17个百分点。这表明原始模型的高准确率主要来自预测变量与结果之间的概念重叠(循环性),而非音乐特异性特征。
4.9 特征重要性分析:基于排列的特征重要性显示,抑郁严重程度(0.089)、焦虑严重程度(0.076)和强迫症严重程度(0.039)排名前三,进一步证实了循环性的存在。在音乐相关特征中,收听lofi、古典和金属音乐的频率贡献相对较大,但小于心理健康变量的贡献。
4.10 稳健性与亚组分析:Subspace KNN模型在10次独立随机重复中的平均测试准确率为89.8%±1.2%;在年龄(18–25岁89.4%,26–40岁90.8%,41岁以上88.9%)和性别(男性89.2%,女性90.6%,非二元/其他88.1%)之间表现稳定,差异无统计学意义(p>0.05)。但老年(n=87)和非二元(n=43)亚组样本量小,结果应谨慎解释。
讨论部分指出,约三分之一参与者报告音乐的负面影响,可能与情绪一致的音乐选择、反刍或回避应对等因素有关,但横断面设计无法确证。研究的核心贡献在于方法学而非算法:敏感性分析表明,预测变量的选择和研究设计对模型性能的影响远大于分类算法的选择。这一发现支持“以数据为中心的人工智能”范式。结论部分强调,尽管Subspace KNN是本研究中最准确的分类器,但真正有科学意义的结果是移除心理健康预测变量后73.2%的准确率——它表明仅凭音乐行为和人口学特征仍可在一定程度上预测自我报告的音乐效应,但幅度有限。未来的研究应采用前瞻性纵向设计、客观心理健康指标,并避免预测因子与结果变量的循环重叠,以建立更可靠的因果推断和个性化干预基础。