《Annals of Medicine》:Structural validity and measurement invariance of the Japanese version of the Kessler Psychological Distress Scale (K6): an item response theory analysis
编辑推荐:
背景:凯斯勒心理困扰量表(Kessler Psychological Distress Scale, K6)广泛用于筛查心理困扰,但支持日本版(Japanese version of K6, JK6)质量的证据仍然有限,尤其是基于项目反应理论(item res
背景:凯斯勒心理困扰量表(Kessler Psychological Distress Scale, K6)广泛用于筛查心理困扰,但支持日本版(Japanese version of K6, JK6)质量的证据仍然有限,尤其是基于项目反应理论(item response theory, IRT)的项目参数和测试信息函数(test information function, TIF)方面的证据。跨性别和年龄组的测量不变性证据同样有限。因此,本研究在6632名20–59岁日语成人在线社区样本中检验了JK6的结构效度和测量不变性。材料与方法:采用验证性因子分析(confirmatory factor analysis, CFA)比较单因子与双因子模型。使用等级反应模型(graded response model)进行IRT分析,估计项目区分度和阈值参数,并导出项目信息函数与TIF。采用多组CFA(multi-group CFA, MCFA)检验跨性别和年龄组的测量不变性,并通过序数逻辑回归(ordinal logistic regression)检验项目功能差异(differential item functioning, DIF)。结果:CFA结果支持JK6主要可作为单维解释。IRT分析显示项目区分度非常高,TIF表明对轻度至中度心理困扰具有高测量精度。MCFA支持跨性别和年龄组的标量不变性,DIF效应量可忽略不计。结论:这些发现表明,JK6主要作为心理困扰的单维测量工具,在20–59岁日语成人在线社区样本中提供了跨性别和年龄组的精确且可比较的评估。应进一步开展研究,检验这些发现在更广泛的日本成人群体(包括老年人和临床人群)中的推广性。
论文解读:日本版凯斯勒心理困扰量表(JK6)的心理测量学评价
心理困扰是一个多层面构念,涵盖抑郁和焦虑等非特异性症状领域。心理困扰是许多精神障碍的常见临床特征,即使未达到精神障碍诊断标准,也会对心理健康产生严重影响,并与多种身心健康问题相关,包括死亡率增加、心血管疾病、癌症和糖尿病风险升高、生活质量下降、主观幸福感降低以及社会支持减弱。尽管心理困扰对个人和社会都是严重的健康问题,但在临床和社区环境中却往往未被充分识别或评估。因此,需要简单、可靠、有效且适合在临床和社区环境中进行筛查的评估量表,以便早期发现心理困扰并连接适当的支持服务。Kessler等开发的凯斯勒心理困扰量表(K6)因其简洁性、高信度和效度而被国际广泛认可为优秀的筛查工具。然而,日本版K6(JK6)虽然在实际中被广泛使用,但关于其结构效度、基于项目反应理论(IRT)的项目特征、测量精度以及测量不变性的证据仍然有限。为此,研究人员利用在线社区样本,对JK6的结构效度和测量不变性进行了系统检验。该研究发表于《Annals of Medicine》。
研究人员使用来自Uchida等先前研究的数据,该数据于2020年12月通过在线方式收集,样本为日本市场营销应用公司(Marketing Applications Inc.)维护的小组中的20–59岁日语成人。最终纳入6632名参与者。关键技术方法包括:采用加权最小二乘均值和方差调整(WLSMV)估计的验证性因子分析(CFA)比较单因子和双因子模型;使用等级反应模型(GRM)进行IRT分析,估计区分度参数(a)和难度参数(b),并计算项目信息函数(IIF)与测试信息函数(TIF);通过多组CFA(MCFA)检验性别和年龄组的测量不变性;使用序数逻辑回归检验项目功能差异(DIF)。同时计算了Cronbach's α和McDonald's ω系数评估内部一致性。
研究结果部分:
Characteristics of study participants(研究参与者特征):在135,848名受邀者中,6632人回应,应答率为4.9%。其中男性3321人(50.1%),女性3311人(49.9%)。平均年龄为39.6岁(标准差=11.42)。各年龄组分布均匀:20–29岁1652人(24.9%),30–39岁1658人(25.0%),40–49岁1656人(25.0%),50–59岁1666人(25.1%)。
Descriptive statistics for the JK6(JK6的描述性统计):参与者JK6总平均分为5.66分(标准差=5.79)。所有六个项目中,“完全没有”选项(0分)的选择率最高,其次是“偶尔”(1分)。
CFA(验证性因子分析):单因子模型的拟合指数为χ
2(9)=878.35,CFI=0.979,TLI=0.965,SRMR=0.018,但RMSEA=0.127,未达到预设的可接受标准。双因子模型的拟合指数为χ
2(8)=828.56,CFI=0.980,TLI=0.962,SRMR=0.017,RMSEA=0.133,且估计的因子间相关为r=1.012,表明存在不可接受解和统计上不可区分。因此,尽管两模型的RMSEA均偏高,但单因子模型被认为比双因子模型更合适和更简洁。标准化因子载荷范围为0.842至0.933。
IRT metrics(IRT指标):在应用IRT前,研究人员检验了关键假设。单维性方面,McDonald's分层ω与总ω之比为0.89,一般因子解释的共同方差比例较高,ECV为0.91,尽管PUC为0.53且RMSEA偏高,但综合高因子载荷和ECV支持单维性。单调性方面,Hi系数范围为0.70至0.80,无违反单调性。局部独立性方面,Yen's Q3统计量绝对值均低于0.37的阈值,支持局部独立。项目参数估计中,区分度参数a范围为2.913(项目1)至5.043(项目2),表明所有项目具有非常高的区分能力。难度参数b按b1
Item and test information(项目与测试信息):IIF显示多个项目在潜在特质θ=0至2范围内提供较高信息,其中项目2和4信息量高于其他项目。TIF在θ≈?0.76至2.68范围内达到5以上,峰值位于θ=1.45处,对应可靠性约0.97。这表明JK6对轻度至中度心理困扰具有特别高的测量精度。
Internal consistency and reliability(内部一致性与信度):Cronbach's α为0.94(95% CI: 0.94–0.94),McDonald's ω总值为0.94(95% CI: 0.94–0.95),分层ω为0.84(95% CI: 0.81–0.87),表明内部一致性非常高,且一般因子贡献显著。
Measurement invariance(测量不变性):MCFA依次检验了形态、度量和标量不变性。对性别组,形态模型的CFI=0.995,TLI=0.992,SRMR=0.019,RMSEA=0.122;模型比较中ΔCFI、ΔRMSEA和ΔSRMR均满足推荐标准,支持性别组的标量不变性。对年龄组,形态模型拟合良好(CFI=1.000,TLI=0.999,SRMR=0.019,RMSEA=0.060),所有变化量均符合标准,支持年龄组的标量不变性。
Examination of DIF(DIF检验):使用序数逻辑回归进行的DIF分析中,尽管若干项目在统计上表现出显著DIF(p<0.01),但所有项目的McFadden's R
2变化量均低于0.02,表明DIF的实际影响可忽略不计。因此,JK6项目在不同性别和年龄组间功能等价。
在讨论部分,研究人员指出CFA结果支持JK6主要作为单维量表测量心理困扰,这与K6原始理论及中国、越南、澳大利亚等研究一致。双因子模型因子间相关过高(r=1.012)表明统计上不可区分,与香港、加拿大研究不一致,可能原因是研究人群特征差异(本研究为20–59岁在线社区成人,而以往研究涉及年轻或临床人群)。IRT假设满足,区分度参数很高,TIF显示轻中度心理困扰区域精度高,且项目1信息量较低的现象与越南版K6研究类似,提示这一现象可能跨语言存在。测量不变性结果与加拿大一项研究一致,但与澳大利亚青少年研究不同,这或许与K6原本面向成人设计有关。研究人员也承认研究的局限性:样本仅限于在线调查小组中20–59岁成人,应答率仅4.9%,可能存在选择偏倚;非临床样本;未评估聚合效度和效标效度。未来需在青少年、老年人、临床人群及非在线样本中进一步验证。
研究结论部分翻译如下:本研究在20–59岁日语成人在线社区样本中,结合IRT和经典测量理论检验了JK6的结构效度。研究基于大样本(n=6632),整合了CFA、IRT项目参数估计、测试信息分析以及测量不变性和DIF评估。结果支持JK6主要为单维因子结构,并显示其对轻度至中度心理困扰具有高测量精度。跨性别和年龄组的测量不变性获得支持,表明在该样本中JK6对这些人口统计学群体进行了可比较的心理困扰评估。总体而言,这些发现表明,JK6在在线社区招募的20–59岁日语成人样本中评估心理困扰时具有可接受的结构效度、高测量精度和测量不变性。未来研究应通过检验其他效度方面(包括聚合效度、区分效度、效标效度和诊断准确性),并在青少年、老年人、临床人群以及在线调查小组之外招募的样本中评估该量表,来扩展这些发现。