《Research Synthesis Methods》:A tutorial on fitting flexible meta-analytic models with structural equation modeling in R
编辑推荐:
摘要
元分析中存在多种具有不同特征和假设的统计模型。常用模型包括固定效应(或共同效应)模型、随机效应模型和混合效应模型。除这些模型外,文献中还提出了若干替代模型,如乘法误差模型(multiplicative error model,亦称无约束加权最小二乘[UW
摘要
元分析中存在多种具有不同特征和假设的统计模型。常用模型包括固定效应(或共同效应)模型、随机效应模型和混合效应模型。除这些模型外,文献中还提出了若干替代模型,如乘法误差模型(multiplicative error model,亦称无约束加权最小二乘[UWLS]模型)、加性与乘性误差混合模型以及位置-尺度模型(location-scale model)。对于缺乏扎实数学基础的研究人员而言,理解这些模型可能具有挑战性。除非研究人员具备高级统计和编程知识,否则实施或修改这些模型则更具难度。本教程阐明了一个结构方程建模(structural equation modeling,SEM)框架,以帮助理解这些模型。教程介绍了多个R包,以促进这些元分析模型的设定和图形化模型生成。研究人员可使用全信息极大似然(full information maximum likelihood,FIML)估计方法拟合这些模型。这在两个领域具有重要潜力。首先,它可作为元分析模型教学与学习的教育工具。其次,该框架支持开发和评估尚未在当前元分析软件中实现的新型元分析模型,从而推动元分析方法学的进步。本教程还使用两个真实数据集演示了如何扩展该方法以解决涉及复杂元分析数据的研究问题。文中讨论了基于SEM的元分析的局限性及未来扩展方向。
基于结构方程建模的元分析模型拟合教程:背景、方法、结果与意义
一、研究背景与问题提出
元分析作为一种强大的研究综合工具,广泛应用于心理学、管理学、公共卫生和医学科学等多个学科领域。在元分析的模型体系中,固定效应模型(或称共同效应模型)曾一度被广泛采用,但其局限性已逐渐被认识到。当研究目标旨在超越纳入研究进行泛化,且效应量并非同质时,固定效应模型估计的标准误(standard errors,SEs)会被低估。当前,随机效应模型和混合效应模型已成为当代元分析中最常用的模型。随机效应模型假设研究间效应量的变异源于某些未知随机因素和抽样误差。在存在过度异质性的情况下,混合效应模型纳入调节变量或协变量来解释该异质性。
近年来,文献中提出了若干替代性元分析模型并得到日益广泛的应用,包括乘法误差模型(或称无约束加权最小二乘[UWLS]模型)、结合加性与乘性误差项的混合模型、位置-尺度模型(location-scale model)以及非线性模型。这些高级模型通常以方程和算法形式呈现以获取参数估计值和标准误,要求研究者具备扎实的统计学背景方能理解和实施。使用这些模型的研究者往往需要等待这些模型在R、Python或Stata等编程语言中被实现。尽管一些流行的元分析工具(如R中的metafor包)提供了有价值的功能,但为特定研究目的定制这些模型仍面临重大挑战。
针对上述问题,本研究旨在填补元分析文献中的两个重要研究空白。第一,通过图形建模方法帮助研究者学习和理解各种元分析模型及其基本假设。在这些模型中,图形表示、方程和矩阵形式之间存在直接对应关系,无需复杂方程即可简化元分析的教学与学习。第二,使研究者能够在R中拟合一系列元分析模型,并允许定制新颖模型以纳入效应量的前因和后果,为研究者提供设定自身元分析模型的灵活性。基于SEM的元分析为实现和检验元分析中的新研究问题提供了一种直接而强大的手段。该论文发表在《Research Synthesis Methods》。
二、研究内容与主要结论
本教程展示了如何将各种标准和高级元分析模型表达为结构方程模型。首先概述了SEM的基本概念,然后引导用户完成在SEM框架内设定常见元分析模型的过程,包括固定效应模型和随机效应模型、乘法误差模型、结合加性与乘性误差的混合模型。随后涵盖了含协变量的模型和复杂模型,如位置-尺度模型和非线性模型。教程还展示了该方法如何定制不符合传统元分析框架的模型,包括效应量间的回归模型。教程使用metaSEM包(后端使用OpenMx、lavaan和semPlot包)以及symSEM包提供了演示这些程序的示例。
三、关键技术方法
研究人员采用了结构方程建模(SEM)框架作为核心方法论基础。具体而言,研究使用了Reticular Action Model(RAM)矩阵表达形式来表征元分析模型,包括A矩阵(非对称路径)、S矩阵(对称路径)、M向量(均值与截距)和F矩阵(筛选矩阵)。研究人员采用lavaan语法进行模型设定,并通过metaSEM包将方程自动转换为RAM规范。参数估计采用全信息极大似然(FIML)估计方法,该方法的优势在于能够处理缺失数据。教程还介绍了定义变量(definition variable)的用法,以将已知抽样方差v
i分配给各个研究。样本数据来源包括Jaramillo等人(组织承诺与销售人员工作绩效相关性研究,61项研究)和Chan等人(错误信息与辟谣效应研究,34个独立样本)的数据集。
四、研究结果
4.1 无外部变量模型
4.1.1 固定效应模型
固定效应模型假设所有研究共享相同的真实或总体效应量μ。研究者通过两个等价模型(显式设定潜在变量e
i与不设定e
i)进行拟合,两种方式结果一致。拟合后得到参数估计值$\hat{\mu}=0.1938$,95% Wald置信区间为[0.1782, 0.2093]。
4.1.2 随机效应模型
随机效应模型允许每个研究估计其自身独特的总体效应量,效应量变异源于真实异质性(τ2)和抽样误差(v
i)。拟合后得到$\hat{\mu}=0.1866$,95% Wald CI为[0.1487, 0.2245];$\hat{\tau}^2=0.0170$,95% Wald CI为[0.0089, 0.0251]。
4.1.3 乘法误差模型
乘法误差模型将抽样误差方差v
i视为按比例估计的量而非固定已知值。拟合后$\hat{\mu}=0.1938$,95% Wald CI为[0.1571, 0.2304];$\hat{\phi}=5.5637$,95% Wald CI为[3.5891, 7.5384]。由于φ的置信区间不包含1,表明数据呈现过度离散。
4.1.4 加性与乘性误差混合模型
研究人员探讨了三种混合模型。混合模型1(Schmid简化版)结合研究特定方差τ2和缩放抽样方差φv
i,拟合得到$\hat{\phi}=1.6565$,95% Wald CI为[-0.6720, 3.9849],φ的置信区间包含1,故在0.05水平上不显著。混合模型2(Baker-Jackson原始模型)的方差结构为v
i+τ2v
iω,拟合得到$\hat{\omega}=0.1204$,95% Wald CI为[-0.4562, 0.6971],更接近0(加性误差模型)而非1(乘性误差模型)。混合模型3(Hartung-Knapp-Sidik-Jonkman [HKSJ]方法)将随机效应模型的异质性方差估计作为固定值,拟合得到$\hat{\phi}=1.0173$,95% Wald CI为[0.6563, 1.3784]。
4.2 含外部变量模型
4.2.1 固定X元回归
研究人员使用国家个人主义得分x
i作为协变量预测效应量。通过幻影变量(phantom variable)η
i表示协变量,估计得到$\hat{\beta}_1=-0.0013$,95% Wald CI为[-0.0033, 0.0006]。
4.2.2 随机X元回归
将协变量x
i作为模型中的变量处理,可处理缺失数据。两种方法结果一致(因无缺失数据),R2
random-x=0.0371,95% LBCI为[0.0000, 0.1926]。
4.2.3 将协变量回归于真实效应量
研究人员将引用次数z
i回归于真实效应量f
yi而非观测效应量y
i(传统做法的偏误来源)。正确方法估计$\hat{\beta}_1=-1.9755$,SE=1.0733;而忽视抽样方差的方法得到$\hat{\beta}_1=-1.4114$,SE=0.8051。
4.2.4 部分标准化协变量的元回归
研究人员通过潜在变量方法进行部分标准化,避免了手动标准化产生的有偏标准误。估计R2=0.0371,95% Wald CI上限为0.1425(下限截断为零)。
4.2.5 协变量与真实效应量的相关
研究人员估算了真实效应量与协变量间的相关,得到$\hat{\rho}=-0.1925$,95% Wald CI为[-0.4667, 0.0816]。
4.2.6 位置-尺度与非线性模型
位置-尺度模型同时对均值和方差结构进行建模。加性误差模型拟合后,均值结构系数$\hat{\beta}_1=-0.0013$,95% Wald CI为[-0.0031, 0.0005];方差结构系数$\hat{\alpha}_1=0.0054$,95% Wald CI为[-0.0204, 0.0312]。乘性误差版本拟合后,$\hat{\beta}_1=-0.0026$,95% Wald CI为[-0.0047, -0.0005],在均值结构中统计显著。
4.3 多元元分析
研究者使用Chan等人数据演示双变量元分析,将一个真实效应量回归于另一个真实效应量。估计得到$\hat{\beta}^{(2)}_1=0.6836$,95% Wald CI为[0.4361, 0.9310],R2=0.7989,95% Wald CI为[0.5850, 1.0000](上限截断至1.00)。
五、讨论与结论
讨论部分指出,基于SEM的元分析具有多项优势:可通过方程定义模型、转换为图形模型、计算模型隐含统计量,并能使用FIML估计方法处理MAR机制下的缺失数据。然而,该方法也存在局限性。第一,目前仅FIML估计方法可直接使用,尽管某些模型可指定REML,但模型构建并不直接。元分析中使用的其他估计器(如Hunter-Schmidt、Hedges、DerSimonian-Laird)不太可能在SEM框架内实现。第二,SEM使用Wald或z统计量检验参数,而多数元分析软件偏好t统计量,在小样本情况下表现更优,不过研究者可手动以t统计量替代z统计量。第三,在非独立效应量的处理方面,虽然通过多元元分析扩展较为直接,但嵌套效应量等其他非独立性类型仍具挑战性。基于SEM的三水平元分析目前仅限单个效应量,多效应量的三水平元分析仍未实现。此外,稳健方差估计(robust variance estimation,RVE)方法尚未在基于SEM的元分析中实现。
研究结论为:本教程证明基于SEM的元分析是一种灵活且强大的工具,可用于学习和实施元分析。它可以补充现有元分析工具以解决复杂研究问题。尽管存在局限性,SEM在设定、可视化和拟合复杂元分析模型方面提供了独特优势。基于SEM的元分析作为未来元分析实施的有利框架具有广阔前景。本教程还强调了SEM的灵活性,用户可以定义标准元分析包中当前可能不可用的效应量间新模型,从而使研究者能够探索适合其研究问题的创新建模方法。