
-
生物通官微
陪你抓住生命科技
跳动的脉搏
序数结果下的因果效应估计:G计算法、IPW法和基于TMLE方法的性能比较
《BMC Medical Research Methodology》:Causal effect estimation for ordinal outcomes: a performance comparison of G-computation, IPW, and TMLE-based methods
【字体: 大 中 小 】 时间:2026年07月24日 来源:BMC Medical Research Methodology 3.7
编辑推荐:
摘要背景序数结果在临床和观察性研究中被广泛使用。然而,由于序数变量各类别之间的间隔并未明确界定,因此对序数结果的因果效应估计比二元或连续结果更为困难。所以,准确推断序数结果的因果关系十分重要,因为不恰当的协变量调整可能导致混杂因素带来的偏差。在本研究中,我们定义了序数结果的平均处
序数结果在临床和观察性研究中被广泛使用。然而,由于序数变量各类别之间的间隔并未明确界定,因此对序数结果的因果效应估计比二元或连续结果更为困难。所以,准确推断序数结果的因果关系十分重要,因为不恰当的协变量调整可能导致混杂因素带来的偏差。在本研究中,我们定义了序数结果的平均处理效应,并比较了多种用于估算该效应的因果推断方法的性能。
共比较了九种方法,包括调整后的估计量、基于参数模型和超级学习器的G计算法、逆概率加权法,以及基于阈值和连续得分的目标最大似然估计法。根据结果模型和处理模型是否被正确设定,构建了多种模拟场景。这些方法从偏差、经验标准误差和均方根误差等方面进行了评估。在真实数据分析中,使用了原发性胆汁性肝硬化数据集来估算D-青霉胺治疗的平均处理效应,并通过置信区间对比不同方法的结果。置信区间的构建依据的是每种估计量的特点,采用基于模型、基于自助法或基于影响函数的各种方差估计方法。
模拟结果显示,在本研究考虑的特定数据生成机制下,基于TMLE的方法通常具有最稳定的整体性能。尤其是基于阈值的TMLE在单一模型设定错误的情况下,仍能保持较低的偏差和均方根误差。相比之下,基于G计算法和IPW的方法分别对结果模型和处理模型的设定错误较为敏感,其中IPW方法的表现存在较大差异。当两个模型同时设定错误时,大多数方法的性能都会下降。由广义线性模型和随机森林组成的超级学习器库提升了若干基于结果模型方法的性能,但未能完全消除IPW方法中的波动性。对于基于TMLE的方法,基于超级学习器和基于参数实现的方法表现相当。
在真实数据分析中,大多数方法得出的处理效应估计值为负,表明治疗可能有助于减轻疾病严重程度。不过,由于大多数95%置信区间都包含0,因此缺乏统计上显著的处理效应证据。基于超级学习器库的方法通常能产生更窄的置信区间,说明其估计性能更为稳定。尽管如此,不同方法得出的处理效应估计值差异较小,这可能反映出在该随机临床试验数据集中混杂因素的作用较为有限。
在本研究考虑的特定数据生成机制下,基于阈值的TMLE在估算序数结果的平均处理效应方面表现相对稳定,尤其是在单一模型设定错误的情况下。使用超级学习器库实现的基于阈值的TMLE与基于参数的方法表现相当。在真实数据分析中,基于超级学习器库的方法往往能产生更小的标准误差和更窄的置信区间,表明在该场景下具备更稳定的估计潜力。
序数结果在临床和观察性研究中被广泛使用。然而,由于序数变量各类别之间的间隔并未明确界定,因此对序数结果的因果效应估计比二元或连续结果更为困难。所以,准确推断序数结果的因果关系十分重要,因为不恰当的协变量调整可能导致混杂因素带来的偏差。在本研究中,我们定义了序数结果的平均处理效应,并比较了多种用于估算该效应的因果推断方法的性能。
共比较了九种方法,包括调整后的估计量、基于参数模型和超级学习器的G计算法、逆概率加权法,以及基于阈值和连续得分的目标最大似然估计法。根据结果模型和处理模型是否被正确设定,构建了多种模拟场景。这些方法从偏差、经验标准误差和均方根误差等方面进行了评估。在真实数据分析中,使用了原发性胆汁性肝硬化数据集来估算D-青霉胺治疗的平均处理效应,并通过置信区间对比不同方法的结果。置信区间的构建依据的是每种估计量的特点,采用基于模型、基于自助法或基于影响函数的各种方差估计方法。
模拟结果显示,在本研究考虑的特定数据生成机制下,基于TMLE的方法通常具有最稳定的整体性能。尤其是基于阈值的TMLE在单一模型设定错误的情况下,仍能保持较低的偏差和均方根误差。相比之下,基于G计算法和IPW的方法分别对结果模型和处理模型的设定错误较为敏感,其中IPW方法的表现存在较大差异。当两个模型同时设定错误时,大多数方法的性能都会下降。由广义线性模型和随机森林组成的超级学习器库提升了若干基于结果模型方法的性能,但未能完全消除IPW方法中的波动性。对于基于TMLE的方法,基于超级学习器和基于参数实现的方法表现相当。
在真实数据分析中,大多数方法得出的处理效应估计值为负,表明治疗可能有助于减轻疾病严重程度。不过,由于大多数95%置信区间都包含0,因此缺乏统计上显著的处理效应证据。基于超级学习器库的方法通常能产生更窄的置信区间,说明其估计性能更为稳定。尽管如此,不同方法得出的处理效应估计值差异较小,这可能反映出在该随机临床试验数据集中混杂因素的作用较为有限。
在本研究考虑的特定数据生成机制下,基于阈值的TMLE在估算序数结果的平均处理效应方面表现相对稳定,尤其是在单一模型设定错误的情况下。使用超级学习器库实现的基于阈值的TMLE与基于参数的方法表现相当。在真实数据分析中,基于超级学习器库的方法往往能产生更小的标准误差和更窄的置信区间,表明在该场景下具备更稳定的估计潜力。