《Pharmaceutical Statistics》:Bayesian Power-Based Sample Size Determination for Diagnostic Accuracy Studies
编辑推荐:
在诊断准确性研究中,预先估计所需样本量对于恰当评估诊断指标(如敏感度和/或特异度)至关重要。在药品和医疗器械开发中,尽管频率学方法(frequentist approaches)已被用于样本量确定,贝叶斯方法(Bayesian approaches)近年来日益
在诊断准确性研究中,预先估计所需样本量对于恰当评估诊断指标(如敏感度和/或特异度)至关重要。在药品和医疗器械开发中,尽管频率学方法(frequentist approaches)已被用于样本量确定,贝叶斯方法(Bayesian approaches)近年来日益受到关注。研究人员提出了一种基于“贝叶斯效能”(Bayesian power)的样本量确定贝叶斯方法,该方法使用两类先验,即分析先验(analysis prior)与设计先验(design prior)。在所提出的方法中,针对敏感度和/或特异度参数引入分析先验和设计先验,并针对患病率参数引入设计先验。对于给定样本量下的每一个可能的未来数据集,更新分析先验以计算满足预先指定成功标准的后验概率。设计先验用于获得未来数据的先验预测分布,贝叶斯效能则计算为满足成功标准的先验预测概率。通过根据预先指定的标准在一系列候选样本量范围内评估贝叶斯效能来确定样本量。数值结果显示,在所考察的参数设置下,当设计先验均值高于相应目标值时,所需样本量通常随设计先验不确定性的减小而减小。在分析先验有效样本量固定的情况下,更乐观的分析先验会减少所需样本量。研究人员还评估了该方法在联合敏感度和特异度标准下的表现,并与常用的频率学方法进行了比较。这些结果展示了设计先验所表示的不确定性和分析先验所表示的信息如何影响贝叶斯效能及所需样本量。
诊断准确性研究旨在评估诊断试验能否正确识别受试者是否存在疾病,常用评价指标包括敏感度(sensitivity)、特异度(specificity)、阳性预测值、阴性预测值、似然比及受试者工作特征曲线下面积等。预先确定合适的样本量是此类研究设计的关键:样本量过小会因随机变异妨碍对诊断指标的精确估计;样本量过大则可能引发伦理问题或经费问题。传统频率学方法在药品和器械研发中被广泛使用,其样本量计算通常基于假设检验或置信区间长度,并依赖对诊断准确度和患病率设定固定计划值。然而,在设计阶段这些数值往往存在不确定性,尤其当证据来源于小型预试验、相关人群或专家判断时。近年来,贝叶斯方法在临床研究中受到关注,其可通过先验预测分布传播试验前的不确定性。基于此,研究人员提出了一种基于贝叶斯效能、结合分析先验与设计先验的样本量确定方法。分析先验代表用于后验推断和决策的分布,设计先验代表设计阶段对参数合理取值的不确定性。该方法对敏感度参数同时使用分析先验和设计先验,对患病率参数使用设计先验。通过枚举给定样本量下所有可能的未来数据组合,计算满足成功标准的后验概率;利用设计先验获得未来数据的先验预测分布,进而将贝叶斯效能定义为满足成功标准的先验预测概率。样本量确定通过按预定标准在候选样本量范围内评估贝叶斯效能完成。数值结果显示,在设计先验均值高于目标值时,所需样本量通常随设计先验不确定性降低而减少;在分析先验有效样本量固定时,更乐观的分析先验会降低所需样本量。该方法还扩展至特异度以及敏感度与特异度联合标准的情形,并与常用频率学方法进行了比较。结果表明,设计先验所表示的不确定性与分析先验所表示的信息共同影响贝叶斯效能与所需样本量。
研究人员使用的主要关键技术方法包括:①贝叶斯共轭分析,对敏感度θ采用Beta分析先验π
A(θ)~Beta(a
θA, b
θA),观察到患病者数n
d和真阳性数n
s后更新为Beta后验分布,计算θ超过目标值θ*的后验概率;②贝叶斯效能计算,利用设计先验π
D(θ)和π
D(ρ)获得(n
d, n
s)的先验预测分布,求和得到贝叶斯效能β
θ,ρ(n);③设计先验的两种参数化设定,即通过均值与有效样本量设定,以及通过等尾区间设定(使用R中LearnBayes包的beta.select函数求解);④与三种频率学方法的对比,包括正态近似法、Li和Fine的Method 0与Method 3(基于精确二项分布),并在退化设计先验极限下推导了数学等价性。应用示例基于Feng等报告的168例肝细胞癌(HCC)患者与153例健康对照的PIVKA-II诊断数据构建设计先验。方法已实现为R Shiny应用程序。
### 3.1 使用均值和有效样本量设定设计先验
在此设定下,设计先验参数被转化为有效样本量与均值的形式。数值计算结果显示,所需样本量一般随设计先验π
D(θ)或π
D(ρ)有效样本量的增加而减少,也随分析先验π
A(θ)均值的增加而减少。先验预测分布图示表明,较小的有效样本量产生更分散的分布,反映设计阶段对预期敏感度更大的不确定性;当有效样本量趋于无穷时,设计先验退化为退化分布,先验预测分布简化为二项分布。贝叶斯效能函数图示显示,有效样本量越小,效能函数上升越平缓,且贝叶斯效能收敛于设计先验概率∫
θ*1π
D(θ)dθ。
### 3.2 使用等尾区间设定设计先验
当患病率和敏感度假定位于区间[l
ρ, u
ρ]和[l
θ, u
θ]内时,可令这些区间分别为设计先验的1-α
ρ和1-α
θ水平等尾区间,通过数值求解获得Beta分布参数。在α=0.05的设置下改变区间值计算样本量,结果列于对应表格。
### 4. 与频率学样本量方法的比较
将所提方法与三种频率学方法在退化设计先验下进行对比。结果显示,在所有设置中样本量从小到大依次为:正态近似法(Approach 1)、所提方法、联合分布法(Approach 3)、精确二项法(Approach 2)。所提方法样本量小于Approach 3,原因在于Approach 3的一侧精确二项决策规则在数学上等价于基于形式极限不当分析先验Beta(0,1)的后验概率准则,而所提方法使用均匀分析先验Beta(1,1),其成功区域包含Approach 3的拒绝区域。
### 5. 扩展至特异度及敏感度-特异度联合标准
仅考虑特异度时,将敏感度部分中的对应符号替换为特异度参数即可。联合标准情形下,假设真阳性数与真阴性数相互独立,构建包含敏感度、特异度和患病率的联合先验预测概率,并定义相应的贝叶斯效能函数用于样本量计算。数值结果显示,所需样本量一般随设计先验有效样本量增加而减少,随分析先验均值增加而减少;部分设置下无法达到目标贝叶斯效能0.8。
### 6. 应用示例
以PIVKA-II诊断肝细胞癌的验证研究为例,基于Feng等报告的数据构建设计先验:患病率设计先验为Beta(168,153),敏感度设计先验为Beta(78.03,15.79)(95%等尾区间[0.75,0.9]),特异度设计先验为Beta(116.58,12.11)(95%等尾区间[0.85,0.95])。目标值分别设为θ*=0.75和η*=0.8。结果显示,当敏感度和特异度均纳入成功标准时,所需样本量在不同分析先验设定下为357至413;仅基于敏感度时样本量为289至345。
### 7. 讨论
讨论指出,设计先验有效样本量的效应取决于其均值与目标值的相对位置:当均值高于目标值时,降低方差可增加满足成功标准的先验预测概率从而减少样本量;反之,当均值接近或低于目标值时,降低方差可能增加样本量或使预定贝叶斯效能阈值无法达到。正态近似法在样本量小或参数接近边界时不准确,这在诊断准确性研究中尤为相关,因为敏感度和特异度的预期值和目标值常接近1。附录推导证明,在退化设计先验下,Approach 3的一侧精确二项决策规则等价于形式极限不当分析先验Beta(0,1)的后验概率准则,故所提方法使用均匀分析先验Beta(1,1)时,其贝叶斯效能不小于、所需样本量不大于Approach 3;该差异反映分析先验及相应决策规则的影响,不应被解读为贝叶斯方法对频率学方法的普遍效率优势。
研究结论:本研究提出了一种基于贝叶斯效能的样本量确定方法,分别对敏感度(或特异度)使用分析先验和设计先验,对患病率使用设计先验,将贝叶斯效能定义为敏感度(或特异度)超过目标值的后验概率超过预先指定阈值的先验预测概率,并可扩展至特异度及敏感度-特异度联合标准。数值研究表明,设计先验所表示的不确定性与分析先验所表示的信息共同影响贝叶斯效能与所需样本量:在设计先验均值高于目标值时,降低不确定性通常减少所需样本量;在分析先验有效样本量固定时,更乐观的分析先验减少所需样本量。分析先验应根据相关且可靠的外部信息设定,无此类信息时推荐使用均匀Beta(1,1)作为实用默认先验。设计先验应基于“what-if”精神通过专家启发确定,并进行敏感性分析以检验稳健性。应用示例表明,基于PIVKA-II的验证研究在联合敏感度与特异度标准下采用均匀Beta(1,1)分析先验时,推荐总样本量为413。