《Pharmaceutical Statistics》:Evaluating the Impact of Outcome Delay on the Efficiency of Sample Size Re-Estimation
编辑推荐:
中文翻译:
样本量重估(sample size re-estimation, SSR)可作为一种有效工具,确保当试验在设计阶段对某一设计参数存在不确定性时,仍能满足预设的检验效能要求。然而,长期的主要终点可能对此类试验设计的效率产生不利影响。若在等待治疗结局
中文翻译:
样本量重估(sample size re-estimation, SSR)可作为一种有效工具,确保当试验在设计阶段对某一设计参数存在不确定性时,仍能满足预设的检验效能要求。然而,长期的主要终点可能对此类试验设计的效率产生不利影响。若在等待治疗结局期间继续招募受试者,长时间延迟可能导致试验中纳入大量不参与期中分析的“管道”(pipeline)参与者。这可能使最终招募人数超过实际所需人数,导致试验效能过剩且成本高昂。本文精确研究了此类结局延迟对“内部试点”(internal pilot)型SSR设计效率的影响。在不同的延迟时长下,针对连续型和二分类结局数据,研究人员推导了SSR后最终样本量的分布;进而讨论了延迟对最终样本量估计精度的影响。具体而言,延迟对该精度的影响通过均方根误差(root mean square error, RMSE)以及两个更新的指标(分别称为延迟影响(delay impact)和成本(cost))进行评估。结果表明,随着延迟时长的增加,延迟影响随之增大,导致平均样本量与检验效能被抬高。然而,结局延迟效应的严重程度高度依赖于具体的试验情境。当重估样本量小于原计划样本量时,试验受延迟结局的影响最为严重,往往导致效能过剩。相反,若原计划样本量仍小于重估样本量,则延迟的影响显著减小。
**论文解读:结局延迟对样本量重估设计效率的影响评估**
**一、研究背景与问题提出**
样本量估算是临床试验设计的核心环节,其目的在于以恰当的检验效能识别预设的治疗效应,同时避免资源浪费。样本量计算通常依赖于对 nuisance 参数(如结局方差、组内相关系数或人群事件率)以及治疗效应的估计。然而,在实际规划阶段,研究者对这些参数的先验信息往往十分有限:若假设的治疗效应偏离真实值,或对 nuisance 参数的估计不准确,试验将面临检验效能不足或资源过度消耗的风险。样本量重估(sample size re-estimation, SSR)设计为此类问题提供了一种适应性解决方案,允许在试验进行期间根据累积的受试者数据对样本量进行调整,以实现预设的检验效能。
现有SSR文献大多隐含假设治疗结局在受试者入组后立即可用,但这在临床实践中往往与现实不符。当主要终点需要较长随访时间才能观测时,若在等待结局期间持续招募受试者,就会产生大量“管道”(pipeline)参与者——即在期中分析时尚无结局数据的已入组受试者。这些参与者不参与期中分析,却会推高最终样本量,导致试验过度把握度(over-powered)并增加不必要的成本。如果暂停招募以等待结局,则会延长试验周期。两种情形均对试验效率构成不利影响。既往针对 Simon 两阶段设计、双臂成组序贯设计以及多臂多阶段设计的研究已表明,结局延迟会严重削弱这些设计的效率。尽管有研究指出SSR对结局延迟的敏感程度可能低于其他适应性设计,但相关量化研究仍显不足。为此,本文旨在系统评估结局延迟对“内部试点”型SSR设计效率的影响,重点关注不重估治疗效应、通常可以盲态实施的SSR设计,通过最终样本量的分布及多种汇总指标量化延迟造成的效率损失。
**二、研究概述与主要结论**
研究人员以一项高血压骨关节炎临床试验(NCT00267176)和一项嗜酸性粒细胞增多综合征三期试验(NCT02836496)为实例,说明结局延迟在真实试验中的潜在影响。随后,研究人员建立了包含延迟因素的最终样本量表达式,假设在等待结局期间不暂停招募,推导了均匀、线性和混合三种招募模式下管道参与者人数的估算方法,并提出了三种效率评估指标:延迟影响(delay impact,最终样本量超过重估所需样本量的试验比例)、均方根误差(root mean square error, RMSE,衡量最终样本量与最优样本量之间的偏差)及成本(cost,对效能不足试验惩罚更重的成本-效益比指标)。
基于大规模模拟研究,研究人员得出以下核心结论:延迟影响随延迟时长的增加而增大,导致平均样本量和检验效能被抬高;但延迟效应的严重程度高度依赖于具体的试验情境。当初期规划样本量大于重估所需样本量时(即真实方差小于假设值),结局延迟的影响最为严重,试验极易因管道参与者过多而效能过剩;而当重估样本量大于初期规划样本量时(即真实方差大于假设值),管道参与者通常能对最终样本量作出正向贡献,延迟影响则相对有限。此外,线性递增招募模式下管道参与者人数最多,延迟导致的效率损失也最大;均匀招募模式下的损失最小,混合招募模式居中。在RMSE与成本方面,随着延迟时长的增加,RMSE和成本在典型案例中呈近似指数式上升;但在真实方差较大的情形下,SSR设计即使在较长延迟下仍优于单阶段设计。研究还发现,当延迟时长与管道参与者人数恰好使最终样本量接近最优样本量时,RMSE和成本会出现先降后升的“凹槽”现象。对期中分析时机的敏感性分析显示,增大第一阶段样本量可降低重估样本量的变异性,但会加剧延迟的负面影响;综合权衡后,每组35例的期中分析样本量是兼顾估计可靠性与延迟控制的有效选择。所有研究均未设定最大样本量上限,以观察延迟影响下的完整结局分布。
**三、主要技术方法**
本研究以模拟研究为核心方法。研究假设对照组结局服从标准正态分布,预设单侧显著性水平0.05、检验效能80%,初期计划样本量按治疗效应0.35、方差1计算得到每组101例,总样本量为202例。招募时长假定为24个月,依据均匀、混合和线性三种招募模式估算管道参与者人数。期中分析计划在每组招募35例后进行,模拟了三种真实方差情形(Case I: σ2=0.5;Case II: σ2=1;Case III: σ2=2),每种参数组合运行10,000次模拟重复。每次模拟中,研究人员依据第一阶段数据计算合并样本方差,进而重估所需样本量,再结合管道参与者人数确定最终样本量,并模拟完整第二阶段数据后进行假设检验。模拟代码已公开在GitHub平台。此外,研究人员引入了延迟影响、RMSE和成本三个指标来综合评估延迟效应。
**四、研究结果**
4.1 结局延迟对最终样本量分布的影响
不同延迟时长下,三种招募模式的最终样本量分布显示:随延迟时长增加,样本量分布的离散程度减小,最小值显著抬高,这主要源于管道参与者数量的累积。Case I(σ2=0.5)受延迟影响最重——最优样本量仅需164例,远小于初期计划的202例,重估样本量趋向低于初始计划,高延迟时长下最终样本量往往远超所需。Case II(σ2=1)的分布缩减程度中等,线性招募模式产生的管道参与者最多。Case III(σ2=2)受延迟影响最轻——重估样本量通常高于初始计划的202例,管道参与者有助于满足样本量需求,且不同延迟时长下分布变化甚微。延迟影响指标进一步表明,当时长-招募比(delay-recruitment ratio, ρ)达0.5时,Case I在均匀招募下的延迟影响约0.5,即50%的试验会以超出所需样本量的规模结束;线性招募模式下其最大值可高达96%。
4.2 结局延迟对均方根误差的影响
RMSE分析以单阶段设计的RMSE为参照基准。小延迟时长下SSR的RMSE保持相对稳定;随着延迟增长,Case I与Case II的RMSE显著上升。Case I在均匀招募下ρ超过0.6后RMSE迅速增大,线性招募下增势更早、更急。表明延迟导致的管道参与者使最终样本量系统性偏离最优样本量,SSR的估计精度大幅下降。Case III中RMSE直到ρ接近1才出现明显上升,SSR在多数延迟情形下仍优于单阶段设计。值得注意的是,RMSE曲线在快速上升前存在小幅下降,例如Case II在延迟6个月时RMSE降至最低——此时70例第一阶段参与者加上管道参与者共196例,接近最优的202例,故变异性反而减小。
4.3 结局延迟对成本指标的影响
成本指标的变化趋势与RMSE相似,呈近似指数式增长,但该指标对效能不足的试验施加更重的惩罚。Case I与Case II在长延迟下成本急剧攀升;Case III的成本增幅最小,且在均匀招募下部分延迟时长甚至比暂停招募更有利于效率。总体而言,线性招募模式导致更高的成本。对治疗效应为0.2的补充模拟显示,部分延迟时段内RMSE下降而成本降低的程度更大,反映了成本指标对过把握度试验较为宽容、对把握度不足试验严格惩罚的设计初衷。
4.4 不同第一阶段样本量下的延迟效应
改变第一阶段样本量(每组35例、50例或70例)的模拟表明,第一阶段样本量越大,最终样本量的变异性越小,但最小可达样本量随延迟时长上升更快,延迟影响也更为严重。这一效应在Case I中尤为突出,Case II中趋势相似但较轻。综合估计可靠性需求与延迟风险,每组35例的期中分析时机在两者间取得了合理平衡,研究结果亦支持这一经验法则可推广至盲态SSR设计。
**五、讨论与结论总结**
讨论部分指出,既往研究表明,当延迟超过总招募时长50%时,成组序贯设计的效率优势基本丧失。本研究的贡献在于系统量化了结局延迟对SSR设计的效率影响,证实延迟确实会损害SSR的效率,但这种损害高度取决于初始样本量设定与招募模式。当初始样本量可能被高估时,结局延迟会使SSR设计面临较大的成本风险;研究人员因此建议在此类情形下考虑以较小的第一阶段样本量启动试验。均匀招募模式可代表单中心小规模试验,多中心试验则更接近混合招募模式,线性招募模式作为极端情况进行参考。由于本研究未设最大样本量上限,结果反映的是特定参数下的最大可能损失,实际中可通过设定上限来限制此类损失,但须注意上限选择不当可能带来检验效能问题。讨论部分还指出,当前监管指南对把握度不足试验的担忧甚于把握度过剩试验,但本研究的目标是通过重估尽可能精确地实现目标检验效能,故两种情况均被视为不良结果;所提出的成本指标自然地对把握度不足试验施加更大惩罚,从而更全面地反映了真实的效率损失程度。研究结论认为,结局延迟会对SSR设计效率产生负面影响,其严重程度取决于招募率和初始计划样本量;在规划此类试验时,必须通过精心设计的模拟研究来评估延迟可能造成的危害。对于连续结局数据,每组35例的期中分析样本量是平衡估计可靠性与延迟影响的合理选择。此外,结局延迟对SSR的负面影响低于允许提前终止的Simon两阶段设计以及双臂或多臂成组序贯设计。