《CPT: Pharmacometrics & Systems Pharmacology》:Using Stochastic Simulation-Estimation and Automated Model Development to Assess Power and Accuracy for Covariate Identification
编辑推荐:
当使用临床试验模拟评估研究设计在群体药代动力学(PopPK)建模中识别协变量效应的能力时,通常假设在数据分析阶段已知真实模型。在本研究中,将此假设与更现实的假设(即需要根据计划研究生成的数据建立PopPK模型)进行了比较。比较了三种方法:(i)使用模拟模型进行
当使用临床试验模拟评估研究设计在群体药代动力学(PopPK)建模中识别协变量效应的能力时,通常假设在数据分析阶段已知真实模型。在本研究中,将此假设与更现实的假设(即需要根据计划研究生成的数据建立PopPK模型)进行了比较。比较了三种方法:(i)使用模拟模型进行随机模拟和再估计(SSE);(ii)使用探索性协变量搜索的自动化模型开发(AMD-exploratory);(iii)从一开始就将协变量效应强制纳入模型并在最后重新评估的AMD(AMD-structural)。利用一个模拟的协变量效应(假设的妊娠对清除率的影响),研究人员评估了(i)协变量识别的第一类错误(T1E)和检验效能,以及(ii)协变量参数准确度。SSE和AMD-exploratory中的T1E率得到控制,而AMD-structural则膨胀了20%。在丰富、中等和稀疏设计中的协变量识别检验效能分别为:(i)SSE中99%、100%和79%;(ii)AMD-exploratory中74%、72%和41%;(iii)AMD-structural中92%、93%和80%。稀疏设计放大了策略间的检验效能差异,AMD-exploratory经常选择替代协变量或无协变量。协变量参数估计的相对均方根误差(rRMSE)在SSE中最低(27%、22%和42%),其次是AMD-exploratory(34%、26%和49%),然后是AMD-structural(42%、47%和60%)。SSE提供了乐观的检验效能估计,因为模型构建是数据驱动的,而基于AMD的方法则纳入了模型不确定性并反映了真实世界的分析条件。
**研究背景与问题**
在药物开发中,临床试验模拟广泛用于评估研究设计是否足以识别群体药代动力学(PopPK)模型中的协变量效应。传统上,标准方法——随机模拟与估计(SSE)——假设在数据分析阶段已知真实模型,即直接使用模拟模型对数据进行估计,而不涉及模型构建过程。然而,实际PopPK分析通常需要大量的模型构建,包括结构模型、变异模型和协变量关系的探索。这种理想假设与现实实践之间的差异可能导致对检验效能(即识别真实协变量效应的能力)的过度乐观估计。此外,当数据稀疏时,模型构建不确定性对协变量识别的影响尤为突出。因此,研究人员旨在比较SSE与两种基于自动化模型开发(AMD)的方法(探索性搜索和结构性强制搜索),以评估它们在协变量识别的第一类错误(T1E)、检验效能和参数估计准确度方面的表现,并考察数据丰富度(采样设计)对这些指标的影响。该研究发表在《CPT: Pharmacometrics》。
**主要技术方法**
研究人员基于来自DolPHIN-1试验的多替拉韦(DTG)PopPK模型,生成了一个虚拟人群(28名个体),包含妊娠状态(作为二元协变量)对清除率(CL)的效应(25%增加)。模拟了三种采样设计:丰富(11个时间点)、中等(9个时间点)和稀疏(4个时间点)。使用了三种方法:(1)SSE:模拟100个数据集后,用已知的全模型(包含协变量)和简化模型(不含协变量)进行估计,通过似然比检验(LRT)评估T1E和检验效能;(2)AMD-exploratory:使用Pharmpy中的AMD工具,通过逐步协变量建模(SCM)和探索性搜索,自动构建模型并选择协变量;(3)AMD-structural:在AMD中将目标协变量强制纳入模型,并在最终通过LRT重新评估。所有模型估计均采用NONMEM中的一阶条件估计法(FOCEI)。评估指标包括T1E率、检验效能、参数估计的偏差、精度(标准差)和准确度(均方根误差RMSE及相对均方根误差rRMSE),以及模型拟合优度(通过贝叶斯信息准则BIC比较)。
**研究结果**
**3.1 协变量识别的第一类错误率和检验效能**
通过比较SSE、AMD-exploratory和AMD-structural三种方法,研究人员发现:AMD-structural的T1E率显著膨胀(丰富、中等、稀疏设计分别为17%、18%、20%),而SSE和AMD-exploratory的T1E率控制在5%~7%之间。在检验效能方面,SSE在丰富和中等设计中接近100%,稀疏设计中降至79%;AMD-exploratory的检验效能显著降低(丰富74%、中等72%、稀疏41%);AMD-structural的检验效能介于两者之间(丰富92%、中等93%、稀疏80%)。这表明,强制协变量可提高检验效能,但以增加假阳性为代价;SSE则高估了检验效能,尤其当模型构建是必要环节时。
**3.2 系数估计的偏差、精度和准确度**
在所有设计中,SSE的参数估计最接近真实值(0.25),平均估计值在0.24~0.27之间,rRMSE最低(22%~42%)。AMD-exploratory的平均估计值略高(0.28~0.31),精度低于SSE,rRMSE为34%~49%。AMD-structural的估计精度最差,rRMSE最高(42%~60%),且变异较大。随着数据稀疏性增加,所有方法的准确度均下降,但AMD-structural的下降幅度最大。
**3.3 AMD构建模型的选择一致性和性能**
**3.3.1 AMD模型选择**:AMD-exploratory的成功收敛率(93%~100%)略高于AMD-structural(94%~100%)。结构模型选择(如一室模型、一级吸收和消除)在丰富和中等设计中一致,但稀疏设计中变异增加。IIV/IOV结构的选择在稀疏数据中更不稳定,AMD-exploratory倾向于选择更简单的结构。
**3.3.2 AMD模型性能与方法比较**:通过BIC比较,AMD-exploratory构建的模型中有23%~46%的dBIC≤0(即优于SSE全模型),AMD-structural为25%~46%。在丰富设计中,AMD-structural的BIC差异更大(最大dBIC达274),表明强制协变量可能导致模型拟合较差。在稀疏数据中,两种策略的差异缩小,因为数据分辨率不足以区分候选模型。
**讨论与结论**
讨论部分指出,SSE为理想场景提供了高检验效能和准确度,但忽略了模型构建不确定性,故可能高估检验效能。AMD方法则更贴近实际分析过程,但不同策略各有权衡:AMD-exploratory检验效能较低但T1E可控,AMD-structural检验效能更高但T1E膨胀,尤其在稀疏设计中。研究人员建议在早期设计阶段先用SSE确定最小样本量下限,再通过AMD获得更现实的样本量估计,形成序贯策略以平衡计算效率和模型真实性。最后,结论部分翻译如下:对三种方法(SSE、AMD-structural和AMD-exploratory)的评估使研究人员能够评估协变量识别的检验效能。这项工作强调了在临床试验设计中进行检验效能估计时纳入模型不确定性的影响和必要性,尤其是在真实模型未知的情况下。考虑模型构建不确定性(如结构假设、参数估计和协变量关系的变异性)能够通过反映可能描述数据的全部合理模型,从而获得更现实和稳健的检验效能预测。此外,将SSE与AMD结合提供了一种实用的方法,在计算成本与模型真实性之间取得平衡,从而做出更可靠的研究设计选择。