生成式人工智能赋能血液学下一代合成临床试验

《Leukemia》:Next-generation synthetic trials in hematology with generative artificial intelligence

【字体: 时间:2026年08月20日 来源:Leukemia 8.8

编辑推荐:

  在靶向治疗时代,开发新型抗癌药物面临成本高昂、周期漫长及失败率居高不下的困境,其中受试者招募失败是癌症试验受挫的首要原因。随着精准肿瘤学将疾病实体不断拆分为分子定义亚组,多项试验竞争同一萎缩的合格患者池,标准治疗(standard of care, SOC)对

  
在靶向治疗时代,开发新型抗癌药物面临成本高昂、周期漫长及失败率居高不下的困境,其中受试者招募失败是癌症试验受挫的首要原因。随着精准肿瘤学将疾病实体不断拆分为分子定义亚组,多项试验竞争同一萎缩的合格患者池,标准治疗(standard of care, SOC)对照臂的招募引发试验间“互噬”,延缓证据生成。研究人员提出:若SOC对照臂仍是实践与监管必需,能否通过生成而非招募来构建?生成式人工智能(generative artificial intelligence, generative AI)可对真实数据的特征分布进行统计拟态,产出与真实数据不可区分的合成文本、图像、表格等,合成患者队列(synthetic patient cohorts)复现群体特征分布与特征间关系,有别于针对单个患者的数字孪生(digital twins)。在血液学中,研究人员已训练生成对抗网络(generative adversarial networks, GANs)产出合成骨髓涂片,并基于德国Study Alliance Leukemia既往1606例急性髓系白血病(acute myeloid leukemia, AML)患者多模态表格数据生成合成队列,其在疾病生物学与生存动力学上忠实复现真实队列;进一步用合成AML患者回顾性替换SORAML II期试验(评估索拉非尼加入标准诱导治疗)的安慰剂对照臂,比较原研干预与合成对照臂可重复原始试验结果。类似地,基于GIMEMA AML1310试验500例患者生成的合成AML队列生存动态匹配原试验;在骨髓增生异常肿瘤(myelodysplastic neoplasms, MDS)中,大规模合成队列挖掘的预后特征与IPSS-M重叠。尽管潜力显著,合成数据非万能药:其训练依赖大样本、多样化、具代表性的真实队列,否则无法无中生有;生成模型会镜像乃至放大训练数据中的人口学、治疗偏好与亚组偏倚,需多源训练(含真实世界登记库)并刻意纳入少数群体;隐私并非默认保障,需从立项起嵌入差分隐私预算、真实-合成距离度量与对抗攻击防护,平衡隐私-可用性权衡;监管尚处空白,合成对照试验需独立第三方生成、训练队列属性透明披露、模型架构与保真度指标公开,且合成队列在干预臂数据收集完成前对申办方屏蔽以防樱桃挑选(cherry-picking)。综上,合成数据有望降低数据共享壁垒、加速招募、减少失败,但临床落地前须经历严格评估、质量认证、隐私守护与监管框架约束。
研究背景方面,癌症新药研发单药耗资逾十亿美元、历时近十年且失败频发,受试者招募失败居首因。精准肿瘤学将血液系统恶性肿瘤拆解为分子定义亚组后,多项靶向试验争夺同一缩小化的合格患者池,SOC对照臂招募导致试验互相“ cannibalize”(互噬),加之治疗期间SOC因新获批药或风险分层变更而漂移,整体证据生成放缓,患者获及潜在有效疗法被延迟或否决。研究人员据此提出以“生成替代招募”构建SOC合成对照臂的假设。研究人员通过训练生成式模型在AML、MDS中重建合成队列,并回顾性替换既有随机对照试验(randomized controlled trial, RCT)对照臂以验证可行性,得出结论:合成队列可在统计性质上替代SOC对照臂复现原试验结论,对精准血液学试验设计具变革意义。该文发表于《Leukemia》。
关键技术方法上,研究人员采用生成对抗网络(GANs)、变分自编码器、扩散模型与Transformer等架构,对源自德国Study Alliance Leukemia(1606例AML多模态表格数据)、GIMEMA AML1310(500例AML)、SORAML II期RCT及MDS真实队列进行统计拟态;通过专家盲评区分合成与真实骨髓涂片以验真,利用合成AML队列替换SORAML安慰剂臂重算生存曲线,并比对IPSS-M预后特征重叠度,全程排除试剂培养与质粒操作细节。
研究结果部分,“靶向治疗时代对新试验设计的需求”一节指出,分子亚组碎片化使传统宽入口标准失效,SOC对照臂互斥于探索性亚组入组,合成队列可释放合格患者至干预臂。“生成式人工智能赋能合成患者队列构建”一节表明,生成式AI经神经网络近似真实特征分布,产出不回溯个体的合成样本,区别于数字孪生;AML合成骨髓图像通过专家鉴别测试,1606例训练的合成AML队列复现临床/实验室/遗传特征与生存动态,SORAML合成对照臂重演原干预效应,GIMEMA与MDS合成队列分别匹配原生存曲线及IPSS-M特征。“合成数据在临床试验中的陷阱与前行路径”一节阐明四重陷阱:训练样本先决性(无大样本则无生成)、偏倚镜像与放大(需多源含真实世界登记库及少数群体刻意纳入)、隐私非默认(需差分隐私预算与对抗审计平衡可用性)、监管悬置(需第三方独立生成、属性透明、干预臂锁定期防樱桃挑选)。
讨论与结论翻译:合成数据能降低健康数据共享壁垒,赋能新型试验设计,加速招募,降低失败率,并使更多患者在精准血液学时代获及在研疗法;然而其非银弹,临床实施前须配套严谨评估、质量评定、隐私守护与监管指引。研究人员强调,合成对照试验的可行性建立在SOC侧已有海量训练数据之上,对罕见亚组仍受限;偏倚缓解依赖多源数据与公平纳入;隐私-效用权衡需迭代度量;监管应强制独立第三方生成与盲态释放。论文最终结论为:生成式AI合成患者队列可作为精准血液学临床试验SOC对照臂的统计等价替代,但须在方法学质量、透明性与治理框架三重约束下审慎落地。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号