四种大语言模型在地中海贫血遗传咨询中的表现与局限性

《Frontiers in Digital Health》:Performance and limitations of four large language models in genetic counseling for thalassemia

【字体: 时间:2026年08月11日 来源:Frontiers in Digital Health 5.2

编辑推荐:

  **摘要** 在地中海贫血高发地区(如中国南方和东南亚),专业遗传咨询资源的长期短缺推动了将大语言模型(LLMs)作为辅助工具的研究兴趣,然而此类模型在该场景下的性能表现与安全边界尚未明确。本单中心回顾性研究评估了四种大语言模型(ChatGPT-5.2 Th

  
**摘要**

在地中海贫血高发地区(如中国南方和东南亚),专业遗传咨询资源的长期短缺推动了将大语言模型(LLMs)作为辅助工具的研究兴趣,然而此类模型在该场景下的性能表现与安全边界尚未明确。本单中心回顾性研究评估了四种大语言模型(ChatGPT-5.2 Thinking、DeepSeek-V3.2 chat、Gemini 3 Flash 和 Grok 4.1 Fast),使用1,080道标准化知识问题(分五个独立测试轮次进行)以及150例真实世界临床病例(由六位资深专家从八个维度进行评分)。所有模型在单项选择和判断题中的准确率均超过90%。模型间差异在多选题中最为显著,其中ChatGPT-5.2 Thinking达到最高准确率(87.28% ± 1.69%),显著优于Grok 4.1 Fast(72.06% ± 1.69%,P < 0.001)。DeepSeek-V3.2 chat的跨轮次一致性低于其他三种模型。在临床病例分析中,所有模型总体得分均低于人类专家水平,其中ChatGPT-5.2 Thinking的表现最接近专家。检验报告解读普遍表现良好,而在遗传风险评估、表型预测和咨询建议方面则存在较大差距(与人类专家相比均P < 0.001,ChatGPT-5.2 Thinking在β-地中海贫血亚型中表现存在有限例外)。全部145个严重错误均局限于α-地中海贫血及α合并β-地中海贫血亚型,集中在表型预测(76/145,52.4%)和风险评估(40/145,27.6%)两个维度。LLMs可在地中海贫血遗传咨询中辅助知识检索和结构化报告解读,但不应独立用于风险评估或最终咨询决策,尤其是在复杂的α相关病例中。
**四种大语言模型在地中海贫血遗传咨询中的表现与安全边界:一项系统性评估的深度解读**

**一、研究背景与科学问题**

地中海贫血是全球最常见的单基因疾病之一,在中国南方、东南亚、南亚和中东地区尤为高发。重型患者需要终身输血和去铁治疗,给家庭和社会带来沉重的疾病负担。通过孕前筛查、产前诊断和知情生殖决策来降低重症患儿的出生率,是当前地中海贫血防控的核心策略。在这一预防体系中,遗传咨询发挥着枢纽作用:咨询师需要准确解读血常规、血红蛋白分析和基因检测结果,进而评估遗传风险、预测胎儿表型,并在每个家庭的特定临床情境下指导其生殖决策。这一过程在α-地中海贫血和α合并β-地中海贫血中的复杂度远高于单纯β-地中海贫血,因为基因型-表型关系受到缺失型与非缺失型变异、修饰基因以及检测平台覆盖范围的共同塑造。然而,在高发地区,专业遗传咨询资源长期短缺,严重制约了患者获得及时、精准咨询服务的可及性。

大语言模型(LLMs)凭借其自然语言理解和知识整合能力,已在多个临床领域展现出应用潜力,包括病历书写、医学教育和患者问答等。既往研究表明,LLMs在妇科肿瘤遗传咨询和血红蛋白病检验报告解读中具有初步价值,GPT-4也被证明在医生辅助的患者管理推理中具备一定效用。然而,这些研究均局限于狭窄的任务定义,并未系统考察LLMs能否在需要跨遗传异质性亚型进行多步骤概率推理的地中海贫血咨询全流程中可靠工作。此前研究也持续揭示了LLMs在复杂遗传病语境下的显著局限,包括不稳定的表型识别和不可靠的概率推理。截至本研究开展时,尚无针对地中海贫血遗传咨询场景下LLMs系统性能和安全性边界的专门评估。

**二、研究设计与核心方法**

研究人员开展了一项单中心回顾性研究,于2025年12月至2026年1月在贵港市人民医院实施,经医院伦理委员会批准(审批号:20250023)。研究采用双轨评估框架:第一条轨道为标准化知识测试,包含1,080道源自机构标准化培训教材《地中海贫血防治》的题目,涵盖600道单选题、240道多选题和240道判断题;第二条轨道为真实世界临床病例分析,回顾性纳入2023至2025年间在该院产前诊断中心接受地中海贫血遗传咨询的150对夫妇,所有病例均完成去标识化处理。依据子代风险类型和严重程度,病例分为六组:轻型α-地中海贫血(n=30)、中重型α-地中海贫血(n=20)、轻型β-地中海贫血(n=20)、中重型β-地中海贫血(n=20)、轻型α合并β-地中海贫血(n=20)和中重型α合并β-地中海贫血(n=40)。

评估对象为四种主流商用LLMs:ChatGPT-5.2 Thinking(OpenAI)、DeepSeek-V3.2 chat(DeepSeek)、Gemini 3 Flash(Google)和Grok 4.1 Fast(xAI)。所有模型通过官方应用程序编程接口(API)访问,温度参数设置为0,top_p设为1,禁用随机采样以保证确定性和可复现性。知识测试中,每题组包含10道题目,每轮测试在一天内完成,间隔3天后重复,共进行五轮独立测试,评估指标包括准确率和跨轮次一致性。病例测试中,每个病例的完整临床数据和检验报告汇编为PDF文件,通过标准化中文提示词提交给每个模型,模型需完成检验报告解读、遗传风险评估、临床表型预测和遗传咨询建议四项任务。评分由六位从事地中海贫血遗传咨询超过20年的资深专家执行,采用基于5分量表(5分:完全符合临床指南和医学事实;1分:与临床标准完全不符)的标准化评分规则,涵盖四个任务各自的准确性和完整性共八个维度。各维度得分≤2分被定义为严重错误,需六位评分专家一致同意。人源专家参考标准由两位资深遗传咨询师完成相同150例病例后,由两位评分专家使用同一规则进行评分。

**三、主要研究结果**

**3.1 四种LLMs在医学知识测试中的表现**

在准确性方面,四种模型在三种题型上的总体准确率均存在显著差异。单选题中,DeepSeek-V3.2 chat(95.98% ± 0.60%)和ChatGPT-5.2 Thinking(95.40% ± 0.51%)准确率均显著高于Grok 4.1 Fast(92.42% ± 0.45%),DeepSeek-V3.2 chat也优于Gemini 3 Flash(94.44% ± 0.58%)。多选题中的模型间差异最为显著,ChatGPT-5.2 Thinking取得最高准确率(87.28% ± 1.69%),显著高于DeepSeek-V3.2 chat(82.18% ± 0.87%)和Grok 4.1 Fast(72.06% ± 1.69%)。判断题中的组间差异较小,仅ChatGPT-5.2 Thinking(93.46% ± 0.67%)显著优于Grok 4.1 Fast(90.80% ± 0.40%)。

在跨轮次一致性方面,单选题的四种模型一致性均较高(92.67%–94.50%),无显著差异。多选题中,DeepSeek-V3.2 chat的一致性最低(72.08% ± 0.45%),显著低于其他三种模型。判断题中,DeepSeek-V3.2 chat(85.83% ± 0.35%)同样显著低于其余三种模型(93.33%–95.42%)。这一发现表明DeepSeek-V3.2 chat在高复杂性任务中的输出稳定性相对不足。

**3.2 四种LLMs在临床病例分析中的表现**

在八个评估维度上,四种模型间均存在显著差异。ChatGPT-5.2 Thinking在七个维度上显著高于其他三种模型,涵盖遗传风险评估的准确性和完整性、临床表型预测的准确性和完整性、遗传咨询建议的准确性和完整性以及检验报告解读的准确性。唯一例外是检验报告解读的完整性维度,Grok 4.1 Fast得分最高(4.93 ± 0.26),显著超过所有其他模型。DeepSeek-V3.2 chat和Gemini 3 Flash在遗传风险评估的准确性、完整性、临床表型预测的完整性以及遗传咨询建议的完整性四个维度表现相当。总体来看,各模型在检验报告解读准确性上的得分相对较高(4.68–4.92),提示LLMs在结构化信息提取方面具备较强能力。

在不同地中海贫血亚型中,ChatGPT-5.2 Thinking在全部六个亚型中均取得最高总评分(范围:4.37 ± 0.32至4.98 ± 0.08),且在多数亚型中显著高于其他模型。其他三种模型的相对排名随亚型变化而不同。在轻型β-地中海贫血中,ChatGPT-5.2 Thinking(4.98 ± 0.08)显著高于DeepSeek-V3.2 chat(4.73 ± 0.18),但未显著高于Gemini 3 Flash和Grok 4.1 Fast。在中重型α合并β-地中海贫血中,ChatGPT-5.2 Thinking(4.37 ± 0.32)与Grok 4.1 Fast(4.27 ± 0.47)无显著差异,两者均显著高于Gemini 3 Flash(3.77 ± 0.65)和DeepSeek-V3.2 chat(3.83 ± 0.86)。

**3.3 四种LLMs与人类专家的比较**

与人类专家相比,四个咨询任务均表现出显著组间差异。在检验报告解读方面,ChatGPT-5.2 Thinking(4.89 ± 0.28)、Grok 4.1 Fast(4.88 ± 0.21)和DeepSeek-V3.2 chat(4.76 ± 0.42)达到与人类专家(4.84 ± 0.26)相当的水平,无显著差异;Gemini 3 Flash(4.71 ± 0.43)则显著低于专家。在遗传风险评估、临床表型预测和遗传咨询建议方面,四种模型均显著低于人类专家。ChatGPT-5.2 Thinking在所有任务中始终为四种模型中得分最高者,但其与人类专家之间仍存在显著差距。

**3.4 各咨询任务的亚型分层分析**

亚型分层分析揭示了模型表现的精细化差异。在检验报告解读中,ChatGPT-5.2 Thinking在全部六个亚型均达到人类专家水平;Grok 4.1 Fast仅在轻型α-地中海贫血中显著低于专家,DeepSeek-V3.2 chat仅在轻型α合并β-地中海贫血中显著低于专家;Gemini 3 Flash在四个α相关亚型中均显著低于专家。在遗传风险评估中,模型与专家之间的差距在α合并β-地中海贫血亚型中最突出:轻型α合并β-地中海贫血中仅ChatGPT-5.2 Thinking达到专家水平,中重型α合并β-地中海贫血中四种模型均显著低于专家。在临床表型预测中,所有模型在β-地中海贫血两种亚型中均达到专家水平,但在中重型α合并β-地中海贫血中均显著低于专家。在遗传咨询建议中,模型与专家间的差距为四个任务中最大:ChatGPT-5.2 Thinking仅在轻型β-地中海贫血、中重型β-地中海贫血和轻型α合并β-地中海贫血中达到专家水平,其余亚型中四种模型均显著低于人类专家。

**3.5 严重错误的分布**

共识别出145个严重错误。按任务分布,临床表型预测占比最高(76/145,52.4%),其次为遗传风险评估(40/145,27.6%)、遗传咨询建议(26/145,17.9%)和检验报告解读(3/145,2.1%)。按模型分布,ChatGPT-5.2 Thinking严重错误数最少(n=6),其后依次为Grok 4.1 Fast(n=30)、Gemini 3 Flash(n=48)和DeepSeek-V3.2 chat(n=61)。按亚型分布,严重错误集中于中重型α合并β-地中海贫血(n=48)、轻型α-地中海贫血(n=45)和轻型α合并β-地中海贫血(n=33)。值得注意的是,在所有β-地中海贫血亚型中未观察到任何严重错误,人源专家参考标准也未出现严重错误。

**四、讨论与结论**

本研究发现了一个一致的任务分层模式:LLMs在结构化报告解读方面表现与人类专家相当,但在概率推理任务中存在实质性差距,且所有严重错误均集中于α相关亚型。这一分层与各咨询环节的认知需求密切对应。在推理要求较低的任务中(如知识检索和结构化报告解读),四种模型均表现良好;随着任务复杂度通过遗传风险推断、临床表型预测和咨询建议综合上升,性能显著下降,模型间差异扩大。

亚型层面的分析进一步揭示了性能差异的机制基础。β-地中海贫血遵循相对经典的遗传模式,具有标准化的临床管理路径,LLMs可应用从训练数据中提取的一致性推理框架。相比之下,α相关地中海贫血的推断挑战更为复杂:α-珠蛋白基因簇存在复杂结构变异,缺失型与非缺失型变异之间的表型结局差异显著,拷贝数变化引入额外异质性,多基因修饰效应无法通过常规检测捕获。α-珠蛋白基因改变还可修饰共存的β-地中海贫血突变的临床表达,而血红蛋白H病严重程度评估需要以非线性方式整合多个临床参数。当推断任务涉及此类复杂的不完全信息和上下文依赖规则时,模型错误率大幅上升。

严重错误集中在临床表型预测和遗传风险评估两个维度,具有直接临床意义。这两个任务决定是否需要进行侵入性产前诊断,并直接告知高风险家庭的生殖决策,任一领域的错误都可能产生不可逆后果。因此,本研究结果不支持通用LLMs在无专家监督条件下生成最终诊断或咨询输出的应用路径。更为可行的方案是分层模块化工作流程:咨询前患者教育、常规问题分诊和结构化检验报告初步解释等低复杂度任务适合LLM辅助;精确遗传概率计算、复杂基因型组合的解读、多参数胎儿预后评估和最终生殖建议制定则应保留给基于规则的计算引擎、疾病特异性知识库和人类遗传咨询师的联合工作。

研究人员在讨论部分指出,本研究存在若干局限性:单中心设计、区域特异性突变谱和本地化知识测试集限制了结果的普适性;检验报告解读得分的天花板效应可能降低了区分灵敏度;评分的严格盲法不可行(模型特有格式标识符使其来源无法完全隐藏),但已通过随机化呈现、六位专家独立评分和标准化规则减轻潜在偏倚;人类专家对照群体规模较小;仅评估了单轮、无增强输出,未纳入检索增强生成(RAG)、多模态输入或智能体架构;仅评估商用云LLMs而排除本地可部署离线模型。未来研究应结合疾病特异性检索增强生成、基于规则的计算模块和结构化专家审查,在临床医生监督的工作流程中弥补本文识别出的概率推理缺陷。

研究结论明确指出:LLMs在地中海贫血知识检索和结构化检验报告解读方面表现可靠,接近人类专家水平;但在遗传风险评估、临床表型预测和咨询建议方面存在实质性不足,且所有严重错误均限于α相关亚型。LLMs可作为低复杂度咨询任务的辅助工具,但在高风险决策中不应独立使用。专业审查仍然不可或缺,未来工作应聚焦于整合基于规则计算和疾病特异性检索增强生成的临床医生监督工作流程。这一任务分层模式的提出,为高发地区安全、规范地将LLMs整合进地中海贫血遗传咨询实践提供了实证依据和边界框架。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号