《Frontiers in Psychiatry》:Evaluating the accuracy, reliability, and readability of AI chatbots in delivering postpartum depression information
编辑推荐:
背景:产后抑郁(Postpartum Depression, PPD)是一种常见的围产期精神障碍,对母婴健康具有显著影响。人工智能(Artificial Intelligence, AI)聊天机器人已成为广泛可及的健康信息工具,但它们在提供准确、可靠且可读的P
背景:产后抑郁(Postpartum Depression, PPD)是一种常见的围产期精神障碍,对母婴健康具有显著影响。人工智能(Artificial Intelligence, AI)聊天机器人已成为广泛可及的健康信息工具,但它们在提供准确、可靠且可读的PPD相关信息方面的表现仍未得到充分探索。方法:研究人员评估了六种AI聊天机器人——ChatGPT-5、ChatGPT-4o、Claude Sonnet 4.5、DeepSeek-V3.2、DeepSeek-R1和Gemini 2.5 Pro,使用200道标准化PPD多项选择题(Multiple Choice Questions, MCQs)来评估效度。ChatGPT-4o和DeepSeek-R1仅作为早期版本对照被纳入基于MCQ的效度分析。可靠性和可读性进一步通过20个核心公共教育问题在最新四个模型(ChatGPT-5、Claude Sonnet 4.5、DeepSeek-V3.2和Gemini 2.5 Pro)中评估。聊天机器人性能从三个维度评估:效度、可靠性和可读性。每个MCQ独立呈现三次,每个核心公共教育问题在每个模型中评估一次。结果:在六个模型的基于MCQ的效度分析中,ChatGPT-5在MCQ上取得了最高的总体准确率(97.50% ± 0.50%)。在四个模型的可靠性和可读性分析中,ChatGPT-5获得了最高的DISCERN、EQIP和GQS评分,表明其内容质量和以用户为导向的实用性相对更好。然而,所有模型(包括ChatGPT-5)的JAMA基准评分均较低,表明透明度、来源归属、时效性和披露有限。所有模型生成的输出均超过了推荐的六年级阅读水平,但ChatGPT-5和Gemini 2.5 Pro相对更易读。结论:AI聊天机器人,尤其是ChatGPT-5,显示出作为产后抑郁相关信息补充工具的潜力,特别是在标准化MCQ评估中。然而,本研究未评估临床安全性、患者理解力、用户行为或真实世界有效性,且欠佳的可读性可能限制健康素养或数字素养较低用户的可及性。不充分的透明度、有限的来源归属和欠佳的可读性表明,AI聊天机器人不应作为产后心理健康指导的自主来源,也不应替代专业评估或护理。
论文解读
**研究背景与问题**
产后抑郁(Postpartum Depression, PPD)是围产期最常见的精神障碍之一,全球约10%–15%的女性受其影响,中国平均患病率为14.7%。PPD的病因涉及激素波动、遗传易感性、心理社会应激及社会支持不足等多重因素,但常被漏诊和低估治疗,尤其在年轻母亲、高危妊娠或缺乏家庭支持的女性中。未经治疗的PPD可导致睡眠障碍、情绪不稳、母婴依恋受损、自伤风险增加及婴儿认知与情感发育延迟,给家庭和社会带来沉重负担。近年来,人工智能(Artificial Intelligence, AI)聊天机器人(如ChatGPT、Claude等)作为健康信息获取工具日益普及,患者越来越多地依赖这些对话式AI获取医学与心理建议。然而,AI生成内容在PPD背景下的准确性、可靠性及可读性尚未得到系统评估。既往研究多聚焦于AI在一般医学知识或其他患者教育主题中的表现,且评估指标较为单一。鉴于AI在健康指导中的使用日益增长,系统评估其是否提供基于证据、可靠且可理解的信息至关重要,尤其对于产后妇女这一脆弱群体。
**研究目的与意义**
本研究旨在系统评估AI聊天机器人在回答PPD相关问题时的效度、可靠性和可读性。研究人员对六种AI聊天机器人(ChatGPT-5、ChatGPT-4o、Claude Sonnet 4.5、DeepSeek-V3.2、DeepSeek-R1和Gemini 2.5 Pro)进行了基于多项选择题(Multiple Choice Questions, MCQs)的效度分析,并对最新四种模型(ChatGPT-5、Claude Sonnet 4.5、DeepSeek-V3.2、Gemini 2.5 Pro)进行了可靠性和可读性评估。该研究揭示了AI驱动患者教育在产后心理健康中的潜力与局限,为AI在公共卫生教育中的安全整合提供了重要参考。论文发表在《Frontiers in Psychiatry》。
**主要技术方法**
研究人员采用双模块研究设计。第一模块为基于MCQ的效度分析:从MedQA、MedMCQA及中国国家医学考试资源中筛选200道PPD标准化MCQ,涵盖临床表现与严重程度分层、诊断与临床评估、治疗策略、预防筛查与连续性管理四个领域,由六种AI模型分别独立回答三次,利用混合效应逻辑回归比较模型间准确性差异。第二模块为可靠性与可读性分析:通过Google Trends数据与专家评审制定20个核心公共教育问题,由四种最新模型通过Web界面回答一次,使用DISCERN、EQIP、GQS和JAMA基准评估可靠性,并采用ARI、CL、FKGL、FRES、GFI和SMOG六种可读性指数评估文本复杂度。所有评分由两名产科医生盲法独立完成,一致性通过组内相关系数(Intraclass Correlation Coefficient, ICC)检验。
**研究结果**
**3.1 Validity of AI chatbots on PPD multiple-choice questions**
在基于MCQ的效度分析中,六种AI模型在200道PPD相关MCQ上的总体准确率存在显著差异(p < 0.0001)。ChatGPT-5以97.50% ± 0.50%的准确率最高,其后依次为Gemini 2.5 Pro(93.17% ± 0.29%)、Claude Sonnet 4.5(93.00% ± 0.50%)、ChatGPT-4o(92.83% ± 0.76%)、DeepSeek-V3.2(92.67% ± 0.29%)和DeepSeek-R1(88.83% ± 0.76%)。在四个分领域(临床表现与严重程度、诊断与评估、治疗策略、预防筛查与管理)中,ChatGPT-5均表现最佳,除治疗策略领域外(p = 0.0928),其余领域模型间差异显著(p < 0.05)。版本迭代比较显示,ChatGPT-5较ChatGPT-4o准确率提升4.67个百分点,DeepSeek-V3.2较DeepSeek-R1提升3.83个百分点。
**3.2 Reliability analysis**
在四种最新模型的可靠性分析中,ChatGPT-5在DISCERN(44.35 ± 6.98)、EQIP(70.00 ± 7.78)和GQS(3.95 ± 0.51)三项指标上均获得最高均值,Gemini 2.5 Pro评分最低(DISCERN 33.15 ± 7.06;EQIP 59.75 ± 4.72;GQS 3.35 ± 0.49)。Kruskal-Wallis检验显示模型间差异显著(DISCERN和EQIP p < 0.001,GQS p = 0.007,JAMA p < 0.001)。成对比较表明,ChatGPT-5在DISCERN和EQIP上显著优于其余三种模型,在GQS上优于所有模型,但JAMA基准评分所有模型均极低(ChatGPT-5 0.30 ± 0.47,其余为0.00),表明响应缺乏透明度、来源归属、时效性和披露。项目层面分析显示,ChatGPT-5在几乎所有20个核心问题上获得更稳定的高可靠性评分,而其他模型变异较大。
**3.3 Readability analysis**
在可读性分析中,所有四种模型的文本复杂度均超过推荐的六年级阅读水平(FRES ≥ 80且年级水平指数 ≤ 6)。ChatGPT-5和Gemini 2.5 Pro的FRES均值分别为37.10 ± 9.17和37.50 ± 6.30,相对更易读;Claude Sonnet 4.5和DeepSeek-V3.2的FRES则为26.00 ± 10.71和25.30 ± 10.18,复杂度更高。所有指标模型间差异显著(Kruskal-Wallis检验,p < 0.001)。项目层面分析显示,ChatGPT-5和Gemini 2.5 Pro在20个问题中保持更一致的可读性,而其他模型变异较大。所有模型均未达到美国医学会(American Medical Association, AMA)和美国国立卫生研究院(National Institutes of Health, NIH)推荐的患者教育材料六年级阅读水平。
**讨论与结论**
讨论部分指出,本研究系统评估了AI聊天机器人在PPD问题上的效度、可靠性和可读性。ChatGPT-5在MCQ准确率和多项内容质量指标上表现更优,但JAMA基准评分低表明所有模型在透明度和来源可追溯性方面存在局限。模型间可靠性存在主题依赖性变异,提示用户不应完全依赖聊天机器人响应作为自主信息源。可读性分析显示所有模型输出均超过推荐阅读水平,可能限制低健康素养或数字素养用户的可及性。研究局限性包括:MCQ测试仅评估结构化知识识别而非临床安全;公共教育问题开发存在选择偏倚;DISCERN工具应用于非治疗相关问题需谨慎;可读性仅评估英文响应;未纳入正式可用性分析或患者理解测试。
结论翻译:本研究评估了AI聊天机器人在产后抑郁相关问题上的基于MCQ的效度、内容质量、透明度和可读性。在六个模型的效度分析中,ChatGPT-5在标准化MCQ上取得了最高准确率。在四个模型的公共教育分析中,ChatGPT-5显示出相对更好的内容质量评分,但所有模型的低JAMA评分表明,当前聊天机器人的响应在透明度、来源归属、时效性和披露方面仍存在局限,即使它们在部分内容质量指标上提供了临床相关信息。这些发现表明,AI聊天机器人可能作为产后抑郁教育的补充工具具有潜力,但不应被视为医学或心理健康信息的自主来源。本研究未评估临床安全性、患者理解力、可用性、用户行为或真实世界有效性。此外,聊天机器人输出持续较高的阅读水平表明,默认的AI生成响应可能不足以直接用于患者,除非采用明确的简化策略、可读性优化、通俗语言编辑和专家审查。因此,AI聊天机器人不应替代专业评估、诊断或治疗,尤其是在产后心理健康这一敏感背景下。鉴于响应质量存在主题依赖性变异,聊天机器人生成的信息可能有助于一般性知晓和问题准备,但在用于产后心理健康决策前应经专业或临床医生审核来源进行验证。