动机性访谈能否通过人工智能聊天机器人进行?评估GPT-4o的能力

《Patient Education and Counseling》:Can Motivational Interviewing be delivered using Artificial Intelligence chatbots? Evaluating the capability of GPT-4o

【字体: 时间:2026年07月21日 来源:Patient Education and Counseling 3.1

编辑推荐:

  大型语言模型(Large Language Models,例如GPT)在医疗保健中的应用日益增多。关于其提供动机性访谈(Motivational Interviewing, MI)的能力所知甚少。研究人员发现GPT-4o偏离了以人为中心的支持(person-c

  
大型语言模型(Large Language Models,例如GPT)在医疗保健中的应用日益增多。关于其提供动机性访谈(Motivational Interviewing, MI)的能力所知甚少。研究人员发现GPT-4o偏离了以人为中心的支持(person-centred support)。GPT-4o需要增强(augmentation)才能有效应用动机性访谈。
**研究背景与问题**
动机性访谈(Motivational Interviewing, MI)是一种以人为中心、基于证据的对话风格,旨在通过探索和解决矛盾心理(ambivalence),支持个体做出并维持健康行为改变(如戒烟、糖尿病管理、药物依从等)。MI的核心在于“精神”(spirit)——合作、接纳、共情和唤起患者自身的改变动机,并强调“技术性”(technical)元素(引导患者语言朝向改变谈话)和“关系性”(relational)元素(以人为中心的成分)。然而,训练有素的MI从业者全球短缺,且MI技能在缺乏持续督导和进修培训时易退化,这限制了患者获得高质量MI支持的机会。同时,慢性疾病发病率上升,对可及、可负担的行为改变支持需求日益增长。人工智能聊天机器人,特别是大型语言模型(Large Language Model, LLM),如GPT-4o,因其能生成类人对话,被视为提供可扩展、即时MI服务的潜在工具。但现有研究多将LLM约束于特定MI子技能(如反思)或单一行为,缺乏对其在无约束条件下全面提供MI能力的系统评估,且极少使用验证工具(如动机性访谈治疗完整性编码,Motivational Interviewing Treatment Integrity, MITI)评估其技术性和关系性能力。因此,本研究旨在系统评估GPT-4o在多种健康行为中提供MI的基础能力,并识别其优势与不足,为后续增强(augmentation)提供依据。该论文发表在《Patient Education and Counseling》。

**主要技术方法**
研究使用GPT-4o(版本gpt-4o-2024-08-06)通过OpenAI API开发聊天机器人,系统提示设为“你是Chris,一名健康从业者,与一名新患者进行动机性访谈”。招募12名模拟患者(simulated patients)——来自大学表演课程校友和模拟培训组织,扮演四类虚构患者(糖尿病及体重管理、酒精滥用、哮喘管理、甲基苯丙胺使用),每人进行三场书面对话,每场最长45分钟。对话记录以MITI 4.2.1编码,包含四个全局评分(培养改变谈话、软化维持谈话、合作、共情,1-5分)和10个行为计数(如给予信息、说服、有允许的说服、问题、简单反思、复杂反思、肯定、寻求协作、强调自主、对抗),并计算复合评分(如技术全局、关系全局、复杂反思百分比、反思-问题比、MI一致/非一致行为总分)。两名评审员编码,通过七轮批处理解决分歧。同时分析MITI编码序列的分布及其在对话时间轴上的变化概率。

**研究结果**
**3.1. Results of MITI analysis of MI capability**
通过MITI编码分析,GPT-4o在行为计数上表现良好,但在全局评分上低于公平能力阈值。具体而言:
- 全局评分:软化维持谈话(均值3.14)和共情(3.06)得分最高,培养改变谈话(1.92)和合作(2.36)得分较低。
- 行为计数:寻求协作(均值15.47)和有允许的说服(14.58)使用最多,强调自主(0.19)和对抗(0.83)使用最少。
- 复合评分:关系全局(2.71)和技术全局(2.53)均低于公平能力阈值(分别为3.5和3.0);复杂反思百分比(66.44%)和反思-问题比(2.31)高于良好阈值(分别为50%和2)。总MI一致行为(23.58)高,非一致行为(0.83)低。
然而,GPT-4o大量使用“有允许的说服”(Persuade with Permission),该行为在MITI中被视为中性,但不符合MI精神(聚焦于引发患者自身改变理由)。这导致其技术性和关系性能力不足,尤其缺乏唤起患者改变谈话的技能。

**3.2. Sequences of MITI codes**
分析MITI编码序列,发现六种最常见序列,其中三种包含说服(Persuade或Persuade with)因此与MI不一致:[反思-有允许的说服-寻求协作](16%)、[有允许的说服-寻求协作](13%)、[肯定-有允许的说服-寻求协作](9%);三种与MI一致:[反思-问题](8%)、[肯定-寻求协作](4%)、[反思-寻求协作](4%)。时间轴分析显示,对话早期MI一致行为(如开放问题、复杂反思)概率较高,但迅速下降;从约40%对话时间起,MI非一致行为(包含说服)占主导,直至对话末尾才回升。这反映了GPT-4o的“修正反射”(righting reflex)模式:先进行参与和聚焦(使用复杂反思、肯定等),但立即跟随说服性建议,最后询问患者意见,缺乏对患者自身改变原因的唤起和强化。

**讨论与结论总结**
讨论部分指出,GPT-4o在行为模仿上表现令人惊讶,但偏离了MI的核心精神。与之前研究(如Steenstra等)相比,GPT-4o的复杂反思百分比和反思-问题比相似,但全局评分低于健康专业人员,仅与部分学生培训后水平相当。GPT-4o的刻板响应模式(先MI技能后说服)是技术性和关系性能力不足的主要原因,需通过增强(如更详细的提示工程或结合外部工具)来改善。研究局限性包括:使用模拟患者而非真实患者(可能缺乏情感复杂性和不可预测性),且仅评估了GPT-4o一个模型。未来需探索增强技术,并在真实患者中测试。
**结论翻译**:该研究考察了GPT-4o(一种大型语言模型)提供动机性访谈(MI)的能力。使用大型语言模型有潜力通过提供可及、可负担且允许人们无需担心评判或报复而寻求支持的健康指导来增强医疗护理。GPT-4o的响应在模仿MI行为方面显示出前景,但需要增强才能实现MI在行为改变支持中的全部潜力。需要进一步研究探索最佳增强技术,以提高GPT-4o在MI中的能力。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号