为生成式人工智能培训公共卫生人员:意大利聊天机器人可用性问卷的验证

《Frontiers in Public Health》:Training the public health workforce for generative AI: validation of the Italian Chatbot Usability Questionnaire

【字体: 时间:2026年08月11日 来源:Frontiers in Public Health 4.1

编辑推荐:

  摘要 引言:人工智能(AI)在公共卫生实践中的相关性日益增强。然而,在非英语语境中,针对AI聊天机器人的可扩展培训模型和经过验证的可用性工具仍然有限。研究人员旨在(i)评估意大利公共卫生专业人员样本中的AI知识、态度和实践(KAP),以及(ii)将聊天机器

  
摘要
引言:人工智能(AI)在公共卫生实践中的相关性日益增强。然而,在非英语语境中,针对AI聊天机器人的可扩展培训模型和经过验证的可用性工具仍然有限。研究人员旨在(i)评估意大利公共卫生专业人员样本中的AI知识、态度和实践(KAP),以及(ii)将聊天机器人可用性问卷(CUQ)翻译、文化适应并进行心理测量学验证,形成意大利语版本(CUQ-IT),并将其应用于一个工作坊开发的疫苗接种咨询聊天机器人。
方法:研究人员在意大利第57届国家卫生、预防医学与公共卫生大会(意大利,2024年10月)期间开展了一项三阶段研究:(i)在横断面KAP调查中使用意大利语翻译和改编的CUQ;(ii)一个90分钟的理论-实践工作坊,包括引导式提示工程和协作开发一个用于疫苗接种咨询的定制GPT(VaxSense),随后进行监督式互动;(iii)工作坊后使用CUQ-IT进行可用性评估和心理测量学测试。使用KMO和Bartlett检验评估结构充分性。使用Cronbach's α估计内部一致性。探索了KAP与可用性评分之间的关联。
结果:150名工作坊参与者中,87人返回问卷(58%);86人符合KAP分析条件,77人完成了CUQ-IT用于可用性评估。参与者(平均年龄35.9±8.7岁;55.8%为女性)报告了中等水平的AI知识(均值2.74±1.05/5)、积极的态度(3.87±0.73/5)和有限的常规使用(2.88±1.11/5)。CUQ-IT显示出良好的抽样充分性(KMO=0.81)和显著的项目间相关性(Bartlett χ2(120)=515.36,p值<0.001)。总体内部一致性较高,Cronbach's α=0.881。VaxSense的CUQ-IT平均可用性得分为66.60±15.29(范围18.75-95.31)。具有较高AI知识、更积极态度和更频繁AI使用的参与者倾向于给出更高的可用性得分。
结论:在意大利公共卫生专业人员样本中,出现了中等水平的基线AI知识、积极态度和有限的常规AI使用,而工作坊开发的疫苗接种聊天机器人总体实现了良好的可用性。在自我评定的AI知识和可用性得分中观察到的显著性别差异表明,“AI准备度”可能是不均衡的,即使在受过训练的专业群体内也是如此,这强调了包容性能力建设策略的必要性。在公共卫生领域,培训应被视为安全实施的一个组成部分:加强批判性评估输出、识别常见失败模式、减轻偏见和公平风险以及应用隐私设计原则的能力。CUQ-IT展示了稳健的心理测量学性能,并代表了一个在意大利环境中基准测试聊天机器人可用性的标准化工具。未来的研究应在更大样本中确认其测量结构,并评估针对性培训是否能够缩小能力差距,支持AI在公共卫生实践中的适当和持续使用。
**论文解读:公共卫生人员生成式人工智能培训与意大利聊天机器人可用性问卷验证**

**研究背景与问题**
随着人工智能(AI)技术在公共卫生领域的快速渗透,其对监测、健康传播和决策支持等方面的变革潜力日益显著。然而,国际经验表明,公共卫生人员普遍存在AI知识有限、实践经验不足的问题,尤其是在非英语语境中,缺乏可扩展的培训模式和经过验证的可用性评估工具。现有研究指出,医生群体对AI赋能数字健康工具的知识掌握不充分,态度混杂,且缺乏足够的实践体验,这成为安全实施的主要障碍。同时,生成式AI驱动的聊天机器人(如用于疫苗接种咨询的工具)虽被广泛提议,但其可用性、透明度、可靠性及潜在危害评估框架仍不完善。在此背景下,意大利卫生与预防医学学会(SItI)与意大利医学人工智能学会(SIIAM)合作,在2024年10月举行的第57届国家卫生、预防医学与公共卫生大会上举办了一场理论-实践工作坊,旨在提升公共卫生人员的AI素养,并验证聊天机器人可用性问卷(CUQ)的意大利语版本(CUQ-IT)。

**研究目的与意义**
本研究旨在评估意大利公共卫生专业人员对AI的知识、态度与实践(KAP),并通过工作坊开发一个疫苗接种咨询聊天机器人VaxSense,同时翻译、文化适应并心理测量学验证CUQ-IT。该研究发表在《Frontiers in Public Health》上,为意大利公共卫生领域负责任且有效的AI整合提供了贡献:一是提供了一个标准化工具以评估聊天机器人可用性,二是揭示了AI素养的现状,包括谨慎乐观但实践有限、以及显著的性别差异。

**主要关键技术方法**
研究人员采用三阶段设计:(1)工作坊前,通过横断面调查收集KAP数据,使用单条目Likert量表(1-5分)分别测量AI知识、态度和实践;(2)开展90分钟理论-实践工作坊,包括教育讲座(涵盖大型语言模型原理、提示工程、定制GPT开发)和协作开发VaxSense(基于OpenAI的GPT Builder);(3)工作坊后,使用CUQ-IT进行可用性评估,并通过KMO检验、Bartlett球形检验、探索性因子分析、Cronbach's α及Spearman相关分析进行心理测量学验证。样本来源为意大利帕勒莫大会的150名工作坊参与者(最终有效问卷86份用于KAP,77份用于可用性分析)。

**研究结果**
**3.1 知识、态度与实践(KAP)**
- 知识:总体AI知识均值2.74±1.05(中位数3),男性显著高于女性(p=0.006),但年龄和专业间无显著差异。
- 态度:总体态度均值3.87±0.73(中位数4),各亚组间差异不显著。
- 实践:总体实践均值2.88±1.11(中位数3),专业间差异显著(p=0.009),住院医师和博士生最高(3.19±1.05)。

**3.2 CUQ-IT验证**
- 因子分析显示良好抽样充分性(KMO=0.81)和显著项目相关性(Bartlett χ2=515.36,p<0.001)。
- 平行分析支持单因子结构(特征值6.09,解释方差38.1%),所有项目在单因子上的载荷为0.31-0.76,13/16项目≥0.40,提取因子解释34.4%方差。
- 内部一致性高(Cronbach's α=0.881),三个概念域(个性、响应处理、导航便捷性)的α分别为0.697、0.828、0.716。

**3.3 VaxSense可用性评估**
- CUQ-IT得分范围18.75-95.31,均值66.60±15.29,中位数68.75。
- 男性得分显著高于女性(72.12 vs 62.54,p=0.004);年龄和职业间差异不显著。
- 具有较高AI态度(rho=0.27,p=0.018)和较频繁AI使用(虽未达显著性)的参与者倾向于给出更高可用性得分。

**讨论与结论**
研究发现,参与者表现出“态度-实践差距”:积极态度但实践有限,这反映了缺乏操作技能而非怀疑态度。工作坊结合理论与实践,有助于弥合这一差距。性别差异在AI知识和可用性评分中均显著,提示需采取包容性培训策略。CUQ-IT的心理测量学性能稳健,可作为意大利环境中评估聊天机器人可用性的标准化工具。研究结论强调,应将培训视为安全实施的一部分,以培养批判性评估输出、识别失败模式、减轻偏见和公平风险、应用隐私设计原则的能力。未来研究需在更大样本中确认测量结构,并评估针对性培训对缩小能力差距的效果。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号