医疗保健专业人员对医疗人工智能的获益-风险认知测量:量表开发与验证

《International Journal of Medical Informatics》:Measuring healthcare professionals’ benefit-risk perceptions of medical AI: Scale development and validation

【字体: 时间:2026年09月14日 来源:International Journal of Medical Informatics 5.0

编辑推荐:

  目的:开发并验证针对医疗保健专业人员的人工智能获益-风险认知量表(AI-BRPS),并探索感知人工智能获益与风险之间的关联结构及核心节点。 方法:这项方法学研究通过文献综述、质性访谈、专家咨询和预调查生成了初始条目池。研究于2025年12月至2026年1月期

  
目的:开发并验证针对医疗保健专业人员的人工智能获益-风险认知量表(AI-BRPS),并探索感知人工智能获益与风险之间的关联结构及核心节点。

方法:这项方法学研究通过文献综述、质性访谈、专家咨询和预调查生成了初始条目池。研究于2025年12月至2026年1月期间,采用便利抽样法从中国36家三级医院招募了794名医疗保健专业人员,以评估初步量表的信度与效度。作为补充方法,研究人员在维度层面和条目层面进行了网络分析,以探索关联模式并识别核心节点和桥梁节点。

结果:最终的AI-BRPS包含13个条目的感知人工智能获益分量表(PABS)和16个条目的感知人工智能风险分量表(PARS),涵盖八个维度,采用五点Likert计分。探索性因子分析(EFA)识别出两个分量表均为四因子结构,分别解释67.531%和61.657%的方差。验证性因子分析(CFA)显示模型拟合良好。PABS和PARS的Cronbach's α系数分别为0.924和0.934,McDonald's ω系数分别为0.925和0.934,表明信度令人满意。网络分析表明,社会获益和专业风险在观测到的关联网络中占据相对有影响力的位置,而成本风险在获益感知与风险感知之间占据潜在桥梁位置。

结论:AI-BRPS已显示出令人满意的初步心理测量学特性,并有望用于评估在类似环境中医疗保健专业人员对医疗人工智能的获益期望和风险担忧,在实施前评估和干预结果的未来评价中具有潜在应用价值。未来有必要进一步评估重测信度、测量不变性和跨文化适用性。研究结果还可能凸显与人工智能实施相关的临床考量,包括临床可靠性、明确的责任边界、决策权限以及可管理的学习与使用成本。
# 论文解读:医疗保健专业人员对医疗人工智能获益-风险认知的量表开发与验证

## 一、研究背景与目的

随着人工智能(Artificial Intelligence, AI)在医疗领域的逐步深入,其在医学影像诊断、临床决策支持、健康管理等应用场景中发挥着越来越重要的作用。当AI系统越来越多地参与信息处理、风险预测以及诊疗建议生成时,其临床价值不再仅仅取决于技术性能,还取决于医疗保健专业人员是否能够在特定临床情境下理解、评估并恰当使用这些技术。医疗保健专业人员不仅是医疗AI的直接使用者,也是在AI生成建议纳入临床决策之前的核心解释者和责任承担者。因此,阐明医疗保健专业人员如何感知AI的潜在获益与风险,有助于揭示其对AI临床应用的关切与期望,同时为后续实施策略提供依据。

本研究中,感知AI获益与感知AI风险并非指AI的客观有效性或风险的实际发生率,而是指医疗保健专业人员基于其临床经验、职业责任和使用情境,对AI可能产生的后果所形成的主观判断。现有研究表明,医疗保健专业人员对医疗AI的态度往往并非简单的支持或抵制,而是在认可其作为临床辅助工具价值的同时,对责任归属、患者安全和职业角色变化等问题保持谨慎。这种矛盾态度表明,仅从总体态度、接受意愿或技术信任等单一维度测量对医疗AI的感知,可能掩盖专业人员同时认可其价值又担忧其后果的复杂判断过程。

然而,现有测量工具尚不足以满足测量医疗保健专业人员对AI获益和风险感知的需求。其一,部分AI相关量表主要面向普通公众、学生群体或单一专科情境,评估的是广泛态度或采纳相关信念,而非专业人员如何权衡AI的临床后果。其二,现有研究多将AI相关效能风险、隐私安全或接受意愿分开讨论,鲜有工具在同一量表中同时评估感知获益和感知风险。其三,许多研究依赖自行编制的问卷,心理测量学评价相对有限,难以作为可重复使用的标准化工具。此外,获益感知与风险感知的内部关联结构仍有待阐明。传统心理测量学方法虽可检验量表的结构维度和测量质量,但关于不同感知获益和风险在更广泛认知系统中的相互关系提供的信息有限,而网络分析能够刻画感知内容的关联组织结构,识别高影响力节点及连接获益与风险感知的桥梁节点。

因此,本研究旨在开发并验证针对医疗保健专业人员的人工智能获益-风险认知量表(Artificial Intelligence Benefit-Risk Perception Scale, AI-BRPS),随后应用网络分析探索其维度与条目的关联模式,识别潜在的核心节点与桥梁节点,从而为测量和解释医疗保健专业人员对医疗AI的获益-风险认知提供依据。

## 二、研究方法概况

本研究为方法学研究,分三个阶段开展。第一阶段聚焦量表开发,通过文献综述、质性研究、专家咨询和预调查完成。文献综述系统检索了PubMed、Web of Science及中国知网(CNKI)等数据库,纳入49篇研究,据此初步构建了包含14个条目、5个维度的感知AI获益分量表(Perceived AI Benefit Subscale, PABS)和包含22个条目、6个维度的感知AI风险分量表(Perceived AI Risk Subscale, PARS)。质性研究采用扎根理论方法,于2025年4月至5月对18名医疗保健专业人员(包括护士、医生、管理者、医学信息专家和医技人员)进行半结构化访谈,通过开放、主轴和选择性编码及持续比较法分析数据,经过18次访谈后达到理论饱和。研究团队在此基础上进行了多轮讨论,整合与优化维度结构,形成包含15个PABS条目和19个PARS条目的专家咨询版量表。随后于2025年8月至11月邀请20名专家进行两轮德尔菲咨询,评价条目重要性和内容效度。预调查于2025年11月在重庆市某三级医院20名医疗保健专业人员中开展,评估条目表述清晰度、选项适当性和完成时间。

第二阶段为心理测量学评估。2025年12月至2026年1月,通过问卷星平台(https://www.wjx.cn/)在中国36家三级医院中对医疗保健专业人员开展调查,共回收1103份问卷,排除无效问卷后保留794份有效问卷(有效率71.99%)。将有效样本按45%和55%随机分为子样本1(n=357)和子样本2(n=437),分别用于条目分析、探索性因子分析(Exploratory Factor Analysis, EFA)和验证性因子分析(Confirmatory Factor Analysis, CFA)及后续信效度检验。采用临界比值法、相关分析和同质性检验进行条目筛选;通过EFA和CFA检验结构效度,通过平均方差抽取量(Average Variance Extracted, AVE)和组合信度评估收敛效度,通过AVE平方根与因子间相关比较评估区分效度,并采用人与自动化之间的信任量表(Trust between People and Automation Scale, TPAS)作为外部测量进行效标关联效度检验。信度检验包括Cronbach's α系数、McDonald's ω系数和分半信度。

第三阶段为网络分析,基于第二阶段的有效样本数据,分别构建维度层面和条目层面的高斯图形模型(Gaussian Graphical Model, GGM),采用图形化最小绝对收缩和选择算子(graphical least absolute shrinkage and selection operator, GLASSO)正则化获得稀疏网络,通过扩展贝叶斯信息准则(Extended Bayesian Information Criterion, EBIC)选择最优正则化参数,计算预期影响(Expected Influence, EI)和桥梁预期影响(Bridge Expected Influence, BEI)以识别核心节点和桥梁节点,并通过自举法(bootstrap)评估网络准确性和稳定性。统计分析使用R 4.2.0和AMOS 28.0完成。

## 三、研究结果

### 1. 第一阶段:专家咨询与预调查结果

第一轮德尔菲咨询中,19名专家参与,第二轮18名专家完成两轮咨询,专家权威系数分别为0.88和0.90。两轮咨询中PABS条目重要性均分为4.21-4.89和4.44-5.00,PARS条目重要性均分为4.16-4.89和4.39-4.94。第一轮中PABS和PARS的条目水平内容效度指数(Item-level Content Validity Index, I-CVI)范围为0.895-1.000,量表水平内容效度指数(Scale-level Content Validity Index, S-CVI)分别为0.972和0.981。结合定量标准和专家意见,第一轮删除PABS的2个条目和PARS的3个条目,新增2个PABS条目和4个PARS条目,并修订23个条目。第二轮中PABS和PARS的I-CVI范围为0.944-1.000,S-CVI分别为0.989和0.983,无条目达到删除标准,新增2个条目,进一步修订12个条目。预调查中20名参与者平均年龄(36.55±9.36)岁,完成问卷时间为3-9分钟,参与者普遍接受5点Likert计分格式,仅1人提出修改建议,据此修订了PARS的第11个条目,最终形成含16个PABS条目和21个PARS条目的初版量表。

### 2. 第二阶段:心理测量学评估结果

**参与者特征。** 794名有效参与者中,30-39岁年龄段占比最大(45.84%),女性占84.01%,护士占75.06%。32.62%的参与者知晓AI但未正式使用过。两个子样本在年龄(P=0.028)和AI使用经验(P=0.006)上存在统计学显著差异,但效应量均较小(Cramér's V分别为0.107和0.135)。

**条目分析结果。** 在16个PABS条目中,条目9在三种条目分析方法中均达到删除标准,临界比值为2.474,条目-总分相关系数为0.368,校正条目-总分相关(Corrected Item-Total Correlation, CITC)低于0.40,且删除后内部一致性提高,因此予以删除。条目3虽在维度层面达到删除标准,但其分量表和维度层面的CITC均可接受,且删除后总量表Cronbach's α从0.904降至0.896,故予以保留。PABS最终保留15个条目。在21个PARS条目中,条目5和条目11的条目-总分相关系数低于0.40(分别为0.312和0.384),分量表层面CITC也低于0.40,且在概念区分度上有限,因此予以删除。条目18因评估部门部署成本和预算重新分配可能并非对所有医疗保健专业人员同样适用,且要求受访者做出多重判断,故予以删除。PARS最终保留18个条目。

**结构效度。** PABS的EFA结果显示KMO值为0.900,Bartlett球形检验显著(χ2=3174.177,P<0.001),适合进行因子分析。条目3和条目8存在交叉负载,予以删除。最终EFA提取4个特征值大于1的因子,解释总方差的67.531%,各条目在对应因子上的载荷范围为0.723-0.893,无交叉负载。修订后的PABS保留13个条目,包含4个维度:绩效获益(Performance Benefit, PB,3个条目)、职业获益(Professional Benefit, PrB,3个条目)、社会获益(Social Benefit, SB,3个条目)和成本获益(Cost Benefit, CB,4个条目)。CFA一阶模型拟合良好:χ2/df=2.915,RMSEA=0.066,SRMR=0.036,TLI=0.963,IFI=0.972,CFI=0.972。二阶模型同样拟合良好:χ2/df=2.839,RMSEA=0.065,SRMR=0.037,TLI=0.965,IFI=0.972,CFI=0.972。13个条目在一阶因子上的标准化载荷为0.80-0.89,四个一阶因子在二阶构念上的标准化载荷为0.73-0.81,全部具有统计学显著性(P<0.05)。

PARS的EFA结果显示KMO值为0.926,Bartlett球形检验显著(χ2=3397.152,P<0.001)。条目12和条目17存在交叉负载,予以删除。最终EFA提取4个特征值大于1的因子,解释总方差的61.657%,各条目在对应因子上的载荷范围为0.685-0.880,无交叉负载。修订后的PARS保留16个条目,包含4个维度:绩效风险(Performance Risk, PR,5个条目)、职业风险(Professional Risk, PrR,4个条目)、社会风险(Social Risk, SR,4个条目)和成本风险(Cost Risk, CR,3个条目)。CFA一阶模型拟合良好:χ2/df=2.745,RMSEA=0.063,SRMR=0.040,TLI=0.956,IFI=0.964,CFI=0.964。二阶模型同样拟合良好:χ2/df=2.692,RMSEA=0.062,SRMR=0.040,TLI=0.958,IFI=0.965,CFI=0.965。16个条目在一阶因子上的标准化载荷为0.74-0.87,四个一阶因子在二阶构念上的标准化载荷为0.75-0.83,全部具有统计学显著性(P<0.05)。

**收敛效度与区分效度。** PABS各维度标准化因子载荷为0.802-0.893(均>0.50),组合信度为0.877-0.907(均>0.70),AVE为0.705-0.760(均>0.50),表明收敛效度良好。PABS各维度间相关系数为0.491-0.572(P<0.05),各维度AVE平方根为0.840-0.872,均大于该维度与其他维度的相关系数,表明区分效度良好。PABS总分与TPAS总分呈正相关(r=0.444,P<0.01),四个维度与TPAS总分的相关系数为0.357-0.427(均P<0.01),与假设一致。PARS各维度标准化因子载荷为0.736-0.874(均>0.50),组合信度为0.861-0.909(均>0.70),AVE为0.607-0.742(均>0.50),表明收敛效度良好。PARS各维度间相关系数为0.505-0.606(P<0.05),各维度AVE平方根为0.779-0.861,均大于该维度与其他维度的相关系数,表明区分效度良好。PARS总分与TPAS总分呈负相关(r=-0.460,P<0.01),四个维度与TPAS总分的相关系数为-0.353至-0.473(均P<0.01),与假设一致。

**信度检验。** 13个条目的PABS总体Cronbach's α为0.924,McDonald's ω为0.925,Spearman-Brown分半信度系数为0.954,表明内部一致性极佳。各维度Cronbach's α范围为0.874-0.907,其中成本获益维度信度最高。所有条目CITC值均超过0.40,删除任何条目后Cronbach's α均无实质性提高。16个条目的PARS总体Cronbach's α为0.934,McDonald's ω为0.934,Spearman-Brown分半信度系数为0.961,表明内部一致性极佳。各维度Cronbach's α范围为0.860-0.909,其中绩效风险维度信度最高。所有条目CITC值均超过0.40,删除任何条目后Cronbach's α均无实质性提高。最终AI-BRPS包含两个独立计分的分量表,共29个条目、8个维度,均采用5点Likert计分,从1(“非常不同意”)到5(“非常同意”),所有条目均为正向计分。

### 3. 第三阶段:网络分析结果

**网络结构。** 维度层面网络包含8个节点、28条边,其中21条为非零边,平均边权重为0.176。PABS与PARS两个分量表内部连接相对较强,尤其是社会获益与成本获益之间(权重=0.482)以及职业风险与社会风险之间(权重=0.490)。相比之下,PABS与PARS之间的跨分量表连接较少且普遍较弱,其中绩效获益与成本风险之间的负向边相对较强(权重=-0.070),表明在观测到的网络结构中,AI获益感知与风险感知之间存在一定程度的结构区分。条目层面网络包含29个节点、406条边,其中160条为非零边,平均边权重为0.089。29个条目呈现出清晰的理论维度聚类模式,同一维度内条目之间的连接更强。PABS中最强的边为PB1-PB2(权重=0.495)和CB12-CB13(权重=0.469);PARS中最强的边为CR15-CR16(权重=0.539)和SR12-SR13(权重=0.406)。获益感知与风险感知条目之间的跨分量表连接总体上少于分量表内部连接,且部分为负向连接,表明获益与风险感知在关联组织上相对独立,同时通过有限的跨分量表关系相互连接。

**核心节点与桥梁节点。** 维度层面网络中,社会获益的EI最高(EI=1.179),其次是职业风险(EI=1.047),表明两者在网络中具有较大影响力。成本风险的EI最低(EI=0.524),表明其与其他维度的关联较弱。在桥梁中心性分析中,成本风险显示出最大的绝对BEI(BEI=-0.113),表明其在获益感知与风险感知之间可能发挥负向桥梁作用。条目层面网络中,SR13的EI最高(EI=1.180),其次是SB7(EI=1.099)、CR16(EI=1.078)和PR3(EI=1.053),表明这些条目具有相对较高的中心性。相比之下,PrR8(EI=0.752)和CR15(EI=0.770)的EI值较低,表明其整体连通性较弱。在桥梁中心性分析中,CR15显示出最大的绝对BEI(BEI=-0.076),表明其可能作为获益感知与风险感知之间的重要桥梁条目。

**网络准确性与稳定性。** 自举分析显示,维度层面和条目层面网络中大多数边权重的95%置信区间较窄,表明估计精度良好。差异检验显示,维度层面网络中大多数边权重存在显著差异,条目层面网络中约半数边权重差异显著,表明节点间连接强度存在差异。案例删除自举分析显示,维度层面网络中EI和BEI的稳定性良好,CS系数分别为0.751和0.516。条目层面网络中EI稳定性良好(CS=0.673),而BEI稳定性可接受但较低(CS=0.438)。中心性差异检验显示,多个维度间EI存在显著差异,BEI差异主要存在于成本风险、绩效获益与其他维度之间。条目层面网络中,多个条目间EI差异显著,BEI差异主要集中在CR15、PrR8、PrR7与其他条目之间。

## 四、讨论与结论

本研究的网络分析结果表明,感知获益和感知风险形成了两个相对独立的关联子网络,条目聚类模式与预设理论维度基本一致。社会获益在维度网络中EI最高,与成本获益和职业获益联系紧密,表明感知到的医疗服务可及性和便利性的改善可能与诊疗工作流程和资源利用的感知改善相关。职业风险在维度网络中EI相对较高,与社会风险联系最为紧密,表明专业人员对AI职业风险的感知可能与社会风险如医患关系和临床决策权限相关。条目层面SR13“AI技术可能削弱医疗保健专业人员和患者在临床决策中的主导作用”的EI最高,表明决策权限的变化可能是感知风险结构中的重要组成部分。相比之下,PrR6和PrR8关于工作替代和职业价值受损的条目EI相对较低,表明专业人员对AI相关风险的担忧并不局限于工作替代,而是更多关注在AI引入临床决策后能否维持决策权限、明确责任边界以及维护患者对专业判断的信任。

桥梁分析表明,成本风险在观测到的关联网络中占据获益感知与风险感知之间的潜在桥梁位置。条目层面CR15“学习和有效使用AI技术可能消耗我太多的时间和精力”与PrB6“AI技术可以通过工作流程自动化减轻我的工作量”之间显示出相对突出的桥梁关联,表明感知到的工作量减轻获益可能与专业人员对学习成本、时间投入和使用负担的感知相关。即使专业人员认可AI在提高效率、支持临床决策或优化资源配置方面的潜在价值,如果其认为使用AI将增加培训、操作步骤或结果解读时间方面的负担,其对AI获益的积极感知也可能被削弱。

AI-BRPS在理论和实践层面均具有意义。理论上,该量表通过区分绩效、职业、社会和成本相关维度的感知成分,有助于深化对医疗保健专业人员对医疗AI获益-风险权衡的理解,为未来研究不同专业群体、AI相关经验水平和组织情境下的感知差异提供了基础。实践上,AI-BRPS可为医疗机构在AI实施前或实施过程中刻画专业人员的获益期望和风险担忧提供有用信息,有助于识别实施前评估、风险沟通、员工培训和AI素养项目中需要进一步关注的领域。网络发现进一步表明,决策自主性、患者信任、责任边界、工作量和学习成本可能是实施医疗AI时需要关注的考量因素。对医疗机构和AI开发者而言,关注系统透明度、人机责任分配、可用性和工作流程适配性可能有助于解决通过此类评估识别出的担忧。

本研究存在以下局限性:第一,横断面设计和网络分析中使用的偏相关方法无法推断节点之间因果方向;第二,参与者主要来自三级医院,护士约占样本的75%,研究发现可能更多反映护士的经验和观点,对不同类型的医生、医技人员及其他医疗保健专业群体以及基层医疗机构的推广性尚不确定;第三,未检验重测信度、跨相关亚组的测量不变性和跨文化验证。

研究结论为:本研究开发并验证了针对医疗保健专业人员的AI-BRPS。该量表包括两个独立计分的分量表PABS和PARS,各包含绩效、职业、社会和成本四个维度,表现出令人满意的初步心理测量学特性。网络分析作为一种补充方法,表明感知获益和感知风险相对独立又相互连接,社会获益和职业风险占据相对有影响力的位置,成本风险在观测到的关联网络中占据潜在桥梁位置。在类似环境中,AI-BRPS可为未来研究、实施前评估、风险沟通以及AI素养或教育干预的调查研究提供有用的基础。在更广泛的专业群体、医疗机构和文化背景下推广使用之前,有必要进一步评估重测信度、测量不变性和跨文化适用性。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号