《Pharmaceutical Medicine》:Evaluating AI-Enabled Voice to Text for Medical Affairs Documentation and Insight Capture: The RAPID Randomized Crossover Trial
编辑推荐:
背景与目的:利用大型语言模型(LLM)和自然语言处理(NLP)的人工智能(AI)转录系统或可减轻文档负担。医学科学联络员(MSL)在记录与医疗专业人员(HCP)的科学互动时面临挑战。本研究由安进(Amgen)开展,评估AI赋能转录相较现有手动客户关系管理(CR
背景与目的:利用大型语言模型(LLM)和自然语言处理(NLP)的人工智能(AI)转录系统或可减轻文档负担。医学科学联络员(MSL)在记录与医疗专业人员(HCP)的科学互动时面临挑战。本研究由安进(Amgen)开展,评估AI赋能转录相较现有手动客户关系管理(CRM)录入实践(EP)能否改善MSL文档体验与洞察记录。方法:这项随机交叉研究纳入来自安进亚太6个分支机构的27名MSL;78%在V2T文档中使用非英语语言。受试者按1:1随机至先用Microsoft Copilot语音转文本(V2T)后EP,或先EP后V2T(Copilot),每期4周。主要结局为涵盖效率、CRM录入速度、认知负荷、易用性、洞察结构化的复合MSL满意度问卷(MSLSQ)评分。次要评估为设盲治疗领域(TA)专家对洞察质量的评级。探索分析含语言效应、互动数与定性反馈。结果:所有受试者完成两期。V2T(Copilot)的复合MSLSQ高于EP(均值差+0.763;p=0.0114,双向重复测量方差分析(ANOVA))。五域均倾向V2T(Copilot);Wilcoxon敏感性分析最稳定支持CRM录入速度、认知负荷与洞察结构化改善。TA专家评级洞察质量与记录互动数相似。日语与韩语受试者因转录准确率较低而满意度更低。结论:V2T(Copilot)改善文档体验,但未提升洞察质量或外勤活动。科学术语识别、多语言转录方面存在局限,为医学事务中AI支持文档优化提供方向。V2T(Copilot)提升复合MSL报告文档满意度,认知负荷、CRM录入速度、洞察结构化改善最明显。优势为减文档负担与改善结构化;实践局限为科技术语识别、日韩语准确率较低、缺乏原生CRM集成。
研究背景方面,医学事务职能已从支持角色演变为组织内战略伙伴,对医学科学联络员(MSL,field-based scientific exchange role)的分析严谨性、合规与结构化文档要求提高。临床场景中环境式AI文档工具可减少医生文书负担,但制药企业里MSL需以非推广方式与医疗专业人员(HCP)进行科学交流,并把手写或记忆中的互动整理进客户关系管理(CRM)系统;Veeva CRM虽占生命科学合规CRM市场逾80%,但研究期间无原生语音转录功能。已有文献多聚焦英语临床环境,亚太多语言、科技术语密集的医学事务场景缺乏证据。因此研究人员开展RAPID(Real-time AI–Assisted Post-Interaction Documentation)研究,用企业级Microsoft 365中的Word Dictate加Copilot做转录优先工作流,与手动EP比较,以判断是否能提升MSL满意度且不损洞察质量。
作者为开展研究用到的主要关键技术方法如下:采用两周期、两序列随机交叉设计,27名来自日本与亚太(JAPAC)分支机构的在岗MSL参与,入组要求任MSL超1年、常规用Veeva CRM、近12个月绩效满意;干预为在Amgen设备用Word Dictate口述会后总结,人工核对后再用Microsoft Copilot结构化,最后手录Veeva CRM,对照为纯手动CRM录入。主要终点用自拟5点Likert的MSL满意度问卷(MSLSQ)复合分;次要终点由具5年以上TA经验区域医学负责人设盲评匿名CRM摘要,按what/why/so what三维5点框架评洞察质量;统计用GraphPad Prism 10.6.1做双向重复测量ANOVA、Holm–Sidak校正、Wilcoxon配对、Mann–Whitney、主成分分析(PCA),并以PCA汇总语言相关表现。
研究结果部分,参与者:27人全完成两期,覆盖6国分支机构,22%用英语、37%普通话、30%日语、11%韩语。主要结局:双向重复测量ANOVA显示V2T(Copilot)复合MSLSQ均值3.304对EP 2.541,差+0.763(95% CI 0.187–1.339;F(1,26)=7.413;p=0.0114);效率域Copilot 3.30对2.74(Holm–Sidak p=0.0131,Wilcoxon p=0.12);CRM录入速度3.00对2.26(Holm–Sidak p=0.0011,Wilcoxon p=0.047);认知负荷3.41对2.33(Holm–Sidak p<0.0001,Wilcoxon p=0.003);易用性3.41对2.96(Holm–Sidak p=0.0287,Wilcoxon p=0.17);洞察结构化3.41对2.41(Holm–Sidak p<0.0001,Wilcoxon p=0.011),即研究人员通过自身前后对照与参数/非参数检验得出Copilot在感知速度与认知减负上更优但部分域仅方向一致。次要结局:TA专家评洞察质量Copilot 3.63对EP 3.45(Mann–Whitney p=0.4749),what/why/so what各域均不显著,说明AI未改变洞察本身科学价值。语言效应:日语(n=8)与韩语(n=3)在英—母话码换场景准确率可低于50%,英语与普通话报告准确率>90%;日语虽列Supported Languages仍近似Preview的韩语,PCA显示日韩PC1最低且日语离散大。用户偏好与定性反馈:67%(17/27)偏好V2T(Copilot),澳/台/东南亚偏好率100%,韩33%、日25%;局限为药物名、方案编号、HCP等缩写误识,Word外挂致额外拷贝步骤,重提示负担高。
讨论部分总结:研究人员指出感知“更快录入”与客观时间戳不一致——Copilot期互动到CRM均值9.4天、EP 7.5天,因转录在CRM外完成,出现感知—现实裂隙,类似开发者用AI高估效率现象。AI提升的是捕获与结构化过程,不替代MSL科学判断、TA专业与提问技巧;语言分类标签不能预测真实表现,需科技术典、码换微调、CRM内嵌三类改进。样本小、MSLSQ未验证、单公司治理、准确率靠自报属局限;意义在于给医学事务AI文档首份真实世界证据,提示降本应先解决术语、语言与集成。
结论部分原文意译:人工智能赋能V2T转录用Microsoft Copilot相较现有实践提升MSL报告的总体文档满意度,尤以降低认知负荷、加快感知CRM录入、改善互动摘要结构化为著;但未转化为专家评级洞察质量提升或外勤记录量增加,说明AI辅助转录主要服务文档流程而非洞察科学质量。实际部署暴露科技术语识别、日韩语准确率偏低、重提示修正成本等问题。后续扩面应评估多语言与混合语言转录、以科技术语表预训练、做用户培训与反馈闭环。该研究为《Pharmaceutical Medicine》所载论文,提供医学事务中企业级AI文档工具的首批实证与实施边界。