研究周期中的AI智能体:加速范围综述的实用指南

《Tijdschrift voor Urologie》:AI-agents in de onderzoekscyclus: een praktische handleiding voor het versnellen van scoping reviews

【字体: 时间:2026年09月04日 来源:Tijdschrift voor Urologie

编辑推荐:

  背景:系统综述和范围综述是循证泌尿外科护理的基础,但劳动强度大。AI智能体(AI agents)提供了加速该过程某些环节的机会。 目标:本指南向荷兰泌尿外科医生介绍用于范围综述的AI智能体,演示ASReview和PRISMA-ScR Review Assi

  
背景:系统综述和范围综述是循证泌尿外科护理的基础,但劳动强度大。AI智能体(AI agents)提供了加速该过程某些环节的机会。
目标:本指南向荷兰泌尿外科医生介绍用于范围综述的AI智能体,演示ASReview和PRISMA-ScR Review Assistent工作流程。
方法:研究人员描述了一个三阶段工作流程:(1)系统检索,(2)使用ASReview进行标题和摘要筛选,(3)使用PRISMA-ScR Review Assistent GPT生成报告。
结果:AI支持的筛选可节省高达95%的时间。人在回路(human-in-the-loop)验证仍然至关重要。
结论:当研究人员保持批判性监督时,AI智能体可大幅加速综述进程。
该论文发表在《Tijdschrift voor Urologie》,基于2025年11月27日荷兰腔内泌尿外科工作组(SWEN)会议的演讲,旨在向荷兰泌尿外科医生、住院医师和研究人员介绍如何利用AI智能体加速范围综述(scoping review)。

研究背景与问题:系统综述(systematic review)和范围综述是循证泌尿外科护理的基础。范围综述不同于回答特定问题、采用严格纳入标准的系统综述,其本质是探索性的,旨在绘制现有证据的广度与性质。然而,范围综述的实施极为劳动密集。一次典型检索可能产生数千篇潜在相关出版物,需要逐一进行标题与摘要筛选,随后还要全文阅读、数据提取和结果综合,即使有专门团队也通常耗时数月。人工智能(AI)尤其是大型语言模型(large language models, LLMs)的兴起,为加速这些环节提供了新可能。AI智能体(AI agents)是能够自主执行任务、从反馈中学习并处理复杂工作流程的软件系统。本文以一项关于尿失禁患者报告结局指标(patient-reported outcome measures, PROMs)的范围综述为案例,展示了如何通过AI智能体加速综述过程。

研究内容与结论:研究人员描述了一个三阶段工作流程:(1)系统检索,(2)使用ASReview进行标题与摘要筛选,(3)使用PRISMA-ScR Review Assistent GPT生成报告。结论认为,AI智能体可在研究人员保持批判性监督的前提下大幅加速综述流程,降低文献综述的门槛,同时不牺牲科学质量。

主要技术方法(不超过250字):该研究以数据库检索结果作为分析语料,检索来自PubMed/MEDLINE、Embase和CINAHL,截止2025年6月18日,共获得19555条记录,去除5968条重复后剩余13587条。关键技术方法包括:阶段1采用传统检索策略,由信息专家制定并由研究团队审核;阶段2使用ASReview(v1.6.6)进行主动学习(active learning)筛选,停止标准为至少筛选25%的记录且连续100篇不相关;阶段3使用定制的PRISMA-ScR Review Assistent GPT生成符合报告规范的概念文本。补充采用引文搜索以识别初始检索遗漏的PROM原始文献和后续验证研究。质量控制由一名研究者独立筛选10%的文章。

研究结果:

案例:PROM范围综述
数据库检索共获得19555条记录,去重后剩13587条进入ASReview筛选。达到停止标准后,系统检索纳入96篇文章;补充引文检索额外增加45篇,最终共纳入141篇文章,描述143个尿失禁特异性PROMs。

AI筛选带来的时间节省
假设按传统方式人工筛选13587篇摘要,以平均每篇30秒计算,约需113小时(约14个工作日)。使用ASReview后,筛选约25%的记录(约3400篇摘要)即可识别绝大多数相关文章,筛选时间显著减少。

内容发现
该研究结果显示,143个PROMs中有83个(58.0%)报告了患者参与,其中主要发生在条目生成阶段(40.3%)。74种工具(51.0%)具有经过验证的翻译版本,但仅11种(7.7%)报告了正式的可读性测量;4种PROMs提供象形图版本;仅24种(16.8%)记录了确定的微小重要差异(minimally important difference, MID)。

讨论部分总结:研究人员强调"人在回路"(human-in-the-loop)理念,即AI执行常规任务并对信息进行优先级排序,研究者保持批判性监督并作出最终决策。其原因包括:研究者对科学诚信负责;AI模型可能产生幻觉(hallucination),以高置信度呈现错误信息甚至不存在的文献;以及模型缺乏区分纳入标准中细微差别的领域专业知识。此外,标准化方法更有利于AI辅助,PRISMA-ScR的27个明确步骤构成了理想框架;其他标准化报告指南,如CONSORT(Consolidated Standards of Reporting Trials)和STROBE(Strengthening the Reporting of Observational Studies in Epidemiology),同样适用于此类AI支持。研究人员还提出实践建议:从小范围研究问题开始、透明记录AI工具使用、系统验证(如双人筛选和人工核对参考文献)、保持批判性态度、使用专门定制的GPT工具。当前局限包括ASReview依赖正确的先验知识,LLM输出可能不一致;未来模型有望具备多模态能力和集成搜索功能。

研究结论翻译:AI智能体为执行范围综述提供有价值的支持,并能显著加速研究过程。诸如ASReview用于智能筛选和PRISMA-ScR Review Assistent用于系统引导全部27个步骤等工具,现在对每位研究者都是可及的。将这些技术结合到结构化工作流程中,可以降低文献综述的进入门槛。成功使用的关键,在于认识到这些工具是助手,而非人类专业知识的替代品。通过批判性监督、系统验证输出和透明报告AI使用情况,泌尿外科医生可以在不牺牲科学质量的前提下享受效率优势。AI并不会取代综述写作,但会提供巨大帮助。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号