综述:解剖病理学中的智能体AI工作流:机遇与挑战

《Journal of Pathology Informatics》:Agentic AI workflows in anatomic pathology: Opportunities and challenges

【字体: 时间:2026年09月14日 来源:Journal of Pathology Informatics CS8.8

编辑推荐:

  人工智能(AI)在解剖病理学中的应用主要集中于基于图像的诊断应用,但该专业的许多认知工作是以文本形式进行的:回顾临床病史、起草报告、协调检测以及沟通结果。大型语言模型(LLM)可用于完成其中的许多任务,而智能体系统通过检索外部信息、调用软件工具、遵循特定任务的

  
人工智能(AI)在解剖病理学中的应用主要集中于基于图像的诊断应用,但该专业的许多认知工作是以文本形式进行的:回顾临床病史、起草报告、协调检测以及沟通结果。大型语言模型(LLM)可用于完成其中的许多任务,而智能体系统通过检索外部信息、调用软件工具、遵循特定任务的指令、追踪工作流状态以及在人类监督下执行复杂的多步骤任务来扩展其能力。这篇概念性综述概述了智能体AI系统的关键组成部分,包括检索增强生成(RAG)、工具使用、技能以及所谓的“智能体循环”——并将它们应用于解剖病理学工作流。三个说明性的设计草图分别利用反射检测支持、工作量平衡与病例路由以及辅助检测决策支持,来解释智能体系统如何结合实验室信息系统(LIS)数据、可信的知识源、本地策略以及明确的人类批准关卡。我们审视了临床部署的考量因素,包括互操作性与集成挑战、生命周期治理与验证、安全与安保问题,以及成本与可持续性。智能体AI为病理学中的AI提供了一个合理且建设性的近期愿景:得到更好支持的诊断,使病理学家能将更多时间投入到判断、责任和真正的关怀——这些仍然是人类独有的特质上。
1. 背景
1.1. 大型语言模型简介
大型语言模型(LLM)是基于Transformer架构的人工智能(AI)系统,其注意力机制使其能够理解词语序列间的相对重要性并进行语境化处理。经过海量数据训练后,LLM展现出模仿理解和生成类人回应的卓越能力。它们在文档摘要、情感分析、文本分类和文本生成等语言处理任务中表现出色。在临床医学中,LLM已被应用于临床决策支持、临床文档记录、病历摘要、环境监听以及医患沟通等领域。此外,还涉及匹配患者与临床试验、支持医疗编码工作流、自动化医院质量指标提取与报告、起草预授权信函以及从健康记录中提取临床研究数据等应用。其中一些功能已超越研究阶段,作为商业产品投入临床使用,例如Epic系统公司集成的笔记摘要、放射报告发现提取、AI图表绘制、出院小结起草等功能。
1.2. 解剖病理学中的人工智能
在解剖病理学领域,AI的最新进展主要集中在诊断解释性应用上,如肿瘤检测与特征描述、定量免疫组织化学(IHC)与生物标志物评分、全切片图像质量控制以及预后或治疗反应预测。少数解剖病理学AI产品已获得FDA授权,包括Paige前列腺癌诊断支持工具、Ibex Galen二次阅片、ArteraAI前列腺癌预后预测模型以及Genius宫颈AI算法等。然而,这些应用仅解决了病理实践的一个方面。该专业的大部分认知工作是以语言而非图像形式完成的,包括回顾临床病史、撰写诊断报告、协调辅助检测以及与团队沟通结果。这些语言密集型的文档任务,加上解剖病理学相对可预测的工作流,使其非常适合LLM的整合。目前已构思出多种病理学相关的LLM应用,例如从自由文本的组织病理学报告中结构化提取诊断信息、从叙述性癌症病理报告中自动生成结构化报告、为临床可用性总结复杂的纵向癌症病理报告、检测病理报告中的错误、提供病理学知识支持、生成病理报告、基于报告文本支持编码或分类工作流,以及评估病理学相关的图像和文本输入以进行问答。
1.3. 智能体工作流
上述语言密集型示例使用LLM来阅读、起草、总结、分类、校对和处理病理学文本。但除了处理文本,LLM能否代表我们采取行动?这种安排,即赋予LLM访问外部工具、数据和指令集以完成多步骤任务的能力,通常被称为“智能体”系统。在当前LLM文献中,“智能体”系统通常被描述为能够推理任务、与其他系统或工具交互,并朝着目标推进多个步骤的基于LLM的系统。放射学领域的综述将智能体系统视为从被动、用户触发的LLM输出,向能够与工具和数据源交互、协调工作流步骤并支持临床工作的系统的转变。病理学文献描述了广泛的生成式AI应用,包括报告生成、信息提取、质量控制、工作流支持和多模态系统,并探讨了将这些能力整合到智能体工作流中的方法。本文中,智能体工作流指一个或多个AI“智能体”使用LLM、外部工具、机构数据和预定义指令集,在人类监督下但几乎无需直接人工干预即可完成多步骤解剖病理学任务的工作流。
2. 技术入门
2.1. 基本LLM功能
在最简单的层面,LLM可以一次性使用,用户提供一个单一提示词,模型返回一个单一文本输出。“提示工程”指的是有意设计这些输入,以使模型获得更清晰的指令、更好的上下文、有用的示例和更明确的输出约束,从而提高模型输出的质量和实用性。聊天机器人通过一系列消息重复此交换模式,接收当前用户消息和先前的对话上下文,生成下一个回应,并等待用户的进一步输入。
2.2. 高级LLM相关设计模式
2.2.1. 检索增强生成(RAG)
通过检索增强生成(RAG),LLM在请求时被提供检索到的信息,而不是仅仅依赖其训练数据中固有的知识。在解剖病理学背景下,RAG系统可能检索先前的病理报告、相关临床病史、结构化报告规则或机构的反射检测政策,并将这些最新的本地信息提供给模型以指导其回应。关键在于,RAG允许追溯模型输出的来源,使得输出易于审查、验证和审计,这在医疗保健环境中尤为重要。RAG也适用于快速演变的知识体系,因为更新外部数据源比重新训练或微调底层模型更容易、更快、更便宜。
2.2.2. 工具使用
RAG赋予模型获取可追溯和及时信息的途径,而工具使用则赋予模型访问外部能力和采取行动的能力。在基本的工具使用工作流中,LLM使用外部软件(一个“工具”)执行特定功能,接收结果,然后在下一步生成中使用该结果。工具可以是查询数据库、搜索文档库、运行命令行实用程序或使用应用程序编程接口(API)与服务器交互以执行操作。无论使用何种协议,模型通常不会获得对外部系统的无限访问权限,而是被允许调用具有定义好的输入、输出、权限和日志记录的特定函数。这允许在保留边界、可审计性和运营控制的同时,为模型提供有用的能力。重要的是,工具使用既扩展了基于LLM的系统所能做的事情,也将AI安全和风险管理的重要方面从LLM的概率行为领域转移到了更熟悉的传统软件设计、访问控制、验证和运营治理的确定性领域。
2.2.3. 特定任务指令模块
工具使用模式的一个特点是,模型可能不包含如何使用工具或完成工作流的指令,这些指令必须按需定义并提供给模型。这些定义了特定任务相关工具、信息来源、提示、约束和行为规则的指令,通常被视为模块化的任务指令文档,有时称为“技能”。技能文档本质上是针对特定任务的聚焦操作手册或行为程序。使用时,当面临一个任务时,智能体系统会识别何时某项技能相关,将该技能文档添加到提示中,然后让模型在该更狭窄的框架内进行。这种方法提高了可靠性,因为模型可以在一个聚焦的、本地指定的框架内运作,而不是在一个无限的问题空间中即兴发挥。
2.2.4. 智能体循环
只有一小部分认知工作是简单线性到足以通过单次提示的LLM查询完成的,大部分工作需要随时间展开的多步骤迭代思维过程。智能体系统通过一个编排层将这些迭代过程绑定在一起,该层提供连续性:保存任务状态、选择下一步、调用相关的外部模块或工具,并在工作流继续之前合并结果。核心架构模式是“智能体循环”,系统观察并记住任务状态,要求模型推理和规划下一步,采取行动或检索额外上下文,合并结果,并重复直到任务完成或需要升级到人类判断。ReAct框架是此模式的著名例子,它交替进行中间推理步骤和行动,以便模型在新观察结果返回时更新其计划。其他设计模式强化了同一循环的不同部分,例如先将较大任务分解为较小步骤,或比较几个可能的下一步再选择其一,或增加一个审查步骤来决定是否继续、修订计划、停止或升级。
2.3. 总结
每种设计模式都有其独特的优势和劣势。RAG在系统需要当前或本地特定源信息时很有用,但增加了复杂性并引入了检索失败的风险。当系统必须查询数据或采取行动时,工具是必要的,但每个额外的工具和权限集都创造了新的出错或被滥用的机会。特定任务指令可以在不重新训练模型的情况下编码本地程序,但当政策或系统变更时需要修订。智能体循环结合了这些元素用于多步骤工作,但也允许错误级联并影响下游步骤。综合考虑,最好的系统设计通常是能够安全完成预期任务的最简单的可能安排。
2.3.1. 解剖病理学中的示例性技术智能体AI用例
2.3.2. 示例1:反射检测支持
在此示例中,机构有一项反射检测政策,即每个新诊断的结直肠癌病例应在最终确认前进行错配修复(MMR)IHC检测。本地专家与LLM聊天机器人迭代地为反射路径起草一份既人类可读又机器可读的规范。智能体为以此方式指定的每条路径生成一个工作流模板,并将该规则归档。在病例审查期间加载此技能文档,指示智能体将草拟的诊断文本与任何相关的反射规则进行比较。如果模型检测到结直肠癌的诊断,智能体会实例化并遵循来自相关工作流模板的病例状态记录。该记录定义了当前工作流状态和推进工作流所需的病例特定元数据。随着智能体遍历工作流的每一步,它使用相关的技能和工具进行历史查找、订单查找和染色订单放置,并在每次轮转时使用简单的脚本化工具更新病例状态记录。LLM在两个地方增加了价值:一是帮助将人类编写的规则集转换为结构化的机器可读格式;二是通过定期检查当前病例状态、识别报告中缺失的信息并根据本地指南呈现下一步推荐步骤,减轻了病理学家的认知负担。
2.3.3. 示例2:工作量平衡与病例路由
第二个示例中,解剖病理学实践希望以反映病例复杂性、亚专科专业知识、排班服务职责、截止日期并能应对意外中断的方式,将新收病例分配给病理学家。为此,科室定义一个工作量平衡技能,赋予智能体读取新收病例队列、病理学家工作时间表、亚专科分配、当前病例工作队列状态、服务分配规则以及监控通信渠道的工具。技能定义了哪些分配可以自动进行,哪些应升级供人类审查。智能体首先检索未分配的病例队列并应用本地定义的病例加权方案,然后检索病理学家日程和当前工作队列分配,排除不可用或无资质的病理学家,根据提供的规则计算提议的分布,并要么应用常规分配,要么生成消息请求人类批准。智能体系统比纯算法的病例分配系统更强大,因为它能维护工作量的实时表征,检索缺失的上下文或识别何时需要澄清,解释自然语言请求,并决定请求的更改是否符合批准的分配政策。
2.3.4. 示例3:实时决策支持
第三个示例是一个复杂的临床决策支持场景:在恶性肿瘤检查过程中订购特殊染色。在此工作流中,病理学家通过在报告环境中请求帮助来启动智能体。智能体审查当前的报告草案、标本类型、大体描述、临床病史、先前病理诊断以及任何已订购或已有结果的染色。然后,它从经批准的来源(如科室自身的诊断知识库、本地IHC和组织化学检测菜单以及通过RAG系统索引的选定外部参考文献)检索权威背景信息。智能体综合检索到的信息,提出一个推荐列表,该列表在实际可订购且针对当前诊断问题进行定制,每个推荐都附有指向知识库具体条目的链接。病理学家可以接受、拒绝推荐或与智能体讨论修改。一旦做出决定,智能体为所需染色下单,并在报告的适当部分起草一个记录结果的表格。此工作流不同于传统的临床决策支持路径,因为决策支持工具可以访问实时的病例上下文,推荐受本地运营现实约束,并且与智能体的交互是对话式和迭代式的。
3. 解剖病理学中的其他智能体AI用例
3.1. 诊断工作流优化
最直接的用例可能发生在诊断工作流内部,但严格排除做出诊断的行为之外。许多此类任务始于上下文收集:在签署报告前,智能体可以检索先前的病理报告、近期手术、相关影像印象、分子结果、细胞学材料和既往诊断。智能体工作流还可以协助后续行动,例如检测报告是否缺乏必需的反射检测、验证检测是否已订购或已有结果、应用本地反射检测政策并准备下一步推荐以供批准。另一个机会是沟通支持,例如识别可能需要沟通的病例、确定合适的临床医生、准备包含诊断信息的草稿消息,然后将其路由给病理学家编辑和批准后再发送给临床医生。
3.2. 质量与安全
质量与安全工作流是智能体AI辅助的良好候选者,因为它们需要对众多小细节保持警惕,或者构成虽然相对简单重复但耗时且需要判断力和理解力的任务。一个机会是在飞行中进行诊断报告的质量校对和审查,例如检查打字错误、内部不一致、缺少的结构化元素、侧别冲突以及诊断与其他报告元素之间的不一致。质量保证和患者安全的机会超越了单个报告,例如监控因辅助检测延迟而过期的报告或病例,并将其升级供人工干预。
3.3. 实践管理
将智能体系统用于行政任务是现有兴趣的自然延伸。日常实践管理充满了需要平凡但耗时的人力努力和情境理解的协调任务。智能体工作流可以帮助部门协调这些行政工作,尤其是在相关信息分散于多个渠道时。一个特别有趣的机遇出现在智能体LLM能力与诊断AI输出及运营元数据相结合时。例如,数字病理算法可能识别出可能含有恶性肿瘤的病例,智能体工作流可以使用这些诊断结果以及标本类型、截止日期、病理学家可用性和服务规则来确定病例优先级和分配,以平衡工作量并优化周转时间。
4. 讨论
4.1. 实际考量
4.1.1. 集成策略
LIS集成环境历来充满挑战,存在围绕数据兼容性、安全性、标准演进、验证和实施后修改的持久障碍。一种近期的实施模式可能是由LIS供应商在其专有系统中嵌入智能体功能,优点是智能体可以靠近原生软件工作流状态运行,缺点是供应商控制的智能体可能狭隘、不透明且难以适应本地需求。第二种模式是可互操作的、以API为先的方法,LIS供应商公开有良好文档记录的、安全的接口,允许客户构建自己的智能体。对于解剖病理学而言,基于标准的API优先模式很有吸引力,因为最有用的工作流往往是本地的。尽管有其优势,但基于行业标准的API优先方法并非没有重大挑战,例如FHIR提供了标准化框架,但其在不同医疗系统中的实施并不均衡。
4.1.2. 系统生命周期
先前的研究强调,病理学中安全采用LLM需要组织层面的准备,包括治理、验证、隐私和安全控制、教育以及与现有LIS和EHR基础设施的集成。智能体工作流加剧了这些要求,因为它们可能将LLM推理与现实世界行动联系起来。组织对智能体AI部署的准备应被视为一个持续的、迭代的程序,而不是一次性的技术项目。NIST AI风险管理框架围绕四个相互关联的功能组织了这一过程:治理、映射、测量和管理。对于实验室应用,治理和映射功能可能包括召集正式治理机构,为智能体AI系统的选择、本地配置、访问审批和控制、验证计划、用户培训、监控、事件响应、变更后的重新验证等任务分配明确的问责制。在美国,临床系统中AI的监管是一个复杂且快速演变的主题。一般来说,验证应从测试各个组件的性能开始,包括信息检索性能、文本提取和分类准确性、工具选择、对特定任务指令的遵守情况以及工作流状态表示的准确性。智能体层本身的验证也应进行,包括规划、工具使用、授权边界、多步骤执行、记忆、升级以及失败和恢复率。验证后,一段时间的静默模式前瞻性评估有助于评估配置好的系统在真实工作流条件下的表现。
4.1.3. 安全与安保
智能体系统引入了可能与实验室使用的标准软件工具不同的安全和安保风险。智能体系统可以通过两种方式引入漏洞:一是它们需要网络连接才能运行,这增加了攻击面;二是它们可以调用工具,这创建了新的攻击向量。保护智能体系统的策略包括对所有API通信使用强加密、实施强大的身份验证和授权控制、对所有工具调用和模型输出进行审计日志记录、建立速率限制和异常检测以防止滥用,以及对模型输入和输出进行清理以防止注入攻击。
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号