综述:医疗领域的提示工程:方法论与应用

《Meta-Radiology》:Prompt Engineering for Healthcare: Methodologies and Applications

【字体: 时间:2025年11月27日 来源:Meta-Radiology 13.3

编辑推荐:

  提示工程是自然语言处理(NLP)领域中的一项关键技术,涉及设计和优化用于向模型输入信息的提示,旨在提升模型在特定任务上的性能。随着大语言模型(LLM)的最新进展,提示工程在多个领域展现出显著优势,并在医疗领域变得日益重要。然而,目前缺乏专门针对医疗领域提示工程

  
提示工程是自然语言处理(NLP)领域中的一项关键技术,涉及设计和优化用于向模型输入信息的提示,旨在提升模型在特定任务上的性能。随着大语言模型(LLM)的最新进展,提示工程在多个领域展现出显著优势,并在医疗领域变得日益重要。然而,目前缺乏专门针对医疗领域提示工程的全面综述。本综述将介绍自然语言处理领域中提示工程在医疗领域的最新进展。首先,研究人员将介绍提示工程的发展,并强调其在医疗自然语言处理应用(如问答系统、文本摘要和机器翻译)中的重要贡献。随着通用大语言模型的持续改进,提示工程在医疗领域的重要性日益凸显。本文旨在为医疗自然语言处理研究人员提供有用的资源和桥梁,以更好地探索提示工程在该领域的应用。研究人员希望本综述能为医疗自然语言处理的研究和应用提供新思路和启发。
**1. 引言**

提示工程已成为自然语言处理(NLP)领域的前沿方法,为使用大语言模型(LLM)提供了一种更高效、更具成本效益的方式。这一创新范式植根于大语言模型的发展,后者彻底改变了我们对自然语言的理解。语言模型的历史可追溯到20世纪50年代,但直到2018年BERT和GPT模型的引入,大语言模型才成为主流。这些模型利用复杂算法和海量训练数据,以以前无法想象的方式理解自然语言。它们学习语言模式和结构的能力在广泛的语言相关任务中证明了其价值。然而,微调这些预训练模型可能是一个昂贵且耗时的过程,需要大量标注数据和计算资源。为应对这一挑战,研究人员转向使用提示作为指导模型学习的手段。提示学习是NLP中的一个新范式,使语言模型能够进行少样本甚至零样本学习,用最少的标注数据适应新场景。提示学习的关键是为下游任务设计提示,以指导预训练模型执行所需任务。

提示学习可分解为五个关键步骤:首先,研究人员必须选择合适的预训练模型。其次,他们必须为下游任务设计提示,这可根据每个任务的具体要求进行定制,这一步称为提示工程过程。第三步涉及根据手头任务设计响应,使模型产生所需输出。第四步是扩展范式以进一步改进结果或适应性方法。最后,研究人员必须设计训练策略,使模型能够高效、有效地学习。

因此,提示工程是基于提示方法的关键步骤,涉及设计有效提示以指导预训练语言模型完成下游任务。研究表明,提示的设计会显著影响模型在下游任务上的性能。一个精心设计的提示应为模型提供清晰指导,并促进有效完成任务。此外,优化提示参数也是提示工程的重要方面,可提升模型性能。基于提示方法的后续步骤,如设计答案、扩展范式和调整训练策略,都需要特定任务的提示设计和优化。

总体而言,提示工程是NLP中一种有前景的新方法,有可能彻底改变该领域。其专注于使用提示指导模型学习,为训练大语言模型提供了一种更具成本效益和效率的方式,使其在未来几年成为越来越重要的研究领域。

**1.1. 综述的范围与重点**

自然语言处理越来越多地应用于医疗保健领域,因为医疗数据规模巨大。基于大语言模型(LLM)的提示方法在解决特定领域挑战方面显示出特别的前景。如图1所示,词云展示了医疗领域NLP的研究热点和焦点,突出了本综述在该领域的重要主题。通过大语言模型强大的上下文学习能力,可以从大量医疗文献和病例中有效获取有用信息。通过设计特定提示,可以将领域特定知识和任务特定信息引入预训练模型,从而获得更好的性能并得到更广泛的关注。

在提示工程研究中,设计合适的提示是一个重要问题。目前,研究人员正在探索各种类型的提示,包括手动提示和自动提示,以及各种提示构建方法,以帮助解决医疗领域的任务。

**1.2. 文献检索过程**

为系统考察医疗领域的提示工程,研究人员对2019年至今的文献进行了全面综述,通过搜索关键词“prompt”和“medical NLP”,共识别出333篇与提示相关的论文,并使用ChatGPT筛选摘要与医疗领域的相关性,最终选出140篇相关论文进行进一步综述。这些论文主要关注医疗领域NLP任务中提示工程的设计和应用,旨在为不同医疗任务提供合适的提示设计方法。具体而言,这些研究探讨了如何选择和设计提示元素,如何使用提示指导模型生成符合医疗要求的文本,以及如何评估不同提示设计对模型性能的影响。

**1.3. 综述大纲**

本综述文章深入概述了提示工程这一快速发展的研究领域,其重点是通过开发有效提示来增强医疗应用。如图2所示,研究人员展示了本综述文章的概览,各部分组织如下:引言部分讨论了提示工程的背景和意义,并概述了综述的范围和重点。描述了所遵循的文献检索过程,并提供了文章大纲。第二部分介绍了提示工程的基础知识,包括常见的大语言模型(LLM)以及提示的要素和组成部分。第三部分讨论了文献中可用的不同类型提示。第四部分详细介绍了提示在医疗领域的各种应用。第五部分概述了提示工程在医疗应用中的挑战和未来方向。最后,第六部分总结了文章的主要发现和贡献。

**2. 基础知识**

在提示工程中,大语言模型(LLM)非常重要,因为它们的能力为特定任务设计合适的提示提供了依据,即使训练数据有限也能生成高质量结果。本节将深入探讨大语言模型的最新进展,并提供提示设计的框架。

**2.1. 大语言模型**

在本节中,研究人员探讨了医疗领域提示工程中常用的大语言模型(LLM),这些模型在海量文本数据上训练,能够生成高质量、上下文相关且连贯的文本,用于各种NLP任务。

BERT(Bidirectional Encoder Representations from Transformers)是谷歌团队于2018年开发的预训练模型,利用Transformer架构具有双向编码器表示。其目的是通过联合调整所有层中的上下文来预训练双向表示,并通过掩码语言模型克服先前单向语言模型的局限性。此外,BERT引入了下一句预测任务,可结合掩码语言模型用于预训练文本对表示。BERT的训练目标非常有意义,因为它证明了双向预训练对语言表示的重要性。与之前的单向语言模型相比,BERT的预训练能更好地捕捉上下文中的语义信息。BERT是第一个基于微调的表示模型,在11个NLP任务中超越了众多特定任务架构,刷新了性能记录。这一成就证明了预训练模型在NLP任务中的巨大潜力,并为后续NLP模型的发展提供了重要参考。

文本到文本转换Transformer(T5)是谷歌于2019年开发的大语言模型(LLM)。T5的基本思想是将每个NLP任务视为“文本到文本”问题。T5的训练目标是将其开发成一个通用知识表示模型,使模型能够更好地理解和处理文本。T5在多个NLP任务中取得了最先进的结果,如文本分类、机器翻译、文本摘要和问答等。在这些任务中,文本作为输入,生成新文本作为输出以解决特定问题。这种方法的好处是,通过将所有NLP任务视为“文本到文本”问题,T5模型可以学习如何将输入文本映射到输出文本,从而增强对文本的理解和处理能力。

ChatGPT是OpenAI团队开发的一系列生成式预训练Transformer模型。GPT-1于2018年6月发布,在大规模文本语料库上训练,旨在生成连贯且自然的文本。随后,GPT-2于2019年2月发布,在GPT-1的基础上使用了更大的模型规模和更多训练数据,在多种NLP任务上取得了出色性能。2020年6月,GPT-3问世,使用了比GPT-2更大的模型规模和更广泛的训练数据,模型性能进一步提升。GPT-3.5随后进一步优化了GPT-3的效率和性能。为提升模型性能,OpenAI团队使用监督学习和强化学习对GPT-3.5进行微调,其中人工干预在增强机器学习能力方面发挥了关键作用。训练方法的优化和训练数据的增加使得GPT-4能够生成与人类类似的文本,代表了人工智能领域的重大突破。未来,大语言模型将继续发展和改进,其在医疗领域的应用将为人类健康带来更多价值和贡献。

**2.2. 提示的要素与格式**

提示通常分为两种形式:完形填空提示和前缀提示。完形填空提示指的是模板文本中间需要填充的槽位。例如,在情感分析中,当X = “I love this movie”时,模板可能采用“[X]. Overall, it was a [Z] movie.”的形式。然后,新句子X’变为“I love this movie. Overall it was a [Z] movie.”。这是一个完形填空提示的例子。另一方面,前缀提示指的是输入文本完全位于生成的答案文本Z之前。例如,“English: [X] Chinese:[Z]”。提示工程指的是创建提示函数的过程,该函数指导模型在下游任务中有效执行。这个过程通常包括两个步骤。首先,应用一个模板,它是一个包含两个槽位的文本字符串:输入槽位[X]用于输入文本x,答案槽位[Z]用于中间生成的答案文本z,该文本之后将被映射到最终输出y。然后,将输入文本x填入输入槽位[X]。需要注意的是,在提示工程中,提示不仅可以是自然语言形式,还可以是生成的连续向量嵌入。这部分将在第三节详细讨论。通过利用提示工程技术,可以显著提升模型性能和效率,为下游任务提供更好的支持和帮助。

**3. 提示的类型**

在科学研究领域,提示在指导大模型产生准确输出方面起着至关重要的作用。如图4所示,提示大致分为两类:手动提示和自动提示。

**3.1. 手动提示**

手动提示可用于指导模型为特定任务产生所需结果。这些提示通常基于人类专业知识创建,并常用于大语言模型(LLM)以提高其在下游任务上的性能。本节将介绍两种常见的手动提示:零样本提示和少样本提示。

**3.1.1. 零样本提示**

ChatGPT等大语言模型(LLM)的发展使得基于提示的方法在各种下游任务中越来越受欢迎。特别是零样本提示,显示出巨大前景,仅提供精心设计的提示而不提供相应示例,即可获得出色结果。一些研究表明,利用GPT的强大性能可以帮助完成提取和识别等下游任务,甚至在某些数据集上超越一些全样本模型。在医疗领域,利用大语言模型强大上下文能力也取得了令人瞩目的成就。例如,DeID-GPT提出使用高质量提示在ChatGPT和GPT-4上保护隐私并总结医疗数据中的关键信息,相比几种基线方法取得了更好的结果。该研究为未来将医疗数据应用于大语言模型的研究奠定了基础。ChatAug提出了一种基于ChatGPT的提示式医疗数据增强方法,优于其他流行方法。该研究强调了领域知识在生成正确增强数据中的重要性,并为未来研究提出了一种微调方法。最近的研究调查了使用手动提示在ChatGPT上指导下游任务的可行性,并表明清晰准确的提示可以显著提升ChatGPT在翻译任务上的性能。同样,关于ChatGPT零样本提示的研究也得出了类似结论。该研究提出了HealthPrompt,一个基于提示的临床NLP框架,探索了不同类型的提示模板,包括前缀提示和完形填空提示,以提高临床文本分类任务的零样本学习性能,无需额外训练数据。这些发现凸显了ChatGPT通过有效提示设计增强模型在NLP任务上性能的潜力,为该领域未来研究提供了宝贵见解。

**3.1.2. 少样本提示**

尽管零样本提示在许多任务中表现令人印象深刻,但仍有一些局限性。首先,它严重依赖预训练模型的性能。其次,由于零样本提示的灵活性,其输出可能并不总是准确的。在这种情况下,提供少量提示示例作为模型指导以获得更好性能已成为一种有用方法。少样本提示可以作为清晰明确的提示输入,引导模型产生所需输出。例如,有研究仅使用少量提示样本测量了GPT-4在医学选择题上的基线性能,无需复杂方法(如思维链)。这些提示方法依赖于大语言模型(LLM)的上下文涌现能力,已在ChatGPT/GPT-4上展示了令人印象深刻的性能。基于手动提示的方法在医学文本翻译、文本增强、生成、摘要等任务中显示出典型的少样本提示能力,在公共数据集上相比基线模型有显著提升。

**3.2. 自动提示**

人工设计提示的有效性取决于提示设计者在选择相关信息以及以模型可理解的方式构建提示方面的专业知识。对于输入数据定义明确且输出结构化要求清晰的任务,人工提示尤为有效。然而,设计有效的人工提示需要大量时间和领域知识,这使得它们在更复杂任务中的应用充满挑战。因此,研究人员正在探索自动提示设计方法,以应对这些挑战并提高基于提示方法的效率和适应性。

**3.2.1. 离散提示**

离散提示指在离散空间中自动搜索模板,通常对应自然语言短语,为模型提供生成所需输出的指导。这种方法有助于更轻松地设计提示,并提高模型效率和适应性。常见的离散提示构建方法包括提示挖掘、提示改写、提示生成和提示评分。

提示挖掘是一种通过抓取大量文本语料库,寻找输入-输出对之间的频繁中间词或依赖路径来自动发现模板或提示的方法。这些提示可用于各种自然语言处理任务,如语言建模、文本分类和问答。一项研究提出了一种基于提示学习的方法,自动识别提示短语并将其添加到模板中,用于阿尔茨海默病的细粒度检测。该方法通过使用额外提示提高了检测准确性。

提示改写涉及使用回译或短语替换等方法从现有种子提示生成一组候选提示,并选择在目标任务上达到最高训练准确率的提示。该方法可通过神经提示重写器进行优化,并可针对单个输入进行。例如,一篇论文提出了一种基于改写的简单而有效的提示方法,帮助预训练模型学习罕见的生物医学术语,从而在生物医学应用中提高性能。STREAM框架利用基于提示的语言模型为命名实体标注生成任务特定的逻辑规则,减少了人工需求。通过利用现有提示模板并持续教授语言模型,STREAM在标注过程中实现了更高的准确性和效率。

提示生成是使用自然语言生成模型生成提示的任务。该研究提出了MEDIMP,一个利用大语言模型(LLM)自动文本数据增强生成医疗提示的框架,并展示了其在为医疗应用生成高质量提示方面的优越性。一篇论文提出了一种方法,利用包含边界框标注的提示生成描述,其中包含用于实例识别和定位的大量提示和上下文。然后通过最大化图像和对象级别的跨模态互信息,将语言知识蒸馏到检测模型中。这种方法涉及从现有数据训练提示,并利用这些提示生成新数据。然后,新生成的数据可用于定义额外提示,最终为下游任务提供更高质量的特征表示。该研究引入了一个提示构建模块,利用医学语言模板使预训练语言模型能够从表格化电子健康记录中提取上下文信息,并生成更全面的细胞嵌入,由预训练句子编码器生成句子嵌入作为细胞表示。

提示评分涉及使用语言模型为给定任务对填充后的提示进行评分,并选择概率最高的提示。这可以产生针对每个单独输入的自定义模板,例如基于知识补全的情况。例如,ImpressionGPT提出了动态提示,为每个输入选择相似度最高的前k个示例。基于k个选中示例的概率和阈值,确定每个输入的提示。这种利用少样本学习的方法显示出比某些全样本学习方法更好的性能。

各种提示类型的使用可以极大地帮助语言模型在广泛任务上执行,如自然语言理解、文本生成、机器翻译和问答。无论是通过提示挖掘、提示改写、提示生成还是提示评分生成的提示类型,都可以独立使用或组合使用,以优化语言模型在特定任务上的性能。这强调了基于提示方法在推进NLP系统能力方面的重要性。

**3.2.2. 连续提示**

近年来,大语言模型(LLM)的发展使得基于提示的方法在各种下游任务中越来越受欢迎。在此背景下,连续提示(例如软提示)作为一种新型提示出现,并引起了研究人员的广泛关注。与离散提示不同,连续提示可以在嵌入空间中操作,不再局限于文本可读类型。此外,连续提示可以通过在下游任务训练数据上调优来优化参数,从而放宽了对提示的约束,提高了大语言模型在任务执行中的效率。同时,在数据高度不平衡的情况下,连续提示已被证明是标准模型微调的有效替代方案。离散提示由离散的词或短语组成,通常是人类可解释的自然语言,用于指导模型执行下游任务。而连续提示直接在嵌入空间中提示模型,不受自然语言约束,并允许提示拥有自己的参数,可利用训练数据进行微调。

在医疗领域,连续提示的优势得到了进一步证明。Liang等人使用连续提示将提示作为唯一可训练参数引入模型架构以指导模型输出,提出了PromptFuse和BlindPrompt作为以模块化和参数高效方式对齐不同模态的方法。这些方法仅需少量可训练参数,在低资源场景下与多种多模态融合方法性能相当。提示的高模块化特性允许以低成本灵活添加模态,因为避免了微调大型预训练模型。PrefixMol是一个生成模型,利用可学习的提示令牌作为前缀嵌入来指导模型生成满足所需标准的输出。该提示令牌编码了一组可学习特征以及关于目标口袋环境和各种属性的上下文信息。与传统生成模型相比,这种方法具有显著优势,因为它允许对输出进行更精确和高效的控制。Wang等人提出了一种用于胶质瘤分级的自适应PromptNet,仅利用非增强MRI数据,并通过设计的提示损失在训练期间接收来自增强MR数据特征的约束。在论文中,增强特征被用作提示来指导PromptNet的特征提取,设计了自适应策略以基于样本方式动态加权提示损失,从而在NE-MRI数据上实现了具有竞争力的胶质瘤分级性能。CPP利用对比原型损失优化特定任务提示,以避免语义漂移和原型干扰,使用提示作为可学习令牌为每个任务训练特定任务信息。它还引入了多质心原型策略以提高原型代表性。CPP在轻量级内存预算下优于现有方法,并改善了类别分离。

总体而言,连续提示是提高自动化系统性能的强大工具。它帮助这些系统更快地学习和适应,并在广泛的应用中更准确地执行。该技术可与其他类型的提示(如手动提示和离散提示)结合使用,以创建更全面、更有效的学习环境,也用于图像和语音识别等多模态任务,以提高系统的准确性和速度。此外,连续提示可根据任务的具体需求进行定制,使其具有高度适应性和通用性。

**3.3. 手动提示与自动提示的比较**

手动提示是指由人类手工制作的提示,而自动提示是由算法或自动化方法生成的。手动提示与自动提示的主要区别在于人类参与提示构建过程的程度。手动提示由人类专家精心设计,而自动提示则使用各种搜索算法或其他自动化方法生成。手动提示的优势在于它们通常设计良好,能够捕捉下游任务的重要方面。然而,手动提示设计过程可能耗时且成本高昂。另一方面,自动提示生成更快,并且可能比手动设计的提示捕捉到更多任务特定信息。然而,自动提示的有效性在很大程度上取决于搜索算法的质量和语言模型的表示能力。

总之,手动提示和自动提示各有优缺点。手动提示提供了对输出的更大控制,而自动提示更高效、更具适应性。最终,提示的选择将取决于具体任务和可用资源。

**4. 提示的应用**

提示工程使语言模型能够以高性能实现医疗领域的广泛AI任务。通过定制的医疗提示,模型可以完成以前在没有大量医疗数据集和资源的情况下难以解决的复杂医疗问题。在医疗领域,提示工程的应用包括:分类、生成、检测、增强、问答、推理。

**4.1. 分类任务**

提示工程技术在标注数据稀缺的医疗分类任务中显示出巨大潜力。一些研究将基于提示的学习与预训练语言模型应用于临床和心理健康分类。

**4.1.1. 医学图像分析**

GPT4MIA利用生成式预训练Transformer(GPT)作为医学图像分析(MIA)分类任务的即插即用推理模型。作者从理论上证明了使用GPT-3(一个大型预训练语言模型)进行MIA的合理性。他们开发了提示工程技术,如改进的提示结构设计、样本选择和提示排序,以增强GPT4MIA在检测预测错误和提高图像分类准确性方面的效率和有效性。GPT4MIA与成熟的视觉模型合作,在这些任务上表现出色。

**4.1.2. 临床文本分类**

HealthPrompt提出了一个新颖的基于提示的临床NLP框架,该框架将提示工程应用于预训练语言模型,以在没有训练数据的情况下对临床文本进行分类。深度学习模型需要大量标注数据集,但临床NLP缺乏这些数据。HealthPrompt通过使用基于提示的学习来调整预训练语言模型以适应新任务,通过定义提示模板而非微调模型。使用六种预训练语言模型在无数据设置下对HealthPrompt进行的分析表明,提示能有效捕捉临床文本中的上下文,并在没有训练数据的情况下取得良好性能。

**4.1.3. 心理健康分类**

ChatGPT,一个基于大语言模型(LLM)的模型,在三个心理健康任务(压力检测、抑郁检测和自杀倾向检测)中对社交媒体帖子进行分类时,展示了强大的零样本性能。大语言模型在NLP心理健康应用中显示出潜力,但需要数据,ChatGPT通过基于提示的学习解决了这一问题。ChatGPT优于基线模型,表明语言模型在心理健康分类方面的潜力,尤其是在数据有限的情况下。

**4.2. 生成任务**

**4.2.1. 医学图像生成**

Chambon等人展示了选择性微调和有意义的评估如何使Stable Diffusion生成模型能够从临床提示生成医学图像。通过针对医疗领域定制Stable Diffusion,聚焦微调并使用临床定制指标评估性能,作者将领域知识转化为模型在数据稀缺情况下进行敏感生成的能力。他们的方法和结果凸显了提示工程通过将专业知识赋予模型以进行细微生成来解决现实世界挑战的前景。然而,充分发挥这一潜力需要模型适应和领域特定评估技术的持续进步。

**4.2.2. 医学文本生成**

NapSS提出了一种“先总结后简化”策略,以连贯方式简化医学文本。NapSS生成摘要和叙事提示,分别训练模型提取关键内容并指导生成器在保持文本流畅性的同时澄清内容。在医学文本上的评估显示,NapSS在词汇、语义和人类指标上优于基线。这凸显了多阶段提示工程如何实现需要复杂评估的细微领域相关生成。

**4.2.3. 医学报告翻译**

Lyu等人考察了大语言模型ChatGPT在将放射学报告翻译成通俗语言以用于教育方面的性能。经放射科医生评估,ChatGPT显示出潜力,但通过更好的提示,其不一致性有所改善。ChatGPT基于报告生成一般性和特定性建议。与较新的模型GPT-4相比,ChatGPT的性能显著逊色,表明大语言模型在临床使用中的潜力,但需要先进模型和提示才能达到优化性能。

**4.3. 检测任务**

**4.3.1. 医学图像检测**

Qin等人展示了提示工程如何使预训练于自然图像上的视觉-语言模型(VLM)将知识迁移到医学图像。包含专家医学知识的手动提示提高了VLM在无医学训练数据情况下的医学检测任务性能。自动提示注入图像细节,进一步提升了性能。所提出的方法在13个医学数据集上优于默认提示。微调后的模型超越了监督基线,表明VLM可以通过从自然图像迁移知识,从有限的医学数据中学习。这项工作确立了提示工程作为将VLM应用于医学的关键,并为开发专门用于医疗保健的VLM铺平了道路。

**4.3.2. 医学文本检测**

DeID-GPT是第一个使用GPT-4最先进的NLP能力对医学数据进行去标识化的框架,在去除私有信息的同时保持了原始含义,实现了最高准确率。由于GPT-4的规模和上下文学习能力,它对不同数据类型无需更改。DeID-GPT使用提示以最少的人工输入生成最佳去标识化结果,展示了ChatGPT和GPT-4在自动化医学文本处理方面的潜力。它为这一重要问题贡献了一种新颖且高效的方法——在保护患者隐私的同时使用医学文本数据。DeID-GPT确立了GPT-4及类似大语言模型通过提示工程和自然语言理解克服医疗保健重大挑战的手段。

**4.4. 增强任务**

**4.4.1. 文本数据增强**

Dai等人提出了一种新的文本数据增强方法,称为ChatAug。ChatAug使用ChatGPT语言模型将训练数据中的句子改写为多个概念相似但语义不同的样本,从而扩大样本语料库。他们将ChatAug应用于医疗领域的少样本学习文本分类,并显示在测试准确性和生成样本分布方面均优于最先进的数据增强方法。

**4.4.2. 将临床数据转换为提示**

Milecki等人提出了一种新的多模态学习模型,称为MEDIMP(Medical Images and Prompts)。MEDIMP将临床生物医学数据转换为文本提示,作为大语言模型(LLM)的输入以产生增强数据。然后使用对比学习和图像-文本对来学习医学图像(即肾移植DCE MRI图像)的有意义表示。MEDIMP使用预定义句子模板和ChatGPT生成提示,旨在学习用于移植后2-4年患者预后状态的有用表示。

**4.5. 问答任务**

**4.5.1. 基于文本的医学问答**

Singhal等人提出了医学问答数据集MultiMedQA和HealthSearchQA,并提出了一个评估临床大语言模型(LLM)的框架,涵盖事实性、精确性、危害和偏见等维度。为了将PaLM和FlanPaLM等大语言模型适配到医疗领域,作者应用了提示工程技术,如指令提示调优,这是一种参数高效的提示方法,使用少量示例将大语言模型对齐到专业领域。由此产生的模型Med-PaLM显示出令人鼓舞的改进,但仍落后于临床医生。这项工作强调了医学问答数据集和以人为本的评估在创建有益临床语言模型中的重要性。通过系统评估调优后的语言模型,作者揭示了在理解医学知识和推理方面存在的差距,这些差距必须解决才能开发用于医疗保健的模型。

**4.5.2. 基于图像的医学问答**

开放式医学视觉问答工作将任务视为生成过程。Sonsbeek等人开发了一个网络,将视觉特征映射到令牌,这些令牌与问题一起直接提示预训练语言模型(PLM)。探索PLM微调策略,他们的方法生成了开放式响应,在Slake、OVQA和PathVQA等医学问答基准上优于其他方法。这使得PLM能够理解医学图像,用于开放式医学视觉问答任务,其中答案不限于预定义集合。该工作指出了使用基于提示的生成模型进行开放式医学视觉问答的有前景方向。

**4.5.3. 基于视频的医学问答**

视觉提示文本跨度定位(VPTSL)提出了一种新颖的方法来处理视频中的时间答案定位任务,通过将其表述为预测与视觉答案匹配的时间戳字幕的跨度。为弥合文本问题与视觉答案之间的语义差距,VPTSL引入了视觉提示——使用问题从视频-文本高亮获得的特征。这些视觉提示与字幕和问题一起输入预训练语言模型(PLM)。然后,文本跨度预测器对这些视觉和文本提示进行建模,以预测字幕跨度。VPTSL在MedVidQA上以大幅优势(mIOU提升28.36%)超越了最先进水平,显示了视觉提示和文本跨度预测器在医学视频问答中的有效性。这项工作通过用上下文视觉信息提示PLM,使其能够将时间答案定位在教学视频中。

**4.6. 推理任务**

**4.6.1. 放射学中的自然语言推理**

Wu等人评估了ChatGPT和GPT-4在放射学自然语言推理任务上的表现。他们在模型中实现了零样本和少样本提示。零样本提示仅提供任务指令和句子-问题对,要求模型在没有标注示例的情况下确定蕴含关系。少样本提示在评估对之前加入了10个标注的句子-问题示例以提供上下文学习。通过设计具有不同上下文信息水平的提示,作者表明ChatGPT和GPT-4可以在不需要大量训练数据的情况下,在放射学任务上达到超过50%的准确率。GPT-4优于ChatGPT,表明其更强的能力。结果证明了构建能在不同领域表现良好的通用模型的可行性。

**4.6.2. 关于医疗变量的因果推理**

Long等人考察了GPT-3是否能够根据医疗上下文准确预测变量之间因果图中边的存在与否。他们使用不同的提示(例如陈述式与疑问式)和连接动词(例如“causes”与“correlates with”)评估了GPT-3。他们发现GPT-3的性能因这些因素而异,表明其对用户输入的敏感性。通过使用“causes”精心设计的提示,GPT-3在测试的图上达到了超过50%的准确率。此外,作者从医学文献中选择了三个不同复杂度的因果图。对于每个图,他们从图中生成2000个随机排列的句子对。GPT-3预测每对之间是否存在因果边。其在最简单的图上准确率最高(70%-85%)。尽管在复杂图上性能下降,但仍远高于50%的随机基线,证明了GPT-3在推理医疗变量方面的潜力。

**4.7. 提示工程在分类、生成、检测、增强、问答和推理中的总结**

这些研究凸显了使用提示工程对预训练语言模型以推进临床NLP和一系列医学AI应用的潜力,尤其是在标注数据稀缺的情况下。基于提示的学习通过定义任务模板而非微调来调整模型以适应新任务,帮助模型在零样本学习场景中实现强性能,无需示例即可泛化到新类别。大型预训练语言模型结合有效提示设计,为跨医疗领域和任务的提示工程提供了理想的初始化。

尽管仍需更多工作,但这些论文证明了提示工程和大语言模型(LLM)在有限数据医学AI中的前景。基于提示的学习可能有助于解决标注数据缺乏的问题,并通过定制提示释放模型能力,推动分类、生成、检测、增强、问答和推理等应用。强零样本性能表明,提示工程相比传统监督学习可能减少医学AI的数据需求。

**5. 挑战与未来方向**

本章讨论了基于提示方法面临的挑战、当前研究方向以及未来的机遇和发展方向。

首先,阐述了提示工程中的挑战,包括医疗NLP领域的数据稀缺、模型可解释性以及提示工程固有的问题。

其次,介绍了当前研究方向,包括提示生成、提示优化、多模态数据处理和深度强化学习。这些研究方向旨在提高基于提示方法的有效性和适用性,进一步推动NLP领域的发展。

最后,探讨了基于提示方法的机遇和未来发展方向,例如多任务和多模态处理的发展,以及创新提示设计和智能提示生成的扩展。这些机遇和发展方向为基于提示方法的未来发展提供了广阔空间和前景。

**5.1. 提示工程中的挑战**

在医疗领域的NLP任务中,提示工程面临若干挑战。首先,医疗数据通常有限且专业,难以覆盖所有领域知识,从而限制了模型的泛化能力。其次,医疗领域术语和领域知识丰富但通常复杂,需要将这些知识有效整合到提示中。此外,不同的医疗任务需要不同的提示设计,这需要在提示的复杂性和可解释性之间取得平衡,同时利用现有医疗领域知识指导模型生成高质量预测。最后,提示设计还需要考虑如何避免引入任何人类偏见或错误信息,以确保模型的公平性和准确性。

需要注意的是,医疗领域的NLP任务极具挑战性,因为它们涉及大量领域知识和专业术语,通用NLP模型可能不容易理解或处理。因此,提示工程在医疗领域的重要性不言而喻。这些挑战包括但不限于:

数据稀缺:在医疗领域,许多任务需要使用特定的医疗数据,这些数据通常非常稀缺且难以获取。此外,医疗数据的特殊性涉及伦理问题,这对提示工程构成了巨大挑战。缺乏足够数据使得设计准确有效的提示变得困难。

数据不确定性:医疗领域涉及众多领域知识和术语,在不同文本中可能具有不同的解释和用法,导致提示设计的不确定性增加。

模型可解释性:在医疗领域,模型可解释性尤为重要。由于涉及人类健康和生命,模型的预测结果需要得到合理解释和论证。因此,在医疗领域,提示设计不仅要考虑模型的准确性,还要考虑其可解释性。

此外,医疗领域的提示工程还面临其他领域的常见挑战,如提示工程的自一致性、提示泄露和对抗性问题等。这些挑战在医疗任务中比在其他领域更为严重。未来研究需要充分考虑这些挑战并提出相应解决方案。

总之,提示工程在医疗领域对NLP任务的成功至关重要,但也面临各种挑战,如数据稀缺和不确定性、模型可解释性、自一致性和对抗性问题。应对这些挑战需要创新解决方案和对医疗领域知识及其相关术语的全面理解。

**5.2. 当前研究方向**

随着通用人工智能(AGI)模型的发展和应用的推进,医疗领域的研究人员也开始将其应用于各种医疗任务。目前,医疗领域提示工程的研究方向非常多样化,涵盖不同类型提示的设计、多模态数据处理和深度强化学习等方面。

在提示设计方法方面,需要考虑任务和数据的特定特征以做出适当选择。这些包括简单的手工设计模板式提示、基于知识图谱的提示、基于自然语言生成的提示,以及可以作为可训练参数嵌入模型自动生成的提示。在多模态数据处理中,整合文本和图像数据需要设计合适的提示来指导模型处理和分析不同类型的数据,从而提高模型的性能和可解释性。此外,深度强化学习可以通过自主学习不断优化提示设计,进一步提高模型性能。

总之,目前医疗领域提示工程的研究方向多样,研究人员可以根据任务和数据特征要求选择合适的方法和技术,以提高模型的性能和可解释性。

**5.3. 机遇与未来方向**

在医学领域,提示工程呈现出广泛的应用机遇和未来方向。ChatGPT和GPT-4等大语言模型(LLM)的发展为医疗领域的提示工程提供了巨大潜力。作为基于提示技术的重要组成部分,提示工程可以帮助大模型更准确地理解和处理医疗数据。除了技术优化,解决伦理、隐私和部署挑战对于确保大语言模型在医疗保健中的安全负责采用至关重要。

敏感医疗数据的使用带来了与隐私和安全相关的重大风险。患者数据意外泄露、模型对代表性不足人群的偏见以及不透明的决策等问题仍然紧迫,这意味着增强提示的鲁棒性和泛化能力至关重要。当前的应用,如临床文本分类和去标识化,揭示了提示措辞的微小变化可能导致性能大幅波动。未来研究应探索鲁棒提示模板和元提示框架,这些框架能够适应不同任务和机构,提高实际部署中的一致性。

一个更深层的挑战在于伦理方面。如果训练数据在不同人群中表现出不平衡,或者某些群体的隐私特征在数据中过度暴露,模型可能对特定群体发展出有偏见的推理模式。这可能导致辅助诊断、治疗建议或资源分配中的不公平倾向——这不仅是技术问题,更是严重的伦理问题。为应对这些挑战,可以采用解释增强提示来提高模型公平性。这些提示不仅要求模型提供结果,还要求其阐述推理过程和依据,从而使潜在偏见在决策链中可见。同样,在提示设计中融入明确具体的伦理原则是另一种重要方法。这包括将公平性、非歧视性和患者自主性等伦理要求直接纳入提示构建。

将基于大语言模型(LLM)的提示工程转化为实际临床实践需要克服计算成本、法规合规性和临床可解释性等障碍。当前模型需要大量资源,这对许多医疗机构来说可能不可行。未来工作可以探索基于领域特定语料库的自动提示生成,以及能够捕捉共享临床语义同时适应本地术语的多任务提示。

为弥合研究与临床应用之间的差距,未来努力应侧重于开发平衡性能与保障措施的可扩展系统。基于HealthPrompt等框架,未来研究应开发适应性强的用户友好型提示库或自动化提示调优工具,以便直接应用。人工智能研究人员、临床医生、伦理学家和政策制定者之间的跨学科合作对于设计负责任部署的实用框架至关重要。

总之,提示工程是医学NLP研究的一个有前景领域,未来研究不仅应专注于开发更智能、更自动化的提示工程方法,还应将隐私、伦理和实际部署考虑嵌入设计和评估中。

**6. 结论**

**6.1. 综述总结**

总体而言,本综述文章全面概述了医疗领域NLP任务中不同的提示工程方法和挑战。研究人员介绍了不同的提示设计方法,包括手动和自动、离散和连续,并提供了示例说明其在医疗环境中的实际应用。此外,研究人员讨论了用于各种医疗任务的不同提示工程方法,如分类、生成、检测、论证、重建、问答、预测和推理任务。

本综述的一个关键发现是,提示工程是提高医疗领域NLP任务性能的一种有前景的方法。通过精心设计针对特定任务和领域定制的提示,研究人员可以在准确性和效率方面取得显著提升。

然而,提示工程也存在若干挑战和局限性,需要在未来研究中加以解决。此外,提示的有效性可能取决于任务和领域的特定特征,这些特征在不同的医疗应用中差异很大。

**6.2. 综述的局限性**

尽管进行了全面的文献检索过程并纳入了333篇相关研究,但可能遗漏了医学NLP提示工程领域的一些相关研究。因此,本综述的范围可能并非完全详尽,可能还有其他重要研究未被涵盖。

此外,尽管文章涵盖了一系列医疗任务及其中使用的提示工程方法,但可能还有其他任务或
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号