生成式西班牙语临床命名实体识别中的跨度引用与接地可靠性:一项验证研究

《Electronics》:Span-Reference and Grounding Reliability in Generative Spanish Clinical Named Entity Recognition: A Validation Study

【字体: 大 中 小 】 时间:2026年08月20日 来源:Electronics 2.9

编辑推荐:

  生成式命名实体识别(Named Entity Recognition, NER)系统必须识别临床概念并将其映射到精确的源跨度。研究人员调查了跨度引用设计如何影响这一映射,以及失败是源于识别还是源定位。研究人员比较了四种表示与接地流水线——内联XML(inlin

  
生成式命名实体识别(Named Entity Recognition, NER)系统必须识别临床概念并将其映射到精确的源跨度。研究人员调查了跨度引用设计如何影响这一映射,以及失败是源于识别还是源定位。研究人员比较了四种表示与接地流水线——内联XML(inline XML, iXML)、提及列表JSON(mention-list JSON, mJSON)、制表符分隔提及列表(tab-separated mention list, TSV)和直接偏移JSON(direct-offset JSON, oJSON)——在一个公开的西班牙语临床病例报告集合中对疾病、程序和症状的识别。研究人员针对每个任务微调了两个指令调优的30亿参数模型,并对输出进行了句法有效性、解析、接地和官方严格跨度性能评估。iXML、mJSON和TSV格式的F1分数为0.637–0.736,而oJSON仅为0.001–0.005。使用相同的未适应检查点,零样本F1最高为0.131,三样本F1最高为0.386;三样本提示改善了mJSON的输出,而iXML和直接偏移仍接近零。直接偏移输出通常包含相关的提及文本但字符位置不正确。在一个单独的75文档确认分区上,对输出的字符串进行接地恢复了0.603–0.701的F1,而用提及出现次数替换绝对偏移则达到0.652–0.740。无需进一步训练,在458个医院记录片段上的外部CARMEN-I评估中,字符串接地或出现索引输出的F1为0.610–0.659,而iXML为0.113–0.177,直接偏移至多为0.002。这些结果表明,仅输出有效性并不能确立可用的跨度提取。将识别与源定位分开,可以确定一个原本有效的生成在何处失败,而基于出现次数的引用在测试设置中的精确匹配下提供了比绝对字符偏移更可靠的替代方案。
生成式西班牙语临床NER的跨度引用与接地可靠性验证研究

生成式命名实体识别(NER)系统必须从输入文本中识别出临床概念,并将其映射到精确的源文本跨度。与序列标注模型直接为每个词元分配标签不同,生成式大语言模型(LLM)输出的是新的文本序列,这些输出必须经过解析、接地后才能与金标准跨度比较。既有研究指出输出结构会影响信息抽取性能,但对完整的“表示-接地”流水线在西班牙语临床文本上的系统比较尚不充分。主要问题在于:模型可能识别了正确的短语,却因格式错误、复制偏差、重复出现选择错误或生成错误的字符索引而导致失败,而传统的聚合分数无法定位失败环节。此外,输出格式的设计决定了模型需要生成什么以及预测如何被定位,这与后续接地规则共同构成了一个完整的管线。因此,研究人员针对西班牙语临床NER的三种实体类型,系统比较了四种表示-接地流水线,并诊断失败发生的阶段。

这项研究在公开的西班牙语临床病例报告集合上开展,使用了三个官方任务:DisTEMIST(疾病)、MedProcNER(医疗程序)和SympTEMIST(症状)。研究人员微调了两个30亿参数指令调优模型(Qwen2.5-3B-Instruct和Llama-3.2-3B-Instruct),为四个输出格式、三种训练种子和三个任务训练了72个适配器,并在官方测试集上采用严格跨度评分。结果发现,内联XML(iXML)、提及列表JSON(mJSON)和制表符分隔提及列表(TSV)的F1分数为0.637–0.736,而直接偏移JSON(oJSON)仅为0.001–0.005。通过将识别与源定位分离,诊断实验表明失败主要发生在定位阶段:模型能够生成实体文本,但无法产生可靠的绝对字符偏移。用提及出现次数替代绝对偏移后,性能恢复至0.652–0.740。外部CARMEN-I验证进一步显示,字符串接地和出现索引输出在未再训练的情况下保持0.610–0.659,而iXML和oJSON显著下降。这一研究为生成式临床NER的输出接口选择提供了证据基础,论文发表在《Electronics》。

研究方法上,研究人员使用了公开的西班牙语临床病例报告官方训练/测试划分,以及外部CARMEN-I数据集(来自巴塞罗那医院诊所的458个去标识化医疗记录片段)。主要技术包括:基于量化低秩适配(QLoRA)的微调、四种输出格式(iXML标签、mJSON、TSV、oJSON数字索引)的生成、四阶段评估流程(语法有效性、格式解析、源文本接地、严格跨度评分),以及位置-引用诊断(比较原始偏移指令、显式坐标定义和出现次数引用)。此外还进行了零样本/三样本提示比较和文档级配对自助法统计。

4.1. 目标转换检查
研究人员将金标准注释转换为各目标格式并解析回来,发现iXML和oJSON能完全恢复,而mJSON和TSV因重复字符串无法唯一确定出现位置,只能恢复94.9–96.7%。这设定了这些管线的理论上限。

4.2. 严格跨度性能
iXML、mJSON和TSV在所有任务和模型上表现接近,F1在0.637–0.736;oJSON则几乎失败。配对置信区间显示mJSON与TSV差异极小,仅SympTEMIST/Qwen组合TSV高出0.014,低于预设的实际重要性阈值。oJSON与iXML差异显著。

4.3. 语法、解析与接地
所有格式的语法有效率和解析接受率都很高(>96%),但接地环节分离了性能。oJSON中99.8–99.9%的候选具有无效或源不一致的位置;iXML失败主要源于生成的源副本不匹配;mJSON和TSV大多数能找到字符串。

4.4. 直接字符偏移为何失败?
通过显式坐标定义,oJSON仍无改善;忽略生成的数字、仅用文本接地,F1升至0.603–0.701;用出现次数索引则达到0.652–0.740。这说明模型往往能识别实体短语但无法可靠地计数绝对字符位置。

4.5. 稳健性检查
改变重复提及的接地规则(首次出现或所有出现)会移动mJSON/TSV的分数但不改变格式排序;提示措辞、串行/并发推理以及按文档长度、实体密度分层均未逆转主要结论。

4.6. 零样本与三样本提示
未适应检查点零样本F1最高0.131,三样本最高0.386。三样本显著提高mJSON和TSV,但iXML和oJSON仍接近零,说明监督微调对位置携带型格式至关重要。

4.7. CARMEN-I外部验证
在不进一步训练的情况下,mJSON和TSV保持0.610–0.659,iXML降至0.113–0.177,oJSON仍为0.001–0.002。出现索引F1为0.610–0.652。这表明官方测试中的格式相似性并未完全迁移,字符串接地在外部数据上更稳健。

讨论部分强调,输出格式必须与解析器和接地规则视为完整管线。结构有效不代表可用的跨度提取。语法有效的输出可能完全无法接地,因此应分阶段记录语法、解析、接地和评分失败。iXML保留位置但生成冗长且易在源复制上出错;mJSON和TSV需要处理重复字符串;绝对偏移不可靠时,出现次数引用是一个更可靠的替代。研究也指出局限:仅两个3B模型、一个微调配置、三个来自同一语料库的单实体任务,以及有限的种子数量。

翻译研究结论部分如下:这项研究表明,输出表示是生成式NER被评估流水线的一部分,而不是识别后的装饰性选择。首先,受控比较发现内联XML、提及列表JSON和TSV在两个微调过的30亿参数模型和三个西班牙语临床注释层上取得了0.637–0.736的严格跨度F1,而直接偏移JSON仅为0.001–0.005,跨度引用流水线能决定已识别的实体文本是否成为被接受的源跨度。其次,匹配的提示比较将这一结果限定于监督适应范围:未适应检查点零样本F1最多0.131,三样本最多0.386;提供三个示例改善了mJSON和TSV,但iXML和直接偏移仍接近零。第三,将语法、解析、源接地和实体正确性分离,将直接偏移失败定位于定位阶段——输出通常格式良好但无法接地,因此仅有效结构不足以保证可靠的跨度提取。第四,匹配的位置-引用比较显示,直接偏移输出通常保留相关提及文本,而更清晰的计数指令并未实质性改善数值位置;出现次数引用在75文档确认分区上达到0.652–0.740。最后
相关新闻
生物通微信公众号
微信
新浪微博

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号