
-
生物通官微
陪你抓住生命科技
跳动的脉搏
ACEL-Eval:基于《史记》的古典中文实体链接基准数据集
《Scientific Data》:ACEL-Eval: A Benchmark Dataset for End-to-end Entity Linking in Classical Chinese
【字体: 大 中 小 】 时间:2026年09月25日 来源:Scientific Data 7.2
编辑推荐:
摘要随着前现代文本日益以数字形式呈现,对其进行分析计算的一大障碍在于缺乏用于识别和规范化历史实体的结构化资源。这一挑战在古典中文中尤为明显,其中端到端实体链接的标准化基准仍然有限。为满足这一需求,我们提出ACEL-Eval,一个用于评估古典中文实体链接的基准数据集。ACEL-
随着前现代文本日益以数字形式呈现,对其进行分析计算的一大障碍在于缺乏用于识别和规范化历史实体的结构化资源。这一挑战在古典中文中尤为明显,其中端到端实体链接的标准化基准仍然有限。为满足这一需求,我们提出ACEL-Eval,一个用于评估古典中文实体链接的基准数据集。ACEL-Eval源自《史记》,涵盖古典历史写作中频繁出现的六个实体类别:人物、地点、国家、官职、书籍和时间。该数据集通过结合六个实体类别的命名实体识别和人物提及的实体消歧来支持端到端实体链接。为便于人物指称的规范化,我们提供了一个以人物为导向的知识库,包含个人姓名、别名和所属国家等核心属性。我们在两个目标任务上进行了基线实验,以验证数据集的可用性,并为未来的比较建立可重复的参考结果。ACEL-Eval旨在作为古典中文实体链接的基准资源,以及前现代中国历史文本相关计算研究的参考。