
-
生物通官微
陪你抓住生命科技
跳动的脉搏
基于语言学家标注验证的印尼语词性标注语料库
《Scientific Data》:A Part-of-Speech Tagging Corpus for Bahasa Indonesia with Linguist-Based Label Validation
【字体: 大 中 小 】 时间:2026年08月14日 来源:Scientific Data 7.2
编辑推荐:
摘要词性标注是一项至关重要的工作,它会对其他文本分析任务产生显著影响。目前,使用BiLSTM方法,印尼语的词性标注已经实现了较高的准确率。然而,由于存在多义词的词类识别难题以及词汇表外词的识别问题,这一准确率仍未达到最佳水平。其中一个原因是缺乏一个一致且可验证的语料库作为可靠的数
词性标注是一项至关重要的工作,它会对其他文本分析任务产生显著影响。目前,使用BiLSTM方法,印尼语的词性标注已经实现了较高的准确率。然而,由于存在多义词的词类识别难题以及词汇表外词的识别问题,这一准确率仍未达到最佳水平。其中一个原因是缺乏一个一致且可验证的语料库作为可靠的数据来源。因此,本研究提出了一种通过改进Fu等人现有的包含21,024个句子的语料库,并结合语言学家的标签验证来构建新语料库的方法。语料库构建过程包括六个步骤:语言学家选定、不一致性识别、预处理、不一致性检测、不一致性修正以及语料库评估。评估是在2,457个经过验证的单句子集上进行的,将初始筛选后的语料库与所提出的Ideal语料库进行比较。结果显示,与初始筛选后的语料库相比,所提出语料库中的标签差异有所减少,其熵值从0.04降至0.02。评估表明,Ideal语料库的性能优于之前的基准语料库。此外,在这种受限的单句语境下,Ideal语料库提升了模型在一般情况以及多义情境下的性能。模型的宏观F1分数在一般情况下提升了约8%,在多义情况下提升了约9%。该数据集可从https://doi.org/10.5281/ZENODO.20159181下载。