AnnotaHub:面向低资源语言YouTube评论标注的开源人机协同平台

《SoftwareX》:AnnotaHub: An open-source human-in-the-loop platform for LLM-assisted youtube comment annotation

【字体: 大 中 小 】 时间:2026年09月25日 来源:SoftwareX 1.9

编辑推荐:

  在自然语言处理(NLP)领域,构建高质量标注数据集是一项耗时的任务,尤其对于标注资源仍然有限的低资源语言而言。本文介绍了AnnotaHub,一个支持大语言模型(LLM)辅助的YouTube评论标注的开源人在环路(human-in-the-loop)平台,涵盖评

  
在自然语言处理(NLP)领域,构建高质量标注数据集是一项耗时的任务,尤其对于标注资源仍然有限的低资源语言而言。本文介绍了AnnotaHub,一个支持大语言模型(LLM)辅助的YouTube评论标注的开源人在环路(human-in-the-loop)平台,涵盖评论级分类和跨度标注(span labeling)。该平台将数据收集、自动标注、人工审核、数据集管理和导出集成在统一环境中。AnnotaHub同时支持本地部署和基于云的大语言模型,使研究人员能够根据其计算和隐私需求选择部署方案。一项针对越南语YouTube有毒评论标注的案例研究证明了该平台在实际数据集构建中的有效性。实验结果表明,与人工标注相比,LLM辅助标注减少了77.3%的人力投入,并使标注吞吐量几乎翻倍。该平台为创建和管理NLP数据集提供了实用支持。
一、研究背景与问题提出
在自然语言处理(NLP)研究中,文本标注特别是跨度标注(span labeling)是将非结构化文本转化为可用于下游任务的结构化信息的关键环节。近年来,大语言模型(LLM)的进步深刻影响了跨度标注的方式。然而,这些技术进展并未均衡惠及所有语言。英语研究者可依赖大量公开基准数据集,而许多低资源语言仍面临标准化标注资源的严重短缺。以越南语为例,其在有毒语言检测、命名实体识别(NER)和垃圾评论检测等跨度级任务中,标注资源尤为匮乏。
现有标注工具如YEDDA、Doccano和Label Studio虽各有优势,但大多主要服务于标注过程本身,而非数据集构建的完整生命周期。具体而言,现有框架普遍缺乏以下能力:自动化数据收集、与本地部署LLM的无缝集成、AI生成建议与人工验证标注的分离存储、以及内置基准数据集创建支持。因此,针对低资源语言的NLP数据集构建面临三大根本性挑战:一是来自YouTube等平台的数据常包含大量外语评论,现有静态标注工具缺乏原生翻译工作流;二是社交媒体文本处理需高度灵活地适应不断演变的俚语和语义变化,传统平台难以动态定义标注模式并将AI推理融入标注流程;三是使用商业API进行预标注受制于财务成本和数据安全风险,且缺乏AI预测与人工修正标签同时存储的基准评估机制。
为应对上述挑战,研究人员开发了AnnotaHub——一个开源的人机协同(HITL)标注平台,专门针对低资源语言的资源限制设计了多项目标注工作流。
二、研究方法与技术路线
AnnotaHub采用多层架构设计,包括表现层、应用层、持久化与缓存层、异步处理层。核心技术方法包括:
  1. 1.
    动态LLM辅助标注框架:允许用户为单个项目定义自定义标签模式(label schemas),系统自动将这些定义转换为推理就绪的表示形式,并通过Ollama平台与本地部署的AI模型原生通信,或通过兼容OpenAI的推理API与云端AI模型交互。该方法在句子级和词元/跨度级实现预标注自动化,从而降低标注工作量与运营成本。
  2. 2.
    多实体基准架构:与传统标注工具不同,AnnotaHub独立且同时存储AI生成的标签和经专家验证的真实标签,同时保留人工标注作为权威来源。该架构便于创建用于小语言模型(SLM)微调的高质量数据集,并为评估LLM的上下文内标注性能提供实用的基准库。
  3. 3.
    端到端数据处理流水线:平台自动化整个数据生命周期,包括社交媒体数据收集(内置YouTube数据管道)、机器翻译支持的多语言增强、人工辅助标注工作流,以及直接导出为JSON和JSONL等LLM训练格式。
平台基于Python、Django和Bootstrap实现,采用面向对象的软件开发方法,核心域模型包括Project、Comment、Token和Label等类。
三、研究结果
1. 标注效率评估
研究人员以越南语有毒评论数据集为案例,对214条YouTube评论进行了对比实验。四名经验丰富的标注员分别在纯人工条件和AnnotaHub辅助条件下独立标注相同数据集。实验顺序采用平衡设计以消除顺序效应。结果显示:
  • •
    人力投入从每条评论约22秒降至约5秒,人力减少77.3%
  • •
    端到端标注时间从约22秒降至约11.5秒/条
  • •
    标注吞吐量从164条/小时提升至313条/小时
2. LLM标注质量评估
通过比较初始LLM生成标签与最终人工验证标签的混淆矩阵发现:
  • •
    LLM正确分类了50条有毒评论和119条无毒评论,误分类12条有毒和33条无毒评论
  • •
    准确率达78.97%,Cohen's Kappa系数为0.54,表明与最终标签达到中等一致性水平
  • •
    有毒类的召回率(80.65%)高于精确率(60.24%),F1分数为68.97%
四、讨论与结论
研究表明,LLM在生成初始标注建议方面效果显著,但人工审核仍是产生可靠基准数据集的必要条件。AnnotaHub作为开源平台支持自主托管部署和定制,将数据收集、AI辅助标注、人工验证、原生只读快照模式和数据集导出集成于统一工作流中。自主托管部署还允许组织在需要时保留对研究数据的控制权。
研究结论:本文提出了AnnotaHub,一个用于LLM辅助YouTube评论标注的开源人机协同平台。该平台将数据收集、自动标注、人工验证、数据集管理和数据导出整合在单一工作流中。对本地和云端语言模型的支持使研究人员能够根据其计算和隐私需求选择部署方案。在越南语YouTube评论数据集上的评估表明,与纯人工标注相比,所提出的工作流将人力标注投入减少了77.3%,并将标注吞吐量从164条/小时提升至313条/小时。LLM生成标注与人工验证标签之间的Cohen's Kappa得分为0.54。这些发现表明,LLM在生成初始标注建议方面有效,但仍需人工审核以产生可靠的基准数据集。未来开发将扩展数据收集来源、改进批量推理、支持更广泛的语言模型,并探索提示生成和质量控制机制以提高标注一致性和处理效率。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号