基于大语言模型零样本标注与混合标签腐蚀序列校正的弱监督金融新闻分类

《Information》:Zero-Shot Annotation by Large Language Model with Serial Correction of Mixed Label Corruption for Weakly Supervised Financial News Classification

【字体: 时间:2026年09月09日 来源:Information 4.3

编辑推荐:

   摘要

  

摘要

金融新闻的多标签分类经常受到不完整和含噪标注的影响,而大规模获取专家标注标签的成本极其高昂。本研究提出了一种弱监督分类框架,将大语言模型(LLM)零样本标注与串行标签校正策略相结合。该框架首先利用大语言模型生成初始弱标签,然后通过两阶段"Correct→Clean"流程对其进行精炼——该流程先通过中心性加权图传播恢复缺失标签,再抑制标签噪声。在Reuters-21578数据集的金融子集上的系统实验表明,在80%缺失标签和15%噪声标签的极端混合腐蚀设置下,Correct→Clean将Micro-F1从0提升至0.6748。在端到端评估中,所提框架使用降维特征实现了0.8882的Micro-F1,恢复了与全监督学习之间88.69%的性能差距。在RCV1 Topics和AAPD数据集上的额外实验证实,Correct→Clean的优势在不同领域和数据集规模下均得到一致复现。这些发现表明,将大语言模型生成的标注与有序标签校正相结合,是应对缺失标签与噪声标签共同影响的有效手段,为专家标注稀缺情况下的金融文本分类提供了一种有前景的方法。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号