BART-Disaster-X:一种从X平台上的灾难相关推文中提取信息的高效模型
《Remote Sensing Applications: Society and Environment》:BART-Disaster-X: an effective model to extract information from disaster-related tweets on X
【字体:
大
中
小
】
时间:2026年07月19日
来源:Remote Sensing Applications: Society and Environment 3.8
编辑推荐:
摘要:微博客平台提供了大量在自然灾害发生时极具价值的实时更新型众包信息。然而,如此庞大的数据量使得自然语言处理工具成为筛选和识别灾害响应团队所需信息的必要手段。本文提出了基于变换器的架构用于灾害推文分类,并对其进行了比较。目前最先进的框架采用BART分词器和LSTM分类头,能够将
摘要:微博客平台提供了大量在自然灾害发生时极具价值的实时更新型众包信息。然而,如此庞大的数据量使得自然语言处理工具成为筛选和识别灾害响应团队所需信息的必要手段。本文提出了基于变换器的架构用于灾害推文分类,并对其进行了比较。目前最先进的框架采用BART分词器和LSTM分类头,能够将推文分为灾害与非灾害、有用信息与无用信息两类,同时还能识别八种不同类型的灾害。该12类模型分别实现了0.8871的微观F1值和0.8764的宏观F1值,这一表现与那些处理类别较少的类似研究相当。所提出的框架可应用于支持灾害响应团队或其他系统快速筛选推文,从而找出包含针对特定灾害或灾害类型的有用且可操作的信息的推文。
引言:像X(原称“Twitter”)这样的微博客网站在自然灾害发生期间及之后被视为宝贵的数据来源。在灾害发生时,包括普通民众和当地当局在内的用户往往会发布带有时间戳和地理位置标签的推文,通报灾害的发展状况。如果能够筛选并整理这些与灾害相关的数据,保留有用的信息并及时提供,将有助于灾害响应工作。保险机构和非营利性人道主义组织等利益相关方也对这些数据很感兴趣,因为众包的灾情信息有助于他们评估灾害的程度和分布情况以及受影响的群体[1]、[2]。不过,新发布的推文数量庞大,人类灾害响应团队难以在合理时间内完成筛选和处理。因此,人们越来越多地采用基于自然语言处理的技术来自动识别和提取有用的灾害相关信息。自然语言处理指的是利用计算机处理人类语言文本,以实现翻译、文本生成、内容总结、文本分类以及情感和语气分析等功能。在过去十年中,自然语言处理技术也被越来越多地应用于灾害信息整合领域,相关技术从传统的机器学习逐步发展到基于大型语言模型的方法。与灾害相关的推文分析方法大致可分为监督学习和无监督学习两类。监督学习方法依靠标记好的数据集,将推文分类到预定义的类别中,如灾害类型、基础设施损毁、救援请求或有价值的内容等。支持向量机、卷积神经网络、长短期记忆网络以及基于变换器的架构等传统机器学习和深度学习模型已被广泛用于此类分类任务。而无监督学习方法则旨在无需手动标记数据的情况下,从大量的社交媒体数据流中识别模式并提取有意义的情境信息。这些方法包括基于本体的推文总结[3]、主题建模、聚类以及用于快速提升灾害预警和响应能力的情境信息提取框架[4]。以往的研究已经证明了基于本体的总结和无监督情境信息提取技术在灾害事件监测和疫情相关信息分析方面的有效性[5]。近年来,大型语言模型的进步进一步提升了监督式自然语言处理方法的性能,使其在上下文理解、语义推理以及多任务学习能力方面都有所改进。2014年有一项研究采用了机器学习方法对巴基斯坦地震相关的推文进行分类,取得了90%的曲线下面积精度[6]。大约在同一时间,基于支持向量机的机器学习方法也被成功用于对意大利语推文中的相关灾情信息进行分类和识别。早期面向灾害处理的自然语言处理系统,如人工智能灾害响应平台,也被开发出来,能够近乎实时地将与灾害相关的社交媒体帖子自动分类到有意义的人道主义类别中[7]。AIDR平台证明了机器学习框架在支持灾害响应和危机信息处理方面的实际应用价值,它能够快速筛选并确定海量社交媒体数据中的重要信息。
除了机器学习模型之外,还有多种深度学习框架被应用于文本分类,比如卷积神经网络[8]和长短期记忆网络[9]。最近,基于变换器的架构也被用于文本分类,既可用于定制开发的模型,也可通过GPT、BERT[10]以及后来的BART[11]等知名框架实现。这些知名框架在架构上的差异使得它们更适合特定的自然语言处理任务。GPT由于具有解码器模型架构,通常更适用于文本生成或创意写作任务。而具有编码器架构的模型则在分类和总结任务中表现更好。具体而言,BERT采用编码器模型架构,而BART则采用编码器-解码器模型架构。因此,这两种模型都适用于分类、总结和情感分析任务[12]、[13]。BERT在预训练策略上也有一些改进,它采用同时屏蔽整段文本的预训练目标(段落破坏法),这使得该模型在段落级或全文级的理解能力更强,而且相比在预训练过程中仅屏蔽单个单词的BERT(掩码语言模型法),BERT还具有额外的解码器层,因此在单词级理解能力上也更出色[14]。这些差异会影响模型在特定分类任务中的性能,因为在某些情况下,表示类别差异的信息在单词层面更容易被捕捉到。但在其他情况下,要准确区分类别,则需要段落级或全文级的上下文信息。也有研究尝试结合现有模型的优点,打造混合架构,以在特定任务中获得更好的性能。基于深度学习的分类模型通常由两部分组成:一是将文本转换为高维向量的分词器,二是利用经过分词处理的输出来生成低维类别预测的分类头。因此,有必要评估各种可能的架构组合,包括分词器和分类头,以便将这些组合用于从推文或类似的微博客平台中提取灾害信息。在针对与灾害相关文本的分类研究中,最近有研究使用BERT和CrisisMMD数据集[15]进行多类分类,取得了0.8796的宏观F1值[16]。他们的多类分类包括基础设施损毁、人员伤亡和无损毁三类。不过,该研究没有考虑自然灾害的类型,也没有判断数据是否有用。Zhou等人[12]将BERT应用于更具体的分类任务,即识别飓风灾害期间推文中的救援请求。还有研究尝试对架构进行改进,比如用卷积神经网络替代传统的线性分类头来优化分类头架构。不过,这样的改进并未带来显著的性能提升,所得F1值仅为0.8,而且该研究仅考虑了二分类问题(即是否为真实灾害)[17]。基于变换器的大型语言模型研究则能够处理多种类型的自然语言处理任务[11]。在这种应用中,它们不仅可以通过增加类别来区分不同的灾害类型,还能对社交媒体上收集到的关于灾害的必要信息(图片和文字)进行总结。同样,近期基于大型语言模型的灾害总结框架在从大量社交媒体数据流中提取简洁的情境信息方面也展现出了良好的性能。这些发展凸显了基于变换器架构在实时灾害信息分析中的重要性,同时也促使人们进一步探索混合架构,以提高模型在多种灾害类别中的分类准确性和泛化能力[18]。
本研究旨在在已有灾害相关推文分类研究的基础上取得新的进展,具体体现在以下三个方面:第一,在保持现有研究精度的前提下,将多类分类问题中的类别数量增加到12个。所提出的模型能够区分八种自然灾害类型以及两种重要的推文属性,即信息是否有用以及推文是否涉及真实的灾害。第二,整合多个灾害相关推文训练数据集,包括不同语言的翻译推文,以此提高模型的稳健性和适用性。第三,比较不同的混合架构,考虑使用BART和BERT作为嵌入模型,同时引入LSTM作为分类层,以替代传统的线性分类头。提出这些改进是因为人们认识到,要想让基于自然语言处理的灾害信息提取技术真正成为利益相关方的实用工具,就需要更详细的灾害相关信息,以及判断推文是否包含有用信息(从而可以标记出来供灾害响应团队查看)。
数据收集:本研究使用的数据集来自多个公开数据源以及自行收集的资料,其中包含了与灾害相关的推文。该数据集旨在涵盖多种不同的灾害场景,包括不同类型的灾害、有用与无用的信息,以及关于灾害与非灾害的讨论内容。数据来源于Kaggle竞赛、Hugging Face数据集、CrisisMMD数据集,以及近期手工收集的推文。
分类任务概述:该分类任务的目的是从与灾害相关的推文中提取信息,尤其是灾害的类型、推文是否包含可用信息(即是否有价值),以及推文是否涉及真实的灾害。此处提出的框架(图1)整合了基于深度学习的自然语言处理技术,如LSTM、BERT和BART,能够将推文分为12个类别,其中包括8种灾害类型。
模型结构:该模型采用混合架构,结合使用了BERT或BART。
结果:通过微观F1值、宏观F1值以及精确度、召回率和混淆矩阵等指标,对所提出的灾害推文分类框架的性能进行了评估,以此判断其在不同分类任务中的效果。将该模型的四种不同架构与作为基线的TF-IDF+SVM机器学习方法的性能进行了对比。表现最好的模型是BART + LSTM,在验证集上分别取得了0.8871的微观F1值和0.8764的宏观F1值(见表3)。
讨论与局限性:实验结果表明,BART + LSTM在微观F1值方面优于BART + Linear,但在宏观F1值方面略逊一筹。这表明在大多数类别中,BART + LSTM能以更高的准确性得出分类结果。但由于数据集标注存在不平衡现象,LSTM分类器在某些样本量较小的类别中表现较差,尤其是对于洪水、台风、山体滑坡和海啸等灾害类型。而BART + Linear在某些特定类别中的表现更为稳定。
结论:本研究致力于通过对社交媒体上与灾害相关推文的分类,有效提取有关灾害的信息。我们的模型结合了最先进的基于变换器的文本分类模型(BERT、BART),以及LSTM和线性分类头,能够将推文分为12个类别,涵盖8种灾害类型和4个关键属性(灾害与非灾害、有用信息与无用信息)。此外,该模型的性能也与其他模型进行了比较。
CRediT作者贡献声明:
Ram Avtar:写作——审阅与编辑、写作——初稿撰写、监督、软件、资源、方法论、数据整理。
Rakesh Konduru:写作——审阅与编辑、验证、监督、软件、概念设计。
Abhinandan Arya:写作——审阅与编辑、验证、形式分析、数据整理、概念设计。
Yin Thant:写作——审阅与编辑、方法论、研究调查。
Stephanus Louw:写作——审阅与编辑、写作——初稿撰写、资源、方法论。
代码与数据获取方式:本文中描述的软件框架是开源的,可在Github上获取。
软件名称:BART-Disaster-X
开发者:Su Yicheng
首次发布年份:2025年
编程语言:Python 3;Pytorch lighting
软件获取地址:https://github.com/sdy623/BART-Disaster-X
数据获取地址:https://huggingface.co/datasets/sdy623/new_disaster_tweets
利益冲突声明:作者声明不存在任何可能影响本文研究的已知财务利益或个人关系。
利益冲突声明:我确认不存在任何可能影响本文所述工作的已知财务、职业或个人关系。
致谢:我们感谢北海道大学提供的研究设施,以及X平台给予的数据访问权限。
Su Yicheng | Stephanus Albertus Louw | Yin Min Thant | Abhinandan Arya | Rakesh Teja Konduru | Ram Avtar
日本札幌市北海道大学环境科学研究生院
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号