
-
生物通官微
陪你抓住生命科技
跳动的脉搏
用于评估大型语言模型在气候情感分析中跨领域迁移能力的ClimaSentAR数据集
《Scientific Reports》:The ClimaSentAR dataset for evaluating cross-domain transferability of large language models in climate sentiment analysis
【字体: 大 中 小 】 时间:2026年07月24日 来源:Scientific Reports 4.9
编辑推荐:
摘要由于语言多样性、资源有限以及标注数据集的匮乏,阿拉伯语在气候情感分析方面的研究仍然十分有限。现有的方法主要依赖问卷调查或通用的情感分析模型,而这些方法往往无法准确捕捉特定领域的情感表达。为填补这一空白,本文提出了ClimaSentAR,这是首个大规模的阿拉伯语气候主题情感数据
由于语言多样性、资源有限以及标注数据集的匮乏,阿拉伯语在气候情感分析方面的研究仍然十分有限。现有的方法主要依赖问卷调查或通用的情感分析模型,而这些方法往往无法准确捕捉特定领域的情感表达。为填补这一空白,本文提出了ClimaSentAR,这是首个大规模的阿拉伯语气候主题情感数据集,包含了来自X平台的23,957个样本。这些数据由阿拉伯语母语者进行标注,不同标注者之间的一致性系数为0.45。其中正面情感实例有5510个,负面情感实例有8140个,中性情感实例则有10,307个。为验证ClimaSentAR的重要性和可靠性,并弥补阿拉伯语气候变化情感分析领域的不足,本研究对以阿拉伯语为特色的预训练语言模型及大型语言模型进行了微调。与以往仅基于通用数据集的研究不同,该方法系统地评估了模型在特定领域的表现及其跨领域泛化能力,同时还采用了包括领域自适应预训练、AdapterFusion以及数据增强在内的多种优化策略。实验结果表明,针对气候主题的微调显著提升了模型在相关领域的性能,AraBERT在气候相关数据上的宏观F1分数达到了0.753。而在跨领域测试中,经过气候主题微调的模型宏观F1分数最高为0.599,而通用模型这一数值则低于0.48。为便于复现研究结果及推动后续发展,经过微调的AraBERT模型已通过Hugging Face公开发布,同时还提供了交互式网页界面,供研究人员和实际应用人员进行测试和进一步微调。
生物通微信公众号