基于多标签嵌入的短期跨类别投诉复发预测框架
《Informatics》:A Multilabel Embedding-Based Framework for Predicting Short-Term Cross-Category Complaint Recurrence
【字体:
大
中
小
】
时间:2026年07月10日
来源:Informatics 2.8
摘要
公众投诉存在明显的时空依赖性,问题往往会在短时间内在不同类别间传播,但现有研究大多忽视了跨类别的重复出现现象,也未充分运用嵌入表示方法来处理结构化数据。为弥补这一不足,本研究提出了一种基于多标签嵌入的框架,利用结构化的时空数据预测短期内的跨类别投诉重复出现情况。该框架基于48,103条真实的投诉记录,将嵌入表示方法与机器学习及深度学习模型相结合,用以预测同一区域内多种投诉类别在接下来七天内再次出现的可能性。研究结果表明,这两种方法的平均F1分数均在30.5%至32.6%之间,而对于那些频繁出现的投诉类别,这一比例甚至超过81%。其中效果最佳的机器学习模型是采用多语言e5-large嵌入的逻辑回归二元相关性模型,其汉明损失最低,为0.138 ± 0.126。统计分析显示,数据不服从正态分布,夏皮罗-威尔克检验值在0.796至0.819之间,p值低于0.05;通过弗里德曼检验,不同模型之间存在显著差异,其统计值为512.531,p值也低于0.05,不过通过涅梅尼事后检验并未发现模型间的显著两两差异。此外,95%的自助法置信区间表明这些模型的性能较为稳定,机器学习的F1分数在74.1%至74.9%之间,而深度学习的F1分数则在73.2%至74%之间。
生物通微信公众号
生物通新浪微博
今日动态 |
人才市场 |
新技术专栏 |
中国科学人 |
云展台 |
BioHot |
云讲堂直播 |
会展中心 |
特价专栏 |
技术快讯 |
免费试用
版权所有 生物通
Copyright© eBiotrade.com, All Rights Reserved
联系信箱:
粤ICP备09063491号