《Scientific Reports》:An LLM-based synthetic data generation approach for addressing class imbalance in malicious traffic detection
编辑推荐:
电信网络流量的快速增长给可靠、及时地检测恶意活动带来了越来越大的挑战。该领域的关键困难之一是类别不平衡,即恶意事件仅占真实世界数据集的一小部分。传统的过采样技术往往难以捕捉此类场景中少数类模式的结构多样性。本文研究使用大语言模型(LLMs)进行合成数据生成,作
电信网络流量的快速增长给可靠、及时地检测恶意活动带来了越来越大的挑战。该领域的关键困难之一是类别不平衡,即恶意事件仅占真实世界数据集的一小部分。传统的过采样技术往往难以捕捉此类场景中少数类模式的结构多样性。本文研究使用大语言模型(LLMs)进行合成数据生成,作为在网络流量分类任务中缓解类别不平衡的数据层面方法。所提出的方法利用LLMs的生成能力,产生多样且统计一致的合成样本,增强少数类的表示,同时保留原始数据的整体特征。实验结果表明,在训练中引入LLM生成的样本,将少数恶意类别的召回率从约0.78提升至0.84,同时保持有竞争力的精确率。此外,基于变异系数的分析表明,与合成少数过采样技术(SMOTE)相比,所提出方法在召回率和F1分数上表现出更低的变异性,并且在多次重复训练中展现出与自适应合成采样(ADASYN)和表格变分自编码器(TVAE)相当的稳定性。这些结果表明,在受限增强条件下,基于LLM的合成数据生成能够改善少数类检测,同时保持稳定可靠的模型行为。
**论文解读文章**
**研究背景与问题**
随着互联系统的激增和网络威胁的指数级增长,恶意流量检测已成为现代网络安全的关键组成部分。基于网络的入侵检测系统(NIDS)严重依赖监督式机器学习模型将流量流分类为正常和恶意类别。然而,现实世界数据集的高度不平衡性构成了根本性挑战:正常流量占绝大多数,而恶意事件虽罕见但可能造成毁灭性后果。这种不平衡导致模型偏向多数类、少数类检测率降低,以及未检测到入侵的风险增加。现有技术,如随机过采样、欠采样或算法级修改,虽能部分缓解不平衡问题,但存在固有缺陷:过采样常引入冗余模式,欠采样丢弃有价值信息,代价敏感学习无法始终捕获少数类的复杂上下文依赖关系。因此,传统解决方案在动态异构网络环境中难以保证可靠的泛化能力。
**研究目的与意义**
大语言模型(LLMs)的最新进展为数据增强开辟了新的机遇。凭借其上下文推理和生成能力,LLMs可以合成与原始数据保持统计和语义一致性的真实多样样本。在恶意流量检测领域,这一能力尤为宝贵,因为它允许生成在训练数据中本已不足的罕见攻击模式。本研究提出一种基于LLM的合成数据生成框架,旨在解决恶意流量检测中的类别不平衡。该框架专注于用代表性合成样本丰富少数类,以提升分类模型的判别性能。与传统的重采样方法不同,所提出方案增强了稀有类的多样性和上下文相关性,从而带来更稳健的检测结果。该研究发表在《Scientific Reports》。
**主要关键技术方法**
研究人员采用以下关键技术方法:(1)基于LLM(GPT-4o-mini模型)的合成数据生成,通过提示工程向模型传递目标类别的皮尔逊相关系数、描述性统计以及1500条连续样本记录,迭代生成约44000条合成样本;(2)对比经典过采样方法:SMOTE(合成少数过采样技术)、ADASYN(自适应合成采样)和TVAE(表格变分自编码器);(3)使用相同的数据预处理流程、神经网络架构(四层全连接前馈网络,含ReLU激活和Dropout层)和训练配置进行控制实验;(4)采用LUFlow网络入侵检测数据集(基于蜜罐收集)和UNSW-NB15数据集进行验证,数据集分为训练、验证和测试集,合成样本仅加入训练集。
**研究结果**
**LUFlow网络入侵检测数据集**
通过稳定性分析(基于变异系数CV),研究人员发现LLM增强后的召回率变异系数从基线的4.17%降至3.09%,低于SMOTE(5.24%)和ADASYN(4.58%),与TVAE(3.06%)相当。训练动态曲线显示LLM增强的召回率轨迹更平滑。分类性能比较表明,LLM增强将少数类召回率从0.786提升至0.846,优于SMOTE(0.781)、ADASYN(0.805)和TVAE(0.796);精确率略有下降(0.699至0.684),但与其他方法相当;F1分数从0.740提升至0.756,为所有方法中最高。混淆矩阵分析确认召回率提升主要来自假阴性减少,假阳性水平与对比方法相当。Wilcoxon符号秩检验表明,仅LLM增强的召回率提升具有统计显著性(p=0.00195)。
**UNSW-NB15数据集**
在二元分类设置下,所有过采样方法均比基线更快收敛。SMOTE和ADASYN达到最高召回率(0.871和0.879),且Wilcoxon检验显著(p<0.01);LLM增强的召回率提升不显著(p=0.75),但获得了最高精确率和最低假阳性率。混淆矩阵显示LLM增强主要改善了正常流量判别,而SMOTE和ADASYN更有效地减少了恶意流量的假阴性。总体而言,在简单二元分类任务中,经典插值法在召回率优化上更有效,而生成式方法(包括LLM和TVAE)的优势不明显。
**讨论与结论**
讨论部分指出,LLM合成数据生成在控制性方面存在挑战:模型对固定生成数量的指令遵守不一致,输出规模波动;输入令牌的利用存在权衡,过长的提示可能引入噪声,过短则丢失关键信息;幻觉样本可能导致训练分布偏移;依赖专有LLM(如GPT-4o-mini)带来安全、保密性和部署限制。增强比例实验(10% vs 20%)显示,适度增强即可达到主要效果,进一步增加未见额外收益。
研究结论:本研究调查了使用大语言模型进行合成数据生成以缓解网络流量分类任务中类别不平衡的方法。实验结果表明,在评估条件下,LLM增强可以提升少数类表示,并带来可衡量的分类性能改善。具体而言,引入少量LLM生成的合成数据(约占少数类大小的10%)使恶意流量类别的召回率从基线0.786显著提升至0.846,持续优于SMOTE(0.781)、ADASYN(0.805)和TVAE(0.796)。召回率提升以精确率从0.699降至0.684为代价,但该降低与SMOTE(0.700)、ADASYN(0.698)和TVAE(0.698)相当,表明LLM增强未引入不成比例的假阳性增加。此外,LLM增强表现出增强的训练稳定性:召回率变异系数从基线4.17%降至3.09%,低于SMOTE(5.24%)和ADASYN(4.58%),与TVAE(3.06%)可比。总体而言,LLM生成的合成数据在检测性能和训练稳定性之间提供了有利的权衡,相较于经典过采样方法,同时实现了更高的召回率和更低的随机初始化敏感性。在UNSW-NB15数据集上,二元分类设置下,经典过采样方法(尤其是SMOTE和ADASYN)在召回率方面最有效,而LLM增强未显著提升召回率,但获得了更高精确率和更少假阳性。因此,对于相对简单的二元任务,传统过采样技术比生成式增强方法具有更清晰的优势。这些结果是在特定实验配置下获得的,应谨慎解释,不能直接推广到所有网络环境。分析还识别出若干限制,包括生成过程可控性有限、对提示表述敏感、有效输入令牌使用约束以及幻觉样本风险。此外,依赖专有LLM解决方案引发安全性和部署可行性问题。未来研究方向包括开发更可控且轻量化的生成模型用于本地部署,以及改进生成过程的稳定性和样本验证策略。