《Frontiers in Computer Science》:Anomaly detection in netflow traffic: workflow for dataset preparation and analysis
编辑推荐:
信息和通信技术(ICT)对于维持高效通信、提升流程和实现数字化转型至关重要。随着ICT在日常生活中的重要性日益增加,确保其安全性对于维护数字信任和抵御不断演变的网络威胁至关重要。这些技术产生大量数据,需要同时分析以检测ICT系统的威胁并保护其可能包含的敏感信息
信息和通信技术(ICT)对于维持高效通信、提升流程和实现数字化转型至关重要。随着ICT在日常生活中的重要性日益增加,确保其安全性对于维护数字信任和抵御不断演变的网络威胁至关重要。这些技术产生大量数据,需要同时分析以检测ICT系统的威胁并保护其可能包含的敏感信息。NetFlow是一种网络协议,可用于监控网络流量、收集互联网协议(IP)地址以及检测NetFlow中的异常。研究人员遵循设计科学研究(DSR)方法论,旨在提供一种使用机器学习开发NetFlow分析特征集的方法。研究人员通过使用K-means聚类算法实施异常检测和使用长短期记忆(LSTM)方法进行时间序列预测,分析和验证了特征集。该研究为两种机器学习方法提供了两个独立的特征集(聚类24个特征,LSTM14个特征),概述了本研究中使用的异常检测方法,并提供了一种结合两种机器学习方法的方法。此外,该研究还引入了一种方法,该方法整合了两个模型的输出,并基于贝叶斯定理和模型先前的性能评估最终决策的可靠性。
**研究背景与问题**
随着信息与通信技术(ICT)在日常生活和商业流程中的深度渗透,网络安全威胁日益严峻。网络流量监控是检测恶意行为的关键手段,NetFlow协议作为Cisco提出的网络流量采集标准,能够收集IP地址、端口、协议等元数据,为异常检测提供基础。然而,现有网络入侵检测系统(NIDS)数据集缺乏标准化的特征集(SoF),不同数据集采用各异的特征组合,导致模型评估困难且难以迁移至真实场景。此外,无监督学习(如聚类)虽能应对未标记流量,但易产生高误报率;单一机器学习模型在真实网络环境中难以保证鲁棒性。因此,研究人员提出两项核心目标:一是为NetFlow异常分析开发一套可复用的特征集,二是建立一种结合多个无监督模型输出并评估其可靠性的方法,以提高异常检测的实用性和可信度。该研究发表于《Frontiers in Computer Science》。
**主要技术方法**(不超过250字)
研究人员采用设计科学研究(DSR)方法论,通过四个设计周期迭代开发。数据采集自里加工业大学的真实网络环境,使用NetFlow v.9协议,经伪匿名化处理。关键技术包括:①采用Apache Spark进行大数据预处理,将原始NetFlow字段按10分钟时间窗口分组,基于源IP聚合统计量(均值、方差、极值等),生成初始特征集;②选择K-means聚类算法(Apache Spark内置实现),并应用主成分分析(PCA)将24维特征降至2维以克服维数灾难,通过欧氏距离与阈值识别异常点;③构建长短期记忆(LSTM)神经网络(6层架构:2个LSTM层、2个全连接层、1个Dropout层、1个批量归一化层),对非聚合特征(包数、字节数、流持续时间等)进行时间序列预测,基于分位数与四分位距设定阈值检测异常;④利用贝叶斯定理融合两个模型的二元输出(异常/正常),依据模型历史准确率计算组合决策的可靠性概率。
**研究结果**
**Set of features for clustering (SoF1)**
通过分析初始特征的箱线图、Kolmogorov-Smirnov检验(KS检验)及相关性分析,研究人员保留了能反映流量行为的关键特征,最终确定SoF1包含27个特征,其中24个用于聚类(去除源地址、时间戳和星期标签)。该特征集针对前向流量(发往目标服务器)设计,可支撑基于欧氏距离的K-means异常检测。
**Set of features for time-series (SoF2)**
针对LSTM模型,研究人员发现聚合特征(如TotalBytes)无法有效预测,转而采用非聚合特征,包括包数、字节数、流持续时间、TCP标志计数、时间增量和星期标签,共12个输入特征和2个输出特征(包数和字节数)。SoF2兼顾前向和后向流量,但仅适用于时间序列预测,不适用于聚类。
**K-means anomaly detection method**
研究人员开发了12步K-means聚类异常检测流程:数据预处理→按工作日/周末及时段(早、午、晚、夜)划分8个子集→PCA降维→肘部法确定聚类数→计算各数据点至簇心的欧氏距离→以最大距离与最小距离之半作为阈值→标记超出阈值为异常。实验表明,该方法平均正确识别83.3%的人工诱导异常流(通过Apache JMeter过载服务器生成),该值作为聚类模型的实证概率P
A=0.83。
**LSTM anomaly detection method**
LSTM模型采用12步时间序列预测方法:前向与后向流量分别建模,用前10个时间步预测下一时刻的包数和字节数,计算预测值与真实值之差,依据分位数阈值(前向仅用上限,后向用上下限)标记异常。性能评估显示:前向流量异常检测率96%(P
B forward=0.96),后向流量为56%(P
B backward=0.56)。尽管标准回归指标(MSE、MAE、MAPE、R2)表明后向流预测更准确,但前向流中明显的异常反而提升了检测能力。
**Output reliability assessment**
研究人员基于贝叶斯定理,结合两个模型的实证概率,计算融合输出的可靠性。当两个模型结果一致(同为异常或正常)时,可靠性公式为P
correct = (P
AP
B) / (P
AP
B + (1-P
A)(1-P
B));当不一致时,则根据各自概率计算。前向流量中,LSTM模型主导(可靠性0.96),后向流量中聚类模型主导(0.83);两者一致时可靠性高达0.99(前向)和0.86(后向)。该评分可触发不同等级的安全响应(如自动黑名单或人工告警)。
**讨论与结论**
研究人员指出,本研究通过设计科学方法产出了四个主要构件:聚类特征集(SoF1)、时间序列特征集(SoF2)、两种异常检测方法,以及模型输出组合与可靠性评估方法。与现有数据集(如CICIDS2017、UNSW-NB15)相比,本研究的特征集包含时间维度和聚合统计量,且来源于真实网络流量而非测试床,更贴近实际场景。局限性包括:仅覆盖高负载类异常,模型尚未引入集成学习,且当前仅基于单一高校网络验证。未来工作将扩展异常类型、引入人机协同增量学习,并增加模型数量以提升可靠性评估精度。研究结论可概括为:所提出的特征集与异常检测方法能够有效识别NetFlow异常,且通过贝叶斯融合可靠性评估为网络安全决策提供了可量化的置信度依据,为后续研究奠定了实用基础。