《Scientific Reports》:A two-stage deep learning approach for multiclass DGA-based malware communication detection and classification in DoH network traffic
编辑推荐:
DNS over HTTPS(DoH)的采用通过加密DNS查询显著提升了用户隐私,但也为攻击者隐藏基于域名生成算法(DGA)的恶意软件通信提供了新的机会。本研究提出了一种新颖的两阶段深度学习框架,该框架集成了自编码器(AE)与门控循环单元(GRU)和长短期记忆
DNS over HTTPS(DoH)的采用通过加密DNS查询显著提升了用户隐私,但也为攻击者隐藏基于域名生成算法(DGA)的恶意软件通信提供了新的机会。本研究提出了一种新颖的两阶段深度学习框架,该框架集成了自编码器(AE)与门控循环单元(GRU)和长短期记忆网络(LSTM),用于检测和分类DoH流量中的DGA恶意软件。第一阶段采用AE进行降维和最优特征提取,随后结合随机森林(RF)重要性评分和互信息(MI)的混合特征选择方法。第二阶段利用LSTM和GRU进行恶意软件家族的二元和多类分类。为确保稳健评估,研究人员采用了分层k折交叉验证(k=5),并对训练数据应用了时序合成少数过采样技术(tSMOTE)以解决类别不平衡问题,同时避免数据泄露。所提出的框架在CIRA-CIC-DoHBrw-2020和DoH-DGA-Malware-Traffic-HKD数据集上进行了评估。AE-LSTM在二元分类中达到了0.9958的准确率,而AE-GRU在多类分类中达到了0.9925的准确率。结果表明,该框架能有效识别加密DoH流量中基于DGA的恶意软件,并且在大多数评估指标上优于独立模型。
论文解读:面向DoH加密流量的DGA恶意软件两阶段深度学习检测框架
一、研究背景与问题
域名系统(DNS)是互联网通信的基础,负责将域名映射为互联网协议(IP)地址。传统DNS查询与响应以明文传输,易遭恶意拦截与篡改。为提升安全性与隐私性,业界发展了多种加密技术,其中DNS over HTTPS(DoH)因其增强的隐私特性而得到广泛应用,并被Windows 11、iOS 14和macOS 11等主流操作系统原生支持。
然而,DoH在保护用户隐私的同时,也为恶意行为者提供了新的掩护。域名生成算法(DGA)可自动产生随机域名,用于建立与命令与控制(C&C)服务器的隐蔽通信信道。当DGA与加密流量结合后,传统的基于明文域名字词法、语言学和结构特征的检测方法失效。这是因为DoH将域名和查询内容一并加密,其流量与常规HTTPS流量在443端口上无法区分,使得负载审查不可行。检测必须转而依赖有限的流级特征(如查询时序和流量突发模式),而这些特征往往与合法DoH使用行为重叠。此外,DGA算法的持续演进产生了日益多样化和自适应的域名模式。这些由加密、协议混淆、有限可观测性和不断演变的恶意行为共同构成的挑战,亟需鲁棒的表示学习与时序建模技术。
二、研究方法概述
研究人员提出了一种两阶段深度学习框架。第一阶段采用自编码器(AE)对原始35维DoH流特征进行非线性降维和潜在特征学习,移除网络环境特定特征(如源/目的IP、端口和时间戳),将特征压缩至23维(二元)或25维(多类)。随后引入一种创新的混合特征选择方法,以等权重(各0.5)组合随机森林(RF)重要性评分与互信息(MI)分析,进一步筛选出15个(二元)或18个(多类)最具判别力的特征。第二阶段分别采用长短期记忆网络(LSTM)和门控循环单元(GRU)作为分类器,执行二元(良性vs恶意)和多类(良性、PadCrypt、Sisron、Tinba、Zloader)分类任务。研究使用了CIRA-CIC-DoHBrw-2020和DoH-DGA-Malware-Traffic-HKD两个公开数据集,并通过分层五折交叉验证和时序合成少数过采样技术(tSMOTE)处理类别不平衡问题,防止数据泄露。
三、研究结果
AE变体RNN模型性能(二元分类): 通过对比有无自编码器的模型表现,研究人员发现AE-LSTM取得了最高性能,准确率达0.9958,精确率0.9935,召回率0.9952,F1分数0.9923,ROC-AUC和PR-AUC分别为0.9995和0.9952。AE-GRU准确率为0.9919,同样显著优于未使用AE的独立GRU模型(0.9839)。这表明自编码器对提升分类性能至关重要。
模型准确率与损失曲线: AE-LSTM和AE-GRU的训练与测试准确率均在最初几个周期快速上升,损失值同步下降,随后趋于稳定。AE-LSTM的训练损失从约0.49急剧降至首个周期后的0.16,测试损失则从0.16降至0.10左右,表明模型从一开始就具有良好的泛化能力。AE-GRU在训练过程中波动更少,显示出更稳定的训练行为。
AE-GRU超参数优化: 针对不同优化器(Adam、RMSprop、SGD)、层数(1-4层)和学习率的系统实验显示,Adam优化器配合单层结构和0.001学习率达到最佳性能(准确率0.9960,F1分数0.9889)。随着层数增加,性能逐步下降,四层时准确率降至0.9864。RMSprop在两层时表现良好(准确率0.9914),而SGD在所有配置下均表现不佳,尤其在深层网络中几乎完全失效。
AE-LSTM超参数优化: 类似地,AE-LSTM在Adam优化器、两层结构和0.001学习率下取得全局最优(准确率0.9958,F1分数0.9923)。RMSprop在两层时也能达到0.9931的准确率,但在三层及以上时性能骤降。SGD仅在浅层网络中表现尚可。
多类分类性能: 在多类分类任务中,AE-GRU展现出更均衡的性能,宏平均准确率达到0.9853,加权平均准确率0.9905,宏平均F1分数0.9828,加权平均F1分数0.9843。相比之下,AE-LSTM的宏平均准确率为0.9827,加权平均准确率0.9890。AE-GRU在各类别上的分类一致性更好,尤其在小样本类别(如PadCrypt)上表现更优。
与现有方法的比较: 在与LightGBM、XGBoost、CatBoost和堆叠集成等传统机器学习方法的对比中,所提出的AE-LSTM和AE-GRU在大多数评估指标上均实现了超越。例如,在二元分类中,AE-LSTM的准确率(0.9958)高于LightGBM(0.9912)和堆叠集成(0.9919)。在多类分类中,AE-GRU的加权平均F1分数(0.9874)同样优于所有对比方法。
四、讨论与结论
讨论部分指出,自编码器通过非线性降维能够捕捉高维DoH流特征中的复杂交互关系,同时抑制噪声,这是传统线性方法(如主成分分析PCA)难以实现的。混合特征选择策略结合了RF对非线性关系的捕捉能力和MI对统计依赖性的度量能力,比单一特征选择方法更具优势。LSTM和GRU的时序建模能力使其能够有效捕获DGA恶意软件通信中的时间动态模式。研究还强调了分层交叉验证和tSMOTE在保持类别分布和防止数据泄露方面的重要性。
研究结论:本研究提出了一种新颖的两阶段深度学习框架,通过整合自编码器与LSTM和GRU网络,专门用于加密DoH流量中基于DGA的恶意软件检测与分类。自编码器执行非线性降维和潜在特征学习,随后通过混合特征选择进一步精炼特征空间,最后由LSTM或GRU完成分类。在CIRA-CIC-DoHBrw-2020和DoH-DGA-Malware-Traffic-HKD数据集上的广泛实验表明,AE-LSTM在二元分类中达到0.9958的准确率,AE-GRU在多类分类中达到0.9925的准确率,性能优于现有的树模型和堆叠集成方法。该框架具备亚毫秒级推理延迟和较小的内存占用,可部署于网络网关、企业监控点或云安全分析平台,实现对加密DoH流量的近实时连续监测。