FedTransKD-IDS:用于物联网入侵检测的鲁棒联邦迁移学习与知识蒸馏 大家读完觉得有帮助记得关注和点赞摘要 — 在现代分布式网络环境中尤其是在物联网基础设施和5G网络中严格的隐私保护和可扩展性要求给入侵检测系统带来了重大挑战。尽管联邦学习通过防止数据集中化来保护隐私但在严重的统计异质性和边缘节点的资源限制下其效率和稳定性显著下降。为解决这些限制本研究引入了FedTransKD-IDS框架该框架通过整合基于几何中值的鲁棒聚合、联邦迁移学习和知识蒸馏同时增强了系统的稳定性和效率。在该框架内协作训练的全局教师模型将其特征提取组件迁移给轻量级的学生模型。在异构数据集上的实验评估展示了峰值检测性能达到了99.18%的准确率和99.99%的召回率从而表明了结构化知识迁移在联邦环境中的有效性。关键词 — 入侵检测系统 (IDS)、联邦迁移学习 (FTL)、知识蒸馏 (KD)、物联网 (IoT)I. 引言在过去十年中由云基础设施、物联网、5G网络和智能系统的广泛集成所驱动的数字化转型已将通信网络转变为动态的、完全分布式的和数据驱动的环境[1]。尽管这些进步显著提高了效率和可扩展性但它们同时扩大了攻击面并将网络威胁转变为复杂的、多层次的和混合的模式[2]。因此依赖静态规则或集中式模型的传统入侵检测系统已无法有效应对。此外异构网络的普及导致安全数据在不同节点上生成这些数据具有高度不平衡的统计分布和显著不同的数据量。这种异构性被认为是分布式机器学习中的基本挑战之一导致收敛不稳定和模型泛化能力降低。此外边缘设备上严重的计算资源限制以及流量数据的高度隐私敏感性为完全集中的方法设置了重大障碍。因此设计一个同时确保高可扩展性、对数据异构性的鲁棒性以及高效计算性能的智能框架已成为网络入侵检测领域的关键问题。A. 联邦学习联邦学习FL最近已成为解决分布式环境中数据隐私和可扩展性双重挑战的一种有前景的方法。在FL中各个设备或客户端使用其私有数据训练本地模型然后仅将模型更新共享给中央服务器。服务器聚合这些更新以生成全局模型确保原始数据永远不会离开本地设备。这种去中心化的方法对于物联网和5G网络尤其有利因为将大量敏感数据传输到中央服务器既不切实际也不安全。最近的研究已将FL应用于各种网络安全应用如恶意软件检测、垃圾邮件过滤、网络流量异常检测和入侵检测。这些工作表明FL可以实现与集中式训练相当的性能同时显著降低数据泄露的风险。B. 联邦迁移学习联邦迁移学习FTL是机器学习中的一种新颖方法它解决了传统联邦学习的局限性并能够在不同领域具有不同特征或样本之间进行知识迁移而无需共享原始数据。在该框架中两个独立方——一方拥有丰富的标签数据另一方拥有有限的标签数据——在有限的公共样本和隐私保护技术如加法同态加密或秘密共享的帮助下进行协作。FTL通过神经网络构建一个共享特征空间并通过同时优化预测损失和特征对齐损失来生成高精度模型[3]。C. 知识蒸馏知识蒸馏KD是一种压缩深度学习模型的技术它将大型复杂模型教师的预测知识迁移给更小、更高效的学生模型。该方法主要使用软目标来训练学生模型即由教师模型在高温软最大化温度T 1下生成的类概率分布。这些软目标提供了关于类间关系和教师泛化模式的更丰富信息因此较小的模型可以达到接近教师的性能但计算成本低得多适合部署在资源受限的环境中[4]。II. 相关工作Sheikhi等人[5]提出了一个名为特征感知联邦学习FAFL的框架用于分布式5G网络中的无监督异常检测。通过在每个客户端利用变分自编码器VAE该框架在本地学习正常流量模式无需标签。FAFL的主要创新在于将特征重要性整合到联邦聚合过程中特征重要性使用集成梯度等方法计算与用于差分隐私的高斯噪声聚合然后转换为注意力权重以正确执行模型参数的加权平均。此外还整合了一种动态更新特征重要性的机制以适应数据分布的变化。与在统计异质性下表现不佳的FedAvg和FedProx等传统方法相比FAFL通过关注关键特征和保护隐私展示了更高的效率。对5G数据集的评估表明其在ROC-AUC、F1分数和收敛速度等指标上具有优越性同时也突显了特征可解释性作为一个实际优势。尽管取得了这些进展该方法仍面临诸如易受恶意客户端攻击、数据集大小限制以及在极端异构条件下缺乏理论收敛保证等挑战[5]。Sheikhi等人[6]提出了一种名为混合信誉聚合HRA的先进防御机制用于5G和边缘网络中的联邦学习。HRA由两个主要部分组成几何异常检测用于识别每轮训练中的异常更新以及一个基于动量的信誉系统用于评估客户端随时间的行为。与依赖静态过滤器的传统方法不同HRA通过分析客户端行为区分恶意模式与非均匀或非独立同分布数据引起的良性偏差从而提高了系统在动态和异构环境中的弹性。在大规模数据集一个5G数据集和NF-CSE-CIC-IDS2018基准上的实验验证结果表明HRA在各种攻击下均实现了高准确率分别为98.66%和96.60%并且计算开销可忽略性能显著优于先前的方法。该方法的一个局限性是可能容易受到高度先进的自适应攻击。Maiga等人[7]提出了一种基于深度神经网络的混合联邦框架用于检测5G网络中的DDoS攻击。该方法的新颖之处在于在联邦学习架构中集成了基于XGBoost的特征工程与混合深度学习模型BiLSTM、GRU和LSTM实现了无需交换原始数据的协作训练。实验结果显示出99.61%的准确率、0.046%的假阳性率和低于一毫秒的检测延迟表明其性能优于相关方法。然而依赖模拟数据集、无法检测零日攻击以及缺乏先进的隐私保护机制被认为是本研究的主要局限性。Zeytouni等人[8]提出了一种基于联邦学习的入侵检测系统用于5G和6G网络通过利用FedAvg聚合算法有效解决了异构非IID数据带来的挑战。在该框架中边缘设备使用5G-NIDD数据集的流量特征训练本地模型并通过基于准确率和信任水平的动态加权在中央服务器上聚合旨在减少恶意客户端的影响。另一方面在聚合过程中注入高斯噪声以确保差分隐私。实验结果报告了96.34%的检测准确率、识别出92.9%的恶意流量以及对模型投毒攻击的高鲁棒性和低计算开销。尽管如此对模拟环境的依赖以及缺乏对未知零日攻击的综合评估仍然是该研究的主要局限性。Alalyan等人[9]提出了一种安全的点对点联邦学习框架用于在O-RAN网络中检测DDoS攻击该框架基于分层RIC架构和用于隐私保护的加密平均计算机制。在这种方法中通过智能地为聚类选择更高质量的客户端并对其余节点应用迁移学习显著降低了通信成本。在真实5G测试平台上的评估展示了高准确率和实时处理能力然而半诚实客户端的假设以及可能忽略罕见数据仍是该方法的主要局限性。研究[10]提出了一种用于入侵检测的联邦迁移学习框架该框架在分布式架构中集成了包括随机森林、AdaBoost和XGBoost在内的集成模型。一个基于CIC-IDS-Collection数据集预训练的全局模型在本地网络上进行微调更新后的参数被迭代聚合到中央模型中从而能够在保护数据隐私的同时适应不断演变的攻击。然而所提出的框架很大程度上仍停留在概念层面评估主要基于理论性能分析而非广泛的实证验证。联邦学习通过依赖本地训练和参数交换减少了通信开销同时保护了隐私并防止原始数据传输然而它面临着诸如严重的统计数据异构性非IID、收敛不稳定、每个节点的数据量和多样性有限以及在边缘设备上训练完整模型的高昂计算成本等挑战。在经典设置中每个节点实际上是从头开始学习由于本地数据不足以提取深度和可泛化的表示即使在聚合之后全局模型在准确性和稳定性方面仍然次优需要更大的模型和更多的通信轮次来弥补这些缺陷。因此通过利用联邦迁移学习并从预训练模型或更丰富的领域迁移知识表示可以减少由数据稀缺引起的方差加速收敛并限制可训练参数的数量从而降低通信成本并提高异构条件下的稳定性。最后为了确保与资源受限节点的兼容性采用知识蒸馏将知识从大型模型迁移到轻量级模型从而在保持准确性的同时最小化计算成本、能耗和执行延迟。为此本文提出了FedTransKD-IDS方法。III. 提出的方法A. 数据集概览在本研究中BoT-IoT数据集被用作主要来源之一。该数据集是为了模拟物联网环境而开发的由实验室环境中生成的真实网络流量组成主要关注僵尸网络相关攻击。其训练数据分为五个部分总共包含超过73,000条网络流记录。该数据的主要特征包括协议类型主要是TCP和UDP、每个方向的数据包和字节数、流持续时间以及连接状态。该数据集的类别分布极度不平衡超过90%的记录属于攻击类别。其中DDoS攻击类别占主导地位约占68-75%其次是数据窃取类别约占20-25%。相比之下代表正常流量的记录占比非常小不到10%。这种严重的不平衡构成了建模过程中的主要挑战并凸显了采用类别不平衡处理技术的必要性。UNSW-NB15数据集提供了更多样化的现代攻击类型除了正常流量外还包括九种攻击类别。在本研究中使用了其四个子集。首先均匀子集通过有针对性的抽样设计实现了大致平衡的类别分布包含五个分区能够在接近平衡的条件下评估模型其中正常流量与侦察、DoS和通用等类别所占份额相对均匀。接下来imbalance1和imbalance2子集更加不平衡总共包含超过1,200,000条记录在这些子集中正常流量约占50-55%而侦察和DoS攻击占有显著份额。从imb1到imb2不平衡程度增加从而模拟了更真实的网络场景。为了评估模型性能使用了独立的测试集。对于BoT-IoT使用了约3,000条记录的Bot_test文件其分布与训练数据相似以DDoS和窃取攻击为主适合用于检查模型在僵尸网络环境中的泛化能力。对于UNSW-NB15选择了超过82,000条记录的DET_TEST集作为测试数据其中包括利用、通用、模糊器和侦察等多种攻击能够评估模型在面对现代攻击和更真实分布时的鲁棒性。这些测试集补充了训练数据并增强了所获得结果的有效性。B. 数据处理本文针对BoT-IoT和UNSW-NB15数据集开发了两个不同的预处理函数以有效地为基于卷积神经网络CNN的分类准备原始网络数据。这两个函数的关键共性在于处理的主要阶段根据有效协议和连接状态过滤记录提取并将二元标签转换为one-hot编码对偏斜的数值特征应用对数变换以归一化分布对分类变量进行one-hot编码同时保持固定维度总共24个特征使用StandardScaler进行特征标准化最后重塑为四维数组以将特征向量解释为类似图像的CNN输入便于提取局部入侵模式。尽管有基本的相似性但每个函数特定的差异源于数据集独特的结构。BoT-IoT函数通过标准化列名例如转换saddr/daddr/dport、直接从攻击列提取标签、更健壮的端口处理处理NaN、十六进制和浮点值、简化本地IP地址以及明确移除冗余的one-hot列以避免维度不一致而得到优化。相反用于多样化UNSW-NB15数据集的函数则侧重于直接的列命名srcip/dstip/dsport、标签来源以及更复杂的IP地址处理包括更广泛地处理十六进制情况使其更适合这些数据集内增加的数据多样性。C. FedTransKD-IDS鉴于该领域讨论的挑战本研究旨在提供一种能够有效解决这些问题的全面且创新的方法。所提出的方法通过创造性地结合联邦迁移学习和知识蒸馏技术来实现预期目标。这种方法使得在联邦环境中能够将知识从强大的教师模型迁移到更轻量、更紧凑的学生模型使得客户端节点可以在本地执行高效且优化的模型而不会牺牲联邦迁移学习的关键优势。所提出的基础模型同时作为教师模型和联邦迁移学习框架内的主要模型是在BoT-IoT数据集上使用联邦学习进行训练的。如图1所示该过程从数据预处理开始然后是全局模型的初始化。训练随后在满足Server_round Num_rounds条件的情况下进行全局轮次在每一轮中服务器首先将全局模型广播给客户端。客户端使用热启动对接收到的模型进行特定数量的本地周期训练并将结果更新权重或梯度返回给服务器。接收到这些更新后服务器使用几何中值方法对其进行鲁棒聚合计算并记录性能指标并更新全局模型。每轮结束时Server_round计数器递增此循环持续到指定轮次完成之后记录报告并保存最终模型。此外采用几何中值提高了模型在面对数据异构性和潜在恶意客户端时的稳定性和鲁棒性。在联邦学习聚合中当存在异常或潜在的恶意客户端更新时几何中值被用作简单平均的鲁棒替代方案。给定来自n个客户端的本地模型更新 {w1,…,wn}聚合模型w* 通过解决优化问题1获得。(1)其中 ∥⋅∥2 表示欧几里得范数。通过最小化距离之和而非平方距离之和该方法降低了对异常更新的敏感性使其特别适用于异构环境和具有拜占庭鲁棒性的联邦设置。在FedTransKD-IDS方法中预训练的教师模型被用作全局知识源。其最后几层被移除特征提取组件被冻结作为本地节点的共享主干。对于每个节点构建一个学生模型由这个固定的主干和几个专用的全连接层组成。经过预处理步骤——包括过滤、数值特征归一化和分类特征编码——每个节点的数据被转换为标准输入格式。该架构的目标是将知识从全局模型迁移到具有不平衡和异构数据分布的本地环境同时降低本地学习成本。如图2的实现流程图所示训练过程包括对验证数据的初始评估然后逐周期使用混合知识蒸馏损失函数进行训练该函数包括来自真实标签的硬损失和教师与学生输出在温度T下的KL散度。在每个周期中将验证准确率与先前的最佳值进行比较如果观察到改进则保存模型并重置耐心计数器否则计数器递增。如果未改进的次数达到阈值则触发早停。该机制防止过拟合并确保为每个节点选择最佳权重。最终为数据集的每个部分保存一个优化模型该模型已在本地高效地吸收了全局模型的知识。图1. 基础模型联邦学习过程流程图图2. FedTransKD-IDS框架IV. 性能评估A. 实验环境该研究实验在Google Colab环境中进行运行时CPU配备Intel(R) Xeon(R) CPU2.20 GHz处理器和13.61 GB主内存。使用的编程环境是Jupyter Notebook与Python 3集成在Colab中作为运行实验的框架。采用仅CPU的执行设置而不是依赖GPU加速器提供了更接近资源受限边缘设备的条件并允许评估模型行为而不依赖于专用硬件。此外在所提出的联邦架构中模型训练和聚合在服务器端执行而物联网节点仅负责执行训练好的模型。因此将实验结果映射到真实物联网环境主要需要在目标设备上部署兼容的机器学习库和Python运行时而无需物联网节点本身进行密集计算处理。下一节将讨论输出结果。B. 评估指标与结果鉴于所提出的方法属于人工智能领域系统评估指标包括精确率、准确率和召回率以及F1分数。混淆矩阵混淆矩阵是用于分类型人工智能模型的评估参数。它通过将样本的真实标签与系统对这些样本的预测进行比较来构建如2所示。该表由以下部分组成TP——真阳性TN——真阴性FP——假阳性和FN——假阴性[7]。混淆矩阵 [ ; ] (2)准确率反映机器学习方法正确预测结果频率的指标称为准确率。准确率的计算方法是将正确预测的数量除以总预测数量如3所示[7]。准确率 () / () (3)召回率召回率是识别数据集中所有相关实例的能力。它定义为真阳性与真阳性和假阴性之和的比率如4所示[7]。召回率 / () (4)精确率精确率是衡量机器学习方法有效性的指标。它表明算法阳性预测的准确性。它定义为真阳性与阳性预测总数的比率如5所示[7]。精确率 / () (5)F1分数F1分数是精确率和召回率的平衡平均值。它将精确率和召回率结合成一个指标如6所示以提高对所提出框架有效性的理解[7]。F1分数 2 × (召回率 × 精确率) / (召回率 精确率) (6)在本节中FedTransKD-IDS框架在三个不同的数据集上进行了评估。鉴于每个场景中存在多个节点以及联邦环境选择节点零作为代表性节点来呈现场景的混淆矩阵。这些矩阵如图3所示。包括准确率、召回率、F1分数和精确率在内的其他性能指标直接根据这些矩阵的值计算并在下文进行分析。在本节中基础模型在BoT-IoT数据集上进行训练。如前几节详细讨论的FedTransKD-IDS框架的性能在四个不同的模型和四个不同的场景中进行了评估。图4至图11展示了在这些不同场景下所有节点0到4的关键性能指标包括准确率、召回率、F1分数和精确率。图3. 不同数据集分布下节点0分类的混淆矩阵(a) BoT-IoT(b) Uniform(c) Imbalance1(d) Imbalance2图4. FedTransKD-IDS在BoT-IoT场景上的准确率指标图图5. FedTransKD-IDS在其他三个场景上的准确率指标图图6. FedTransKD-IDS在BoT-IoT场景上的精确率指标图图7. FedTransKD-IDS在其他三个场景上的精确率指标图图8. FedTransKD-IDS在BoT-IoT场景上的召回率指标图图9. FedTransKD-IDS在其他三个场景上的召回率指标图图10. FedTransKD-IDS在BoT-IoT场景上的F1分数指标图图11. FedTransKD-IDS在其他三个场景上的F1分数指标图仔细检查这些图表表明所提出的模型在两种情况下都表现出非常强劲和稳定的性能——即当数据与训练数据集相似时以及当数据完全不同且存在严重类别不平衡时。在大多数情况下即使在具有挑战性的条件下也能达到0.98以上的值这证明了该框架在处理异构和多样化数据时具有高泛化能力和显著的鲁棒性从而证实了所提出方法在现实环境中的优越性。V. 结论FedTransKD-IDS框架旨在解决联邦入侵检测中的数据异构性、隐私要求和计算限制。通过整合基于几何中值的鲁棒聚合、全局特征迁移和知识蒸馏该框架实现了稳定收敛以及在边缘节点上高效部署轻量级模型。结果表明将全局模型的一部分迁移到本地模型显著降低了计算和通信成本同时在非独立同分布条件下有效保持了检测性能。这些发现表明在联邦架构中将迁移学习与模型压缩相结合显著增强了分布式安全系统的可扩展性和运营能力。

相关新闻

最新新闻

从H桥到FOC:电机驱动与控制全链路工程实践指南

从H桥到FOC:电机驱动与控制全链路工程实践指南

在机器人、自动化、无人机和智能硬件领域,电机驱动与控制是连接数字指令与物理动作的核心桥梁。无论是让机械臂精准抓取,还是让无人机稳定悬停,其背后都离不开对电机转矩、转速和位置的精确控制。然而,从原理图上的一个H桥电路&am…

2026/9/1 8:21:40
OpenCV相机标定实战:张正友标定法原理与代码实现

OpenCV相机标定实战:张正友标定法原理与代码实现

简介:一套完整的张正友相机标定OpenCV实现源码,基于Visual Studio工程组织,面向计算机视觉入门及中级开发者,适合需要掌握相机标定、内参外参求解与畸变矫正的读者。代码附带详细注释,并配有棋盘图和14张不同角度标定图…

2026/9/1 8:21:40
Excel VBA实战入门:30天从零到自动化,告别重复性表格操作

Excel VBA实战入门:30天从零到自动化,告别重复性表格操作

每天面对成百上千行的Excel表格,重复着复制、粘贴、筛选、汇总的机械操作,你是否感到疲惫不堪?当领导临时要求从几十个部门报表中快速合并数据并生成分析图表时,你是否只能加班熬夜手动处理?如果你曾幻想过让Excel自动…

2026/9/1 8:21:40
基于深度学习的人脸识别签到系统设计与实现全解析

基于深度学习的人脸识别签到系统设计与实现全解析

简介:一份基于深度学习的人脸识别签到系统完整项目源码,面向计算机相关专业毕业设计、课程设计以及人脸识别应用开发者。项目利用dlib等深度学习模型实现人脸检测、特征提取与比对,完成自动化身份验证与签到考勤,能够有效应用于课…

2026/9/1 8:21:40
【Qt教程31】GCC 9.3.1 ARM64 下含 QString 结构体的隐式拷贝构造崩溃

【Qt教程31】GCC 9.3.1 ARM64 下含 QString 结构体的隐式拷贝构造崩溃

【Qt教程31】GCC 9.3.1 ARM64 下含 QString 结构体的隐式拷贝构造崩溃故障概况触发条件(经实际验证)验证过程最简复现无效的尝试有效的修复(二选一)根因修复建议复现 Demodemo_bug.hdemo_fix_a.h —— 方案 A:QString …

2026/9/1 8:21:40
别被网红 AI 坑!2026 实测学术 AI 排行榜,避开延毕风险

别被网红 AI 坑!2026 实测学术 AI 排行榜,避开延毕风险

每到毕业季很多同学纠结,到底哪款 AI 适合写论文、可以用来定稿、不容易翻车。AI 工具迭代速度很快,网上很多旧测评已经失去参考价值,不少网红工具实际翻车案例越来越多。对标 2026 高校查重 AIGC 双审新规,统一测试条件&#xf…

2026/9/1 8:16:39