基于强化学习的5G/6G网络多指标QoS优化与香农容量集成研究

《Scientific Reports》:Reinforcement learning for multi-metric QoS optimization in 5G/6G networks with Shannon capacity integration

【字体: 大 中 小 】 时间:2026年09月25日 来源:Scientific Reports 4.9

编辑推荐:

  本研究探讨了利用强化学习(Reinforcement Learning,RL)技术在5G和6G无线网络中优化服务质量(Quality of Service,QoS)参数的方法。研究人员采用多阶段实验框架,评估了两代网络中包括延迟、抖动、丢包率、吞吐量、信噪比(

  
本研究探讨了利用强化学习(Reinforcement Learning,RL)技术在5G和6G无线网络中优化服务质量(Quality of Service,QoS)参数的方法。研究人员采用多阶段实验框架,评估了两代网络中包括延迟、抖动、丢包率、吞吐量、信噪比(Signal-to-Noise Ratio,SNR)和误码率(Bit Error Rate,BER)在内的关键QoS指标。在第一阶段,研究人员在5G环境中训练了一个RL智能体,在延迟降低、抖动控制和吞吐量提升方面取得了显著改进。第二阶段的比较分析表明,6G网络在各方面均持续优于5G,表现为更高的RL奖励、更低的丢包率以及更小的抖动和延迟。在最后阶段,研究人员将香农容量(Shannon Capacity)理论集成到RL模型中,进一步增强了6G场景下的传输可靠性和信号质量。基于视频流场景的附加测试证实了6G在支持实时、高可靠性应用方面的卓越能力。总体而言,研究结果表明,经RL优化后的6G网络为未来无线通信系统提供了更加智能、稳健且高效的解决方案。
**研究背景与问题**

随着无线通信系统从5G向6G范式的快速演进,数据传输方式正发生深刻变革。从自动驾驶、扩展现实到工业物联网,实时、高带宽、低延迟服务的需求持续增长,使得服务质量(Quality of Service,QoS)的维持与优化变得日益关键。QoS通过延迟、抖动、丢包率、吞吐量、信噪比(Signal-to-Noise Ratio,SNR)和误码率(Bit Error Rate,BER)等参数衡量,直接决定了现代通信网络的可靠性与效率。然而,传统的基于规则(rule-based)的QoS控制机制往往难以动态适应波动的网络条件和流量模式。强化学习(Reinforcement Learning,RL)作为机器学习的一个子领域,通过智能体与网络环境的持续交互学习最优QoS策略,为上述问题提供了有前景的解决方案。此外,将香农容量(Shannon Capacity)——噪声信道中最大可达数据速率的理论度量——纳入RL优化,可实现数据传输速率与信号质量之间更为智能的权衡。现有文献在多个方面存在局限:缺乏对多指标QoS的联合优化、缺少信息论约束的严格整合,以及缺乏在统一框架下对5G和6G环境的公平比较。本研究正是针对这些不足,构建了融合香农容量感知的RL优化框架。

**研究内容与意义**

研究人员提出了一种基于Q-learning的多指标QoS优化框架,并将其应用于5G与6G模拟环境。该研究将QoS优化问题建模为马尔可夫决策过程(Markov Decision Process,MDP),设计了基于最小-最大归一化的多指标奖励函数,并创新性地将香农信道容量作为动态奖励塑形项(reward-shaping term)和状态特征显式集成。研究采用三阶段实验框架:第一阶段在5G环境中训练RL智能体;第二阶段在相同条件下对比5G与6G中RL智能体的性能;第三阶段将香农容量集成到RL模型中,进一步评估6G在视频流等实时高可靠性应用中的表现。研究结果表明,6G在几乎所有QoS指标上均显著优于5G,且香农容量的集成进一步提升了传输可靠性和信号质量。该研究为未来无线网络中的自主智能QoS管理提供了理论基础和实证支持。

**关键技术方法**

研究人员采用的主要技术方法包括:(1)将QoS优化问题建模为MDP,定义状态空间包含延迟、抖动、丢包率、SNR和BER,动作空间涵盖调度优先级调整、传输速率适配、重传激进程度调节、资源块重配置和发射功率控制;(2)设计多指标加权奖励函数,通过最小-最大归一化处理各量纲差异,并引入权重因子λ将香农容量(CShannon(t) = Blog2(1 + SNR(t)))作为动态奖励项;(3)采用表格型Q-learning算法配合ε-greedy探索策略,通过时序差分规则迭代更新动作价值函数;(4)通过消融实验(ablation study)剥离香农容量项,量化其独立贡献;(5)统一采用相同的流量负载轨迹和距离轨迹作为输入,确保5G与6G场景间比较的公平性。

**研究结果**

**Phase I:5G环境下的QoS优化**

在500个训练回合中,RL智能体在5G模拟环境中成功学习了有效的QoS管理策略。延迟稳定维持在35–45毫秒区间,抖动集中在约3毫秒,丢包率虽存在波动但控制在1%–5%的可接受范围内,吞吐量在2–5 Mbps之间,明显改善了带宽利用率。奖励信号从初始的较低水平逐步提升至60–100区间。Q值热力图显示不同状态-动作对之间存在明确的价值区分度,表明智能体已学习到具有判别性的策略。

**Phase II:5G与6G的RL优化性能对比**

在相同的RL设置下,6G环境在各项性能指标上均显著超越5G。6G延迟保持在20–40毫秒,明显低于5G的60–75毫秒;6G抖动为2–5毫秒,优于5G的4–9毫秒;6G丢包率常低于2%,而5G经常超过3%;6G吞吐量峰值可达约3 Mbps,5G大多低于1 Mbps。统计检验显示,6G的平均延迟(24 ± 1.4毫秒)和平均奖励(92 ± 2.8)与5G(38 ± 2.1毫秒和78 ± 3.2)相比均有显著提升(p < 0.001),效应量大(Cohen's d分别为1.87和2.41)。与静态配置、比例公平调度和轮询调度等非RL基线相比,RL智能体在最后100个回合中的平均奖励显著更高,延迟显著更低。

**Phase III:集成香农容量的RL优化(5G对6G)**

将香农容量集成到奖励函数和状态表示后,6G的优势进一步凸显。6G在信噪比方面保持在30–35 dB,而5G仅为18–25 dB;6G的BER接近零,5G则出现高于0.03的尖峰。延迟、抖动、丢包率和吞吐量的对比结果与Phase II一致,6G在所有指标上均保持更优表现。消融实验表明,移除香农容量项后,智能体的累积奖励降低、延迟增加、丢包率恶化、吞吐量下降,证实了香农容量集成对整体性能提升具有实质性贡献。

**综合QoS指标:5G与6G的视频流对比**

在视频流场景下,6G的延迟约为1毫秒(5G约10毫秒),抖动约0.5毫秒(5G约5毫秒),丢包率约0.1%(5G约1%),SNR约30 dB(5G约20 dB),BER几乎为零。值得注意的是,尽管6G在各项指标上均优于5G,但复合QoS评分中5G反而更高,这一意外结果揭示了当前QoS聚合方法可能存在的缺陷,提示需要重新审视综合评分公式以更准确地反映真实用户体验。

**结论与讨论**

本研究表明,基于RL的QoS优化在5G和6G网络中均有效,且6G凭借其更优越的底层能力与RL智能体的自适应学习相结合,能够在延迟、抖动、丢包率、吞吐量、SNR和BER等几乎所有关键性能指标上持续超越5G。香农容量的集成进一步增强了传输可靠性和频谱效率,尤其适用于高可靠性和实时性要求严苛的应用场景。研究同时指出当前工作的局限性:表格型Q-learning的状态-动作空间规模较小,未能完全反映大规模5G/6G部署的复杂性;模拟环境的参数设置可能较真实部署条件更为乐观。未来研究将向深度Q网络(Deep Q-Network,DQN)、近端策略优化(Proximal Policy Optimization,PPO)等深度RL方法扩展,并结合实时测试平台、软件定义网络控制器、边缘计算平台以及智能反射面和联邦学习等新兴技术,以应对实际部署中的更高维度和非平稳性挑战。
相关新闻
生物通微信公众号
微信
新浪微博
  • 搜索
  • 国际
  • 国内
  • 人物
  • 产业
  • 热点
  • 科普

热点排行

    今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

    版权所有 生物通

    Copyright© eBiotrade.com, All Rights Reserved

    联系信箱:

    粤ICP备09063491号