← 最新论文
💻 computer science

ER-Curriculum-DDQN for Critical Task Offloading in UAV-MEC via Transparent LEO Relays

本文提出了 ER-Curriculum-DDQN,这是一种深度强化学习框架,该框架通过整合可行性掩码、关键任务压力特征以及预留引导的课程学习,来优化通过透明低轨卫星中继的无人机-边缘计算(UAV-MEC)系统中的在线任务卸载,从而在严格的服务窗口约束下最大化关键任务的完成率。

原作者: Ziang Zhang, Zhenjiang Zhang, Jiaxing Du, Zhaoyuan Liu, Yujie Wang

发布于 2026-09-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziang Zhang, Zhenjiang Zhang, Jiaxing Du, Zhaoyuan Liu, Yujie Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在地面基础设施逐渐消逝的广袤、寂静的天空之中,一种新型网络正在成形。想象一下,一群无人机(即无人飞行器)正盘旋在灾区或偏远的山脉上空,承载着来自传感器和摄像头的沉重数据。这些无人机就像是飞行的计算机,但它们也有极限。为了解决复杂的问题,它们需要将沉重的数据发送到地面或云端的强大服务器中。当地面距离过远或道路被阻断时,这些无人机会仰望星空寻求帮助。它们连接到低轨卫星,这些卫星充当透明的镜子,仅仅是在无人机与遥远网关之间反射信号,而不会在传输过程中停止处理信息。这创造了一个转瞬即逝的桥梁,一个无人机、卫星和地面站三者对齐的短暂窗口。挑战在于,这个窗口既短促又难以捉握。如果无人机试图通过这个桥梁发送一个巨大的非紧急文件,它可能会在整个交易期间锁死整个连接。如果一个关键的紧急消息在桥梁被占用时到达,它无法在任务完成前发送,从而可能错过挽救生命的最后期限。科学家们面临的核心问题是:如何管理这种稀缺且受时间限制的连接,以确保最重要的任务始终能够通过,即使在系统拥挤的情况下也是如此。

北京交通大学和解放军陆军工程大学的研究人员通过设计一种针对这些飞行网络的智能决策系统,解决了这一问题。他们专注于一个场景:二十架无人机协同工作,共享两个地面计算中心和两条卫星路径。系统必须在每个新任务到达的瞬间决定:是在无人机本地进行处理,是发送到附近的地面服务器,还是通过卫星进行转发。难点在于,卫星路径遵循严格的“先到先服务”规则,一旦开始便无法中断。如果一个常规任务被准许进入卫星路径,它会为自己的旅程预留整个连接,从而阻塞任何其他任务(无论多么紧急),直到往返行程结束。研究人员需要一种方法,能够在不知道未来会发生什么任务的情况下,预测何时应该对一个常规任务说“不”,从而为未来的紧急情况保留卫星路径。

为了解决这个问题,团队开发了一种名为 ER-Curriculum-DDQN 的新方法。这是一种通过试错来学习的人工智能,但它拥有一套特定的规则以保持其符合现实。该系统使用一个“可行性掩码”(feasibility mask),它像一个过滤器一样,能瞬间剔除任何不可能的选择。例如,如果卫星窗口已关闭或无人机本地内存已满,系统就根本无法考虑这些选项。这防止了人工智能在因物理约束而注定失败的操作上浪费时间。除了了解什么是可能的之外,系统还会追踪一个“压力”特征。这是衡量近期关键任务对卫星路径需求程度的一个指标。如果系统感知到关键任务频繁到达,它会对让常规任务使用卫星变得更加谨慎,从而有效地为可能到来的紧急情况保留这座桥梁。

学习过程本身由一个“课程”(curriculum)引导,这是一种从简单到困难的教学策略。在训练的早期阶段,AI 被明确告知:如果它允许常规任务使用卫星从而增加了系统的压力,它就会受到惩罚。这教会了 AI 留存资源的价值。随着训练的推进,这种显式的惩罚被逐渐淡化,迫使 AI 内化这一教训,并基于它所学到的模式而非简单的规则来做出正确的决策。目标不仅是完成任务,还要确保最关键的任务能按时完成。

研究人员通过广泛的计算机模拟测试了他们的系统,将其与其他已知方法及简单的基于规则的方法进行对比。他们改变了变量,包括每秒到达的任务数量、卫星窗口持续时间以及任务中关键紧急任务的比例。在每种情况下,尤其是在系统负载沉重或卫星窗口非常短暂的情况下,新方法都优于其他方法。它实现了最高的关键任务按时完成率。例如,当输入任务量很高且卫星窗口很窄时,新系统能完成关键任务的比例约为 69%,而其他方法表现则显著较低。结果表明,通过结合一个针对不可能动作的严格过滤器和一个对未来需求的习得感,系统可以在不需要预知未来的情况下保护最重要的数据。

这项研究证实,在这些高风险、对时间敏感的环境中,最佳策略不仅仅是对现状做出反应,而是要理解连接本身的稀缺性。研究人员发现,仅仅通过给予关键任务更高的权重来优先处理它们是不够的;系统必须理解使用常规任务占用卫星路径的代价。通过使用一种尊重网络物理限制并从历史需求中学习的学习方法,无人机可以做出更明智的选择。这项工作并不声称解决了空间通信中的所有问题,也不承诺能在所有可能的未来场景中奏效,但它展示了一种清晰且有效的方法,用于在时间是最宝贵资源的网络中,平衡常规工作与紧急需求之间的微妙关系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →