Decision Transformer for UAV-Mounted RIS-Assisted Dynamic D2D Communications
本文提出了一种基于决策Transformer(Decision Transformer)的框架,用于优化动态D2D通信中的无人机轨迹、姿态及RIS相位,并证明了与传统深度强化学习方法相比,该框架具有更优越的跨场景泛化能力和零样本迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代工厂和仓库拥挤、杂乱的空间里,无线信号往往难以找到清晰的路径。设备在尝试相互通信时,经常会被沉重的机械、储物架或环境的高密度所阻挡。为了解决这个问题,工程师们转向了一种被称为“可重构智能表面”的技术。可以将它想象成一面智能墙或面板,上面覆盖着数千个微小的、可调谐的元件,能够捕捉无线电波并将其精确地反射到目标位置,从而有效地为数据传输创造出一条新的、清晰的路径。虽然这些表面通常是固定安装的,但研究人员现在正在探索如何将它们安装在无人机上。无人机可以飞到完美的位置,并倾斜其表面以从任何角度捕捉信号,提供了一种静态墙壁无法比拟的灵活性。然而,控制一架同时携带复杂且对角度敏感的“镜面”的无人机是一项艰巨的平衡任务,需要对飞行位置、倾斜角度以及如何实时调整镜面表面进行精确计算。
一位研究人员通过开发一种教导这些无人机搭载系统如何做出决策的新方法,解决了这一挑战。他们并没有用僵化的规则来编写无人机的程序,也没有强迫它在每次进入新房间时都从头开始学习,而是使用了一种模仿人类通过观察专家进行学习的方法。他们首先在计算机模拟中训练了多种标准的学习算法,以寻找在各种不同工厂布局下飞行和调整镜面的最佳方式。从这些模拟中,他们挑选出了最成功的“专家”策略,并记录了无人机为实现高性能所采取的精确路径和动作。随后,他们将这些专家经验的集合输入到一个名为“决策 Transformer”(Decision Transformer)的专门学习模型中。该模型不仅仅是记忆数据,它还学习了特定情况如何导致特定动作的底层模式,使其即使在从未见过的房间里也能预测出最佳动作。
研究人员在一个代表密集工业空间的模拟环境中测试了这种方法,该空间面积为 40 x 40 米,高度为 8 米。在这个空间内,四台单天线设备尝试进行通信,并组成配对来交换数据,同时无人机在 4.5 米的高度悬停。系统必须考虑到信号强度会根据电波撞击镜面的角度而变化的这一事实,这在更简单的模型中经常被忽略。无人机的任务是调整其飞行路径、三维倾斜角度以及 16 个反射元件的设置,以最大化设备间的数据流总量。研究人员将他们的新方法与几种其他学习技术进行了比较,其中包括一种仅仅试图模仿来自附近场景的专家行为的技术。结果显示,当给予无人机一个全新的起始位置时,该新方法无需进一步训练即可立即表现出高水平的性能。这种“零样本”(zero-shot)能力显著优于仅仅从相似但不同的场景中迁移策略的表现。
当研究人员允许系统与新环境进行短时间的交互,并根据其观察到的最佳结果对其知识进行微调后,性能得到了进一步提升。在这些测试中,经过微调的系统达到了与专门为该特定房间从头开始训练的系统相同的高水平性能。研究发现,作为系统潜力基准的 DDPG 专家算法实现了约 29.5 bps/Hz(比特每秒每赫兹)的平均数据速率,这一数值明显高于测试中的其他学习方法,后者分别稳定在 25、20.5 和 17 左右。核心发现是,通过预先学习多样化的专家示例,系统可以将其知识泛化到未见的场景中,从而避免了在现实世界中进行昂贵且耗时的试错学习。这表明,未来的无线网络可以使用无人机在复杂的环境中动态修复信号阻塞,以极少的人为干预快速适应新的布局。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。