← 最新论文
💻 computer science

A Priority-Guided Action-Masked Proximal Policy Optimization Framework for Dynamic Scheduling of Electric Power Material Verification Tasks

本文提出了 PPO-TS,一种优先级引导的动作掩码近端策略优化框架,该框架在动态电力材料校验调度合成基准测试中展示了具有统计学意义的改进,尽管同时也揭示了在设备利用率和泛化边界方面的局限性。

原作者: Zhaolei He, Ao He, Cong Lin, Jing Zhao, Liping Gao, Xiang Yin

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaolei He, Ao He, Cong Lin, Jing Zhao, Liping Gao, Xiang Yin

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代电网庞大且轰鸣的基础设施中,可靠性并非一种奢侈品,而是一种必需品。在变压器或电表安装以维持照明之前,必须经过严格的验证程序,这是一种质量控制检查点,通过对每一件设备进行测试,以确保其符合严格的安全标准。这项工作发生在繁忙的中心,那里不断有成批的任务到达,有时还带有紧急的截止日期,而且负责测试的机器可能会突然发生故障或减速。这些中心的运营者面临的挑战不仅是完成工作,还要实时决定哪个任务应该分配给哪台机器。如果选择不当,紧急任务会被延迟,机器在其他机器过载时却处于闲置状态,整个系统也会变得效率低下。几十年来,操作员一直依赖固定的规则来做出这些决策,例如始终优先处理最紧急的任务或等待时间最长的任务。虽然这些规则简单且快速,但在环境变得混乱时,它们难以应对复杂且多变的日常模式。

来自云南电网和昆明理工大学的研究人员开发了一种解决这一问题的新方法,超越了简单的规则,转向一种能够从经验中学习的系统。他们创建了一个计算机模拟系统,模拟验证中心混乱的现实情况,包括随机的任务到达、紧急的中断以及设备故障。研究人员将一个使用近端策略优化(Proximal Policy Optimization)方法训练的人工智能代理引入了这个数字世界。与依靠直觉或僵化清单的人类操作员不同,该代理被教导去观察全局情况——任务的紧迫程度、机器当前的健康状况以及每个作业已等待的时间——然后做出选择。为了防止代理在不可能的操作上浪费时间,研究人员构建了一个过滤器,屏蔽掉任何违反规则的分配方案,例如将任务发送到损坏的机器。随后,该代理会在一组最有潜力的候选名单中,根据一个权衡了等待时长和贡献容量等不同因素的优先级系统,选择最佳选项。

研究将这一学习系统与一种被称为“紧急余量启发式”(emergency-slack heuristic)的强大传统规则法进行了对比,后者优先处理紧急任务和剩余时间最短的任务。研究人员在九种不同的场景下运行了数千次模拟,这些场景涵盖了从平静可预测的一天到频繁发生机器故障和紧急工作激增的混乱时期。结果表明,基于学习的系统通常优于传统的规则法。在任务完成速度和系统吞吐量方面,新方法表现得更出色,它能更快地完成工作,并使更多的物料通过验证线。然而,这并非一场简单的胜利。研究人员发现,虽然新系统速度更快,但它对机器的使用效率实际上较低,导致机器比传统规则法更频繁地处于闲置状态。这表明存在一种权衡:学习代理愿意让机器暂时闲置,只要这意味着它可以为下一个更关键的任务做出更好的选择。

或许最重要的一点是,研究表明这种新系统并非在任何情况下都完美运行的“万灵药”。在一种特定的场景中,学习系统的表现实际上逊于传统规则,导致在该特定设置下的总分较低。此外,当研究人员测试该系统处理更广泛的未知情况的能力时,结果具有不确定性;数据并未提供足够的证据来证明该系统在现实世界中总是更优越。研究结论认为,虽然这种优先级引导的学习框架在测试的模拟环境中提供了速度和吞吐量方面的明显优势,但它也带有特定的局限性。它擅长快速完成任务,但需要对机器使用进行仔细管理,且其成功高度依赖于当天的具体条件。这项工作并不声称已经永久解决了动态调度的问题,而是提供了一个强大的新工具,只要在理解并谨慎应用的前提下,它可以帮助电网运营者应对维持电网安全可靠的复杂且多变的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →