Hierarchical Server Architecture for Agentic Science
本文提出了一种利用秘书智能体(secretary agents)的层级化、动态服务器架构,旨在实现跨云、边缘及高性能计算(HPC)系统对多样化计算资源的自动化、并发式发现与协商,从而实现高精度的协商准确率,并支持如 Genesis Mission 等智能体科学工作负载。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
不要将超级计算机的世界想象成一个位于寒冷房间里的单一、巨大的大脑,而要将其想象成一个由不同机器组成的广阔、混沌的宇宙。有些是庞大的传统超级计算机(HPC),它们会进行长达数年的数值计算;有些是灵活的云服务器,可以瞬间启动;还有一些是紧挨着传感器的微型“边缘”设备。几十年来,科学家们不得不充当终极导游,手动检查每一台机器是否拥有正确的软件、足够的内存和合适的网络速度,然后才能开始实验。这就像是在一个所有工具都用不同语言标记的库房里,试图寻找一种特定类型的扳手。
“智能体科学”(Agentic Science)应运而生。这是一种全新的思维方式,在这里,计算机不再仅仅等待指令,而是彼此交谈。与其让一个人询问:“你有 GPU 吗?”,不如让一个聪明的计算机程序(即“智能体”)去询问:“我需要运行一个模拟,它需要一种特定类型的显卡和 500 GB 的内存。谁能帮忙?”你即将阅读的这篇论文探讨了如何构建这样一个系统:通过这些聪明的智能体进行谈判,找到完美的机器,并在无需人类了解全球每台服务器细节的情况下开展工作。
数字媒人服务
在这篇论文中,来自劳伦斯利弗莫尔国家实验室(Lawrence Livermore National Laboratory)的 Vanessa Sochat 和 Daniel Milroy 提出了一种组织这个混沌计算机宇宙的新方法。他们称之为分层服务器架构(Hierarchical Server Architecture)。为了理解它,请想象一家巨大的、跨星系的旅行社。
在过去,如果你想预订一次旅行,你必须逐一给每家航空公司、酒店和火车站打电话,询问他们是否有座位。在本文描述的新系统中,你拥有一个中心枢纽(Hub)(即主要的旅行社)和一群秘书(Secretaries)(为航空公司工作的智能体)。你告诉枢纽你的需求:“我需要明天飞往火星的航班,并配有素食餐。”枢纽并不会亲自去检查飞机,而是会立即同时询问它所有的秘书。
每个秘书都是一个代表特定计算机(即“工作者”)的聪明助手。他们拥有一套特殊的工具包,可以窥探其所属计算机的库存情况。他们会检查:我们是否有正确的软件?内存满了吗?网络够快吗? 然后,他们向枢中枢提交一份提案:“我可以胜任!”或者“我太忙了,”或者“我缺少必要的部件。”
“资源秘书”与 51 件工具
这个系统的魔力在于资源秘书(Resource Secretary),这是一个充当通用翻译器的软件程序。作者构建了一个包含 51 种不同“提供者”(providers)(用于检查存储、内存或软件包等内容的工具)的库。这些工具既适用于真实的计算机,也适用于虚构的模拟计算机。
把这些提供者想象成一组专门的手电筒。一个手电筒检查“Slurm”(一种常见的作业管理器),另一个检查“Kubernetes”(一种云管理工具),另一个检查“Docker”(容器),等等。当一个秘书智能体收到请求时,它会打开正确的“手电筒”,以观察房间里实际有什么。如果用户要求某种特定版本的软件程序,智能体会使用这些工具来查找,而不是仅仅靠猜测。
大规模模拟:20,000 次测试
为了验证这个想法是否真的可行,作者不仅仅是在空谈,他们还进行了一场大规模模拟。他们创建了 200 台具有不同性格的虚拟计算机(工作者):
- HPC 原型: 规则严格的大型传统超级计算机。
- 云原型: 灵活、多样且有时显得混乱。
- 独立运行原型: 像高性能笔记本电脑或边缘设备一样的小型单机。
随后,他们生成了 19,973 次谈判测试。在这些测试中,他们要求智能体为不同详细程度的作业寻找资源。有些请求很模糊(“我需要一台计算机”),而有些则极其具体(“我需要一台拥有 128 个 CPU、1TB 内存、特定网络速度以及名为 'Singularity' 容器的计算机”)。
研究结果:擅长说“不”,却在说“是”时遇到难题
研究结果既有令人印象深刻的成功,也有清晰的教训。
好消息: 智能体在判断一台计算机能否胜任某项工作方面表现得非常出色。它们的整体准确率达到了 87.71%。这意味着当它们说“是的,我可以做这个”或“不,我做不到”时,大部分情况下都是正确的。它们特别擅长识别计算机无法完成任务的情况(例如缺少所需的软件)。
坏消息(以及“为什么”): 智能体出错的主要原因在于它们表现得过于自信。在 1,611 例案例中,智能体判定一台计算机兼容,但实际上并不兼容。主要罪魁祸首是软件版本。
想象一下,用户要求“Python 3.9”。智能体可能会看到安装了“Python 3.9”,但未能意识到该作业所需的特定库实际上是 3.8 版本。智能体混淆了主软件及其依赖项。作者指出,智能体使用的工具需要更加精确,应提供确切的版本号,而不仅仅是提供一个通用的列表。
特异性问题: 智能体在两个极端情况下表现最差:
- 过于模糊: 如果用户只说“我需要一台计算机”,而没有说明需要什么软件,智能体就没有足够的信息做出明智决策。
- 过于具体: 当请求变得非常复杂(例如要求特定的容器技术)时,智能体有时会迷失方向,或者使用了错误的“手电筒”来进行检查,从而导致错误。
选择竞赛:谁能获得这份工作?
一旦智能体找到了能够胜任工作的计算机,系统就必须选出其中的“最优者”。作者将他们的“智能体式”选择策略与 6 种传统策略(如“选择第一个可用的”或“选择最便宜的”)进行了对比。
- 速度: 传统方法速度极快(耗时不到一毫秒)。AI 智能体则慢一些,每次决策大约需要 2.19 秒。作者承认这是一个权衡:AI 更聪明,但需要一点时间来思考。
- 成本: AI 智能体在节省成本方面表现得相当出色。它有时会选择一台稍贵一点的机器,如果这意味着作业能更快完成——这种细微差别是简单的“便宜优先”规则往往会忽略的。不过,作者指出,他们的模拟并未完全考虑到作业在更好机器上运行的速度提升,因此这只是对未来可能性的一个暗示。
结论
这篇论文并不声称已经永久解决了计算机调度问题。相反,它证明了一个分层、基于智能体的系统是管理混合类型计算机的一种可行方式。它表明,我们可以构建一个计算机彼此交谈以寻找合适资源的系统,其准确率接近 88%。
作者总结道,虽然这些“秘书智能体”在排除错误选项方面表现出色,但它们需要更好的工具来处理复杂的软件版本和非常具体的请求。他们还指出,虽然 AI 比简单的规则慢,但其理解上下文和做出灵活选择的能力,使其成为科学领域的强大工具。该系统已准备好在现实世界中接受测试,特别是针对旨在实现自动化科学发现的“创世纪任务”(Genesis Mission)。
简而言之,超级计算机的未来不仅仅在于建造更大的机器;而在于教会它们如何交谈、谈判并为每一项工作找到完美的匹配,同时让人类退居幕后,让智能体承担繁重的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。