HADIS: A Hybrid Architecture for Query-Aware Diffusion Model Serving
HADIS 是一个混合扩散模型服务系统,它结合了预生成路由和后生成判别技术,以动态优化模型选择和 GPU 分配,与现有的级联方法相比,显著提升了响应质量并减少了 SLO 违规。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,计算机已经学会了绘画。通过学习数百万张图像以及人们用来描述这些图像的词汇,人工智能系统现在可以根据简单的文本提示生成全新的图像。当用户要求生成“一张代表时间和记忆的超现实主义城市景观”时,计算机并不仅仅是检索一张照片;它会逐像素地构建出一幅图像,这一过程需要巨大的计算能力和时间。这种能力已从研究实验室走向了艺术家和设计师使用的日常工具,但它面临着一个棘手的物流问题:如何在不牺牲最终图像美感的前提下,快速且廉价地处理这些请求。
核心难点在于任务的不可预测性。有些请求很简单,比如“白盘子里的香蕉”,计算机可以很快解决。而另一些请求则非常复杂,需要机器去处理复杂的细节和抽象概念,这个过程耗时更长。如果对每一个请求都运行最高质量、最强大的软件版本,虽然能保证结果精美,但会极其缓慢且昂贵,导致系统因不必要的任务而拥堵。相反,如果对所有请求都使用更快速、更简单的版本,虽然效率很高,但对于困难的请求往往会产生模糊或荒谬的图像。工程师面临的挑战是,如何构建一个能够即时识别哪些请求简单、哪些请求困难,并将它们路由到合适工具的系统,从而避免浪费时间和金钱。
马萨诸塞大学阿默斯特分校的研究人员开发了一种名为 HADIS 的新系统来解决这个确切的问题。他们的工作针对了当前系统处理这些请求时的一个特定缺陷。现有方法通常强制要求每一个请求都必须先通过一个快速、轻量级的软件版本,然后再检查结果是否足够好。如果结果不佳,系统会丢弃该结果并重新使用缓慢、强大的版本开始工作。这种方法在那些注定无法通过快速版本处理的请求上浪费了大量的计算资源。这就像是请一位初级画师去勾勒一幅杰作,结果在进行到一半时才意识到这项任务需要大师出手,然后又把草稿扔掉重新开始。
为了解决这个问题,该团队设计了一种结合了两种不同策略的混合架构。第一部分是一个“路由器”,它在生成任何图像之前先观察文本提示。根据所使用的词汇,它会预测该请求很可能属于简单还是困难。如果请求看起来过于复杂,系统会完全绕过快速、轻量级的版本,直接将请求发送给功能强大、高质量的模型。这通过避免尝试用简单的工具去解决难题,节省了时间和资源。第二部分是一个“判别器”,充当质量检查员。如果一个请求确实进入了快速版本,这个检查员就会检查最终生成的图像。如果图像不符合标准,系统会在用户看到糟糕结果之前捕捉到错误,并将其重新路由到强大的模型。这种两步走的安全网确保了简单的请求处理得又快又好,而困难的请求则能获得所需的关注,且不会在失败的尝试上浪费精力。
研究人员在由十六个强大图形处理器组成的集群上测试了这个系统,使用了来自数千个图像请求的真实世界数据。他们将 HADIS 与几种现有方法进行了对比,包括仅使用快速模型的系统、仅使用慢速模型的系统,以及试图在两者之间切换但没有智能路由器的系统。结果令人瞩目。通过智能地决定何时使用哪种模型,HADIS 比其他系统将生成图像的质量提升了高达 35%。同时,它将未能按时完成的请求数量减少了 27 到 45 倍。这意味着该系统不仅能产生更好的图片,而且在满足用户速度预期方面也更加可靠。
该研究的一个关键洞察是,增加系统的复杂度层级是不必要的。研究人员发现,一个简单的两阶段设置——一个快速模型和一个慢速模型,由他们的混合路由器和检查器进行管理——与拥有三个或更多模型的复杂安排一样有效。这一发现使他们简化了系统的决策过程,使其能够更快地适应不断变化的需求。系统不断监控请求流并实时调整其设置,以确保始终在速度和质量之间取得平衡。
HADIS 的成功表明,服务人工智能的未来不仅在于构建更大的模型,还在于构建更聪明地使用模型的方法。通过在处理之前理解请求的性质,并在处理之后验证结果,该系统避免了困扰现有技术的浪费现象。这种方法使计算机能够以相同的能量和硬件,为更多用户提供更高质量的结果。随着生成式人工智能日益融入日常生活,像 HADIS 这样的系统对于确保这些强大的工具保持快速、经济且可靠,将变得至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。