Mosaic: Modular Orchestration of Specialised AI Components
该论文提出了 MOSAIC,一种模块化架构,通过模型规模替换、早期终止和累积部分解析等机制,利用硬编码编排逻辑与专门的小型组件构成的严格层级结构来取代昂贵的尖端语言模型,从而在实现相当准确度的同时显著降低推理成本。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能的世界最近一直被一个强大的理念所主导:让模型变得更大。通过增加越来越多的数字“神经元”,研究人员创造出了能够回答几乎任何问题的系统,从写诗到解决复杂的物理问题。这些大型系统通常被称为“前沿模型”(frontier models),它们能力极其强大,但也伴随着沉重的代价。运行它们需要海量的计算能力和能源,这使得即使是处理最简单的任务,使用它们也显得非常昂 expensive。这引发了科学家们的一个根本性问题:是否总是需要使用最强大的引擎,还是说,一组较小的、专门化的工具,配合一个聪明的计划,也能完成同样的工作,且成本仅为一小部分?
一位名叫 Nabil Islam 的研究人员提出了一个回答这个问题的新方法,并在一份名为“MOSAIC”的报告中进行了阐述。MOSIC 建议,与其依赖一个巨大的单一大脑来解决所有问题,不如构建一个将查询分解为更小的部分,并将其移交给不同的、较小的专家来处理的系统。其核心思想是,一个大型通用模型就像一把瑞士军刀:它无所不能,但如果你只需要剪一段绳子,它就显得笨重且低效。MOSAIC 提议使用一把专用的剪刀来执行该特定任务,但前提是必须有一个聪明的管理者首先决定剪刀是合适的工具。该报告并未展示一个已经在现实世界中经过测试的成品。相反,它提供了一个详细的蓝图和一套关于这种系统如何运作的假设,认为它会比现有方法更高效,同时保持高准确度。
MOSAIC 系统建立在一个严格的层级结构之上,这是一种高级说法,意指它有一个清晰的指挥链。在最顶端坐落着一个“前沿模型”,这是一个大型的、通用的 AI,作为用户接触的第一点。当用户提出问题时,这个顶层模型并不会尝试独自解决它。相反,它会将请求传递给一层“助手”(Assistants)。这些助手本身不是 AI 模型;它们是人类编写的固定、不可更改的规则。它们的唯一职责是观察请求,并决定如何将其分解。如果一个问题很宽泛,顶层助手可能会将其拆分为两个或三个更具体的小问题。然后,它将这些较小的任务向下传递给下一层的助手。
这个过程会沿着线路向下持续进行。第二层助手会针对特定的领域(如数学或历史)将任务进一步细分,直到到达第三层。在这一底层,任务变得如此具体和明确,以至于可以直接交给一个“专业化模型”(Specialised Model)。这些是仅针对某一特定学科(如纯数学或某种特定编程语言)进行训练的小型 AI 模型。因为它们规模小且专注,所以运行起来比巨型模型便宜得多,也快得多。一旦专业化模型给出答案,结果会沿着链条传回,由助手检查工作是否完成。如果答案足够好,系统就会停止;如果不够好,它会再次尝试,但会在严格的限制内进行,以确保过程不会陷入死循环。
该设计最重要的特征之一是它避免了让 AI 来决定使用哪种工具的常见错误。在许多其他系统中,一个 AI 模型充当管理者,去猜测应该调用哪个较小的模型。MOSAIC 报告认为这是有风险的,因为管理者 AI 可能会犯错或产生困惑。在 MOSAIC 中,管理者是一套固定的规则。它不进行“思考”或“猜测”;它只是遵循预先写好的脚本来分解任务。这确保了系统不会陷入循环,而这种问题在 AI 代理在没有明确边界的情况下互相交谈时经常发生。报告还强调,一旦任务在较高层级得到解决,系统就会立即停止。如果顶层助手能够回答一个简单的问题,它就不会浪费时间和金钱去调用更深层、更昂贵的层级。
研究人员提出了三种主要方式来节省成本。首先,它使用“模型规模替代”(model-scale substitution),即只要任务允许,就用小型、廉价的模型替换庞大、昂贵的模型。其次,它使用“早期终止”(early termination),这意味着系统一旦找到好的答案就会停止,而不是每次都运行整个流程。第三,它使用“累积局部解决”(cumulative partial resolution),即层级结构中的每一层都解决一部分谜题,这样下一层就只需要解决剩余的部分,而不是从头开始。报告指出,如果这三者协同工作,该系统可以达到与巨型模型相当的准确度,同时仅使用极小部分的计算能力。
然而,作者非常明确地说明了他们尚未完成的工作。这份报告是一个提案,而非结果报告。目前尚未进行任何实验来证明该系统能如描述般运作。研究人员表示,整个想法建立在一个假设之上:即一个由固定规则管理的、由小型专业化模型组成的系统,可以与单个巨型模型一样准确。他们承认,这取决于专业化模型是否非常擅长其特定工作,以及固定规则是否设计得完美。如果分解任务的规则出错,系统就会失败。他们还指出,他们目前还没有一种方法可以解释为什么这些小模型会像大模型一样准确;他们只是在暗示,如果小模型训练得当,它们可能会做到这一点。
报告还涉及了人工智能中的一个常见担忧:如何知道系统对自己的答案是否有信心。许多系统会询问 AI:“你有多确定?”MOSAIC 的作者认为这是一个坏主意,因为 AI 可以非常有信心,但却完全错误。相反,他们的系统依赖于结构。它检查任务是否已被完全分解,以及专业化模型是否确实执行了计算。它不依赖于一种“信心感”。这种方法旨在防止系统给出一个带有虚假确定性的错误答案。
研究人员最后概述了测试其想法的计划。他们提议进行一系列测试,将 MOSAIC 系统直接与标准的巨型模型进行对比。他们不仅会测量系统获得正确答案的频率,还会测量它调用昂贵巨型模型的频率、助手链条需要深入到多深,以及使用了多少计算能力。他们警告说,如果系统被调整得看起来很高效,但最终给出了错误的答案,那么测试就会失败。最终目标是证明,智能并不一定非要昂贵,一个组织良好、由小型专注工具组成的团队可以完成一个巨型全能机器的工作。在这些测试运行之前,MOSAIC 系统仍然是一个引人入胜的理论,是一张关于 AI 可以更便宜、更快、更高效的潜在未来的详细地图,但它尚未成为一个被证实的现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。