✨ 要点🔬 技术摘要
想象一下,你拥有一支由世界级专家组成的团队,每位专家都是特定领域的宗师。其中一位是数学天才,另一位是编程奇才,第三位是网络安全侦探,第四位是科学研究员。他们单打独斗时都极其出色。但如果能雇佣一位超级聪明的管理者 ,他知道在遇到每种问题时该向哪位专家求助,并知道如何让他们协同工作,那会怎样?
这正是 Sakana Fugu 的核心所在。
根据 Sakana AI 的技术报告,Fugu 不仅仅是一个试图包揽一切的单一巨型大脑。相反,它是一个“指挥家”或“管理者”,负责统筹调度其他强大的 AI 模型(如 GPT-5.5、Claude Opus 和 Gemini)组成的团队,从而比任何单一模型都能更好地解决问题。
以下是关于它的工作原理及功能的简单拆解:
1. 两个版本:“快手服务员”与“大师级主厨”
团队发布了两个不同版本的管理者,旨在满足不同的需求:
Fugu(快手服务员): 这个版本专为日常使用而设计。当你提出一个问题时,它就像一个动作敏捷的服务员,能瞬间识别出厨房里哪位专家最适合处理你的订单。它会挑选一位 专家立即完成任务。它速度快、延迟低,非常适合日常任务,且依然能精准选出最合适的人选。
Fugu-Ultra(大师级主厨): 这个版本适用于那些对速度要求不高、但对结果完美程度要求极高的极难复杂问题。它不仅仅是挑选一个人,而是组建一整支厨房团队 。它可能会要求一位专家起草计划,第二位专家检查数学计算,第三位专家编写代码,第四位专家进行调试。它耗时较长,但它结合了整个团队的长处,来应对那些单个模型无法处理的难题。
2. 它如何学习:“星探”模式
你可能会问:“Fugu 是如何知道哪位专家最擅长处理哪类工作的?”
论文解释说,Fugu 的训练过程就像是一个星探 。
训练过程: 研究人员给 Fugu 管理者提供了数千个问题。他们观察了不同的专家(即“工人”)在每个问题上的表现。
学习过程: Fugu 学习到了其中的规律。例如,它学到了“Gemini 在科学问题上表现卓越”,而“GPT 是复杂的数学高手”,以及“Claude Opus 最擅长发现安全漏洞”。
结果: Fugu 并没有死记硬背答案,而是学会了**路由(分发)**问题。它观察你的问题,思考:“啊,这需要一位数学专家,”然后立即将其发送给正确的模型。
3. 它的能力:“瑞士军刀”效应
报告显示,通过使用这种“团队协作”的方法,Fugu 在许多领域都超越了各个独立的专家。这就像拥有一把瑞士军刀,每一件工具都是该领域的顶尖版本,而且手柄知道何时该抽出哪件工具。
以下是论文中的一些具体案例:
编程与软件: 在 AI 需要修复真实软件漏洞的测试中,Fugu-Ultra 表现最为出色。它会让一个“构建型”模型编写代码,然后切换到“调试型”模型寻找错误,最后再切换回来进行修复。这种往复循环的效果优于任何尝试独自完成任务的单一模型。
科学与数学: 在高难度科学考试(如“人类最后考试/Humanity's Last Exam”)中,Fugu-Ultra 的得分高于各个独立的模型。它知道在物理问题中使用侧重数学的模型,而在生物问题中使用侧重科学的模型。
创造性问题解决: 论文描述了一个测试,AI 需要找出散落在页面上的古老、杂乱的日语字符的阅读顺序。Fugu-Ultra 不仅仅是靠猜测;它编写了一个自定义程序来解决这个谜题,改进了程序,并比任何单一模型都能更好地解决问题。
设计: 它甚至设计了一个可以正常移动的机械相机光圈(镜头中开合的部分),而其他模型设计的方案要么是损坏的,要么是无法运作的。
4. 为什么这很重要:“管弦乐团” vs. “独奏家”
这篇论文的核心观点是,我们并不一定需要构建一个单一的、规模巨大且极其昂贵的超级大脑来获得更强大的 AI。相反,我们可以构建一个懂得如何使用现有大脑的系统 。
传统方式: 试图让一个模型变得如此庞大和聪明,以至于它能完美胜任所有工作。
Fugu 方式: 保留那些专业化的专家(数学家、程序员、科学家),并聘请一位聪明的管理者(Fugu)来协调他们。
论文声称,这种方法使他们能够实现“最先进(state-of-the-art)”的成果——这意味着在困难测试中取得了最高分——而无需从头开始训练一个新的大规模模型。它将一系列专门的工具转化为了一个单一且极其强大的系统。
简而言之: Sakana Fugu 是一个聪明的管理者,它清楚地知道在处理快速回答或复杂的步骤化谜题时,应该调用哪位 AI 专家,从而实现“整体大于部分之和”的智能水平。
技术摘要:Sakana Fugu
问题陈述
前沿大语言模型(LLMs)已在多样化领域取得了专家级表现,但它们也展现出日益分化的专业化特征。例如,某些模型擅长数学推理或定理证明,而另一些则在软件工程、网络安全或算法实现方面占据主导地位。此外,在单一领域内,模型也拥有细粒度的强项(例如,直接算法实现与复杂规划能力的差异)。
目前扩展 AI 能力的方法主要依赖于训练更大、更昂贵的模型。然而,本文认为,下一个前沿可能并不在于单一的单体模型,而在于能够识别、组合并放大多个专业化模型互补优势的系统。此外,虽然“智能体支架”(agentic scaffolds,如结构化提示、工具使用、环境反馈)增强了单个模型的性能,但这些通常是固定的、特定任务的系统。我们需要一种能够动态编排智能体团队的系统,能够根据每个查询的具体需求,调整工作流、通信拓扑和工具使用,从而有效地将集体智能视为超越原始模型规模的一个可扩展维度。
方法论
Sakana Fugu 是一个学习型编排器模型家族,旨在通过单个模型接口暴露多智能体系统。Fugu 模型并非要求用户设计工作流,而是动态地在候选的前沿 LLM 工作者池之上构建“智能体支架”。该系统发布了两个针对不同运行点优化的变体:Fugu (延迟感知型)和 Fugu-Ultra (性能优先型)。
1. Fugu:平衡性能与延迟
Fugu 专为交互式使用设计,通过为每个输入选择单个工作者来最小化延迟,同时最大化选择最强能力智能体的概率。
参数化: Fugu 使用预训练的语言模型作为骨干网络,并在最终隐藏层附加了一个轻量级的选择头。与以往分配角色的协调器不同,Fugu 的头部输出 L L L 个工作者模型的逻辑值(logits),从中选择一个作为工作者。为了高效适配骨干网络而不进行全量微调,系统采用了奇异值微调(singular-value fine-tuning) ,仅训练所选参数矩阵的奇异值缩放因子。
训练范式:
监督微调 (SFT): 模型在单步任务(编程、数学、推理)上进行训练。标签是通过在任务上运行所有工作者模型,并根据其相对于标准答案的表现进行排序生成的。编排器被训练用于预测工作者的软概率分布(通过 softmax),而非硬性的单一标签,从而提供更丰富的信号。
进化优化: 在 SFT 之后,Fugu 通过 sep-CMA-ES (可分离协方差矩阵自适应进化策略)在端到端的多轮任务(例如带有工具使用和环境反馈的编程助手)上进行优化。这一阶段优化了交互轨迹的预期终端奖励,使模型能够学习诸如工具可靠性和迭代调试等实际能力,而这些是静态基准测试无法捕捉到的。
2. Fugu-Ultra:性能优先
Fugu-Ultra 专为复杂的、多步骤的工作负载设计,其中答案质量高于延迟要求。它基于 Conductor 框架构建,该框架可以生成自然语言形式的智能体工作流。
工作流生成: 编排器输出一系列工作流步骤,定义子任务、分配特定的工作者智能体,并指定访问列表(即哪些之前的输出会被包含在上下文中)。这允许任意的拓扑结构,从顺序链到并行树。
训练: 使用 GRPO (组相对策略优化)在以惩罚格式错误并奖励正确完成任务为目标的奖励函数上进行训练。
高级记忆与隔离:
工作流内隔离: 为了防止“编排崩溃”(即第一个智能体的轨迹偏置了后续所有智能体),单个工作流内的智能体是相互隔离的。它们只能看到由访问列表明确许可的上下文,从而保留了独立的解题路径。
持久共享记忆: 智能体保留跨越不同 工作流(多轮对话)的交互记忆,以避免冗余的工具调用并维持上下文,同时在当前工作流内部保持隔离。
智能体池: 系统编排了一个多样化的前沿模型池(例如 Gemini-3.1-Pro, Claude-Opus-4.8, GPT-5.5)。
核心贡献
编排作为扩展维度: 本文提出,模型编排是相对于增加模型规模的一个互补的扩展维度。研究表明,组合现有的专业化模型可以产生超越最佳个体模型的性能,且无需新的训练过程或参数访问权限。
动态、查询自适应的支架: 不同于固定的智能体框架,Fugu 模型能够针对每个查询动态地设计支架(包括路由、拓扑、通信策略)。这包括选择最优的聚合器(例如,在数学密集型任务中使用数学专家模型进行聚合,而在琐事检索任务中使用事实检索专家)。
生产级系统: 本报告详细介绍了将多智能体研究概念转化为能够处理现实世界交互任务的生产系统的基础设施和设计原则(例如,用于提高效率的奇异值微调、用于增强鲁棒性的进化策略)。
两级发布: 引入 Fugu (低延迟、单智能体选择)和 Fugu-Ultra (高性能、多智能体工作流)为不同的使用场景提供了实用的选择。
结果
Fugu 模型在多项具有挑战性的基准测试中进行了评估,其表现通常优于最先进的前沿模型和专有“预览版”模型。
智能体编程: Fugu-Ultra 在 SWE-Bench Pro (73.7%) 和 Terminal Bench 2.1 (82.1%) 上达到了最先进水平,超过了紧随其后的公开模型 5-6 个百分点。它展示了细粒度的适应性,能够在构建时使用 GPT-5.5,在调试时切换至 Claude-Opus-4.8。
科学推理: Fugu 和 Fugu-Ultra 在 GPQA-Diamond 上均达到了 95.5% ,超过了 Gemini-3.1-Pro (94.3%) 和 GPT-5.5 (93.6)。系统成功地将数学密集型子任务路由至 GPT,并将科学密集型任务路由至 Gemini。
其他基准测试:
LiveCodeBench Pro: 90.8% (Fugu-Ultra) 对比 88.4% (GPT-5.5)。
CharXiv Reasoning: 86.6% (Fugu-Ultra) 对比 84.1% (GPT-5.5)。
Humanity's Last Exam: 50.0% (Fugu-Ultra),超越了所有基准模型。
定性任务:
AutoResearch: 在自主机器学习训练优化中,Fugu-Ultra 实现了比单模型基准更低的验证比特/字节 (0.9774),展示了在长程搜索中的卓越一致性和峰值性能。
古典日语阅读: Fugu-Ultra 在恢复散乱古典日语字母的阅读顺序方面,平均归一化编辑距离 (NED) 为 0.776,显著优于最佳的前沿基准 (0.642)。
CAD 生成: Fugu-Ultra 持续生成机械有效且完整的 CAD 设计(例如照相机光圈机构),而其他模型往往产生不完整或结构脆弱的结果。
意义与主张
论文声称,Sakana Fugu 代表了获取和扩展前沿 AI 能力方式的一种转变。
能力的民主化: 通过在行为层面而非参数层面组合模型,Fugu 可以整合闭源前沿模型和异构供应商,而无需访问它们的权重。这使得前沿能力更加模块化且易于获取。
经济与地缘政治影响: 作者指出,将编排视为一个扩展维度,可以使前沿 AI 的收益得到更广泛的分配,使组织能够在不需要训练超大规模模型所需的巨大计算资源的情况下,实现高性能。
集体智能: 该工作验证了“集体智能”是协调的模型集合中产生的一种涌现属性。它证明了系统可以像最强的程序员一样编写软件,像最强的数学家一样进行推理,并能动态决定何时部署每种模型,从而有效地从现有组件中创造出一个“超级智能体”。
作者将 Fugu 定位为迈向未来的一步,在那个未来,AI 的进步不仅依赖于训练更大的模型,还依赖于学习如何通过动态的、查询自适应的支架让专业化模型进行协作。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。