← 最新论文
🤖 machine learning

Sakana Fugu Technical Report

本文介绍了 Sakana Fugu,这是一个编排器语言模型家族,它通过动态构建智能体支架来结合并放大多个大语言模型的专业能力,从而在各类具有挑战性的基准测试中实现了最先进的性能。

原作者: Yujin Tang, Edoardo Cetin, Jinglue Xu, Qi Sun, Stefan Nielsen, Vincent Richard, Haruto Goda, Iaroslav Tymchenko, Nhan Nguyen, Hyunin Lee, Mari Ashiga, Shashank Kotyan, So Kuroki, Tarin Clanuwat

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yujin Tang, Edoardo Cetin, Jinglue Xu, Qi Sun, Stefan Nielsen, Vincent Richard, Haruto Goda, Iaroslav Tymchenko, Nhan Nguyen, Hyunin Lee, Mari Ashiga, Shashank Kotyan, So Kuroki, Tarin Clanuwat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支由世界级专家组成的团队,每位专家都是特定领域的宗师。其中一位是数学天才,另一位是编程奇才,第三位是网络安全侦探,第四位是科学研究员。他们单打独斗时都极其出色。但如果能雇佣一位超级聪明的管理者,他知道在遇到每种问题时该向哪位专家求助,并知道如何让他们协同工作,那会怎样?

这正是 Sakana Fugu 的核心所在。

根据 Sakana AI 的技术报告,Fugu 不仅仅是一个试图包揽一切的单一巨型大脑。相反,它是一个“指挥家”或“管理者”,负责统筹调度其他强大的 AI 模型(如 GPT-5.5、Claude Opus 和 Gemini)组成的团队,从而比任何单一模型都能更好地解决问题。

以下是关于它的工作原理及功能的简单拆解:

1. 两个版本:“快手服务员”与“大师级主厨”

团队发布了两个不同版本的管理者,旨在满足不同的需求:

  • Fugu(快手服务员): 这个版本专为日常使用而设计。当你提出一个问题时,它就像一个动作敏捷的服务员,能瞬间识别出厨房里哪位专家最适合处理你的订单。它会挑选一位专家立即完成任务。它速度快、延迟低,非常适合日常任务,且依然能精准选出最合适的人选。
  • Fugu-Ultra(大师级主厨): 这个版本适用于那些对速度要求不高、但对结果完美程度要求极高的极难复杂问题。它不仅仅是挑选一个人,而是组建一整支厨房团队。它可能会要求一位专家起草计划,第二位专家检查数学计算,第三位专家编写代码,第四位专家进行调试。它耗时较长,但它结合了整个团队的长处,来应对那些单个模型无法处理的难题。

2. 它如何学习:“星探”模式

你可能会问:“Fugu 是如何知道哪位专家最擅长处理哪类工作的?”

论文解释说,Fugu 的训练过程就像是一个星探

  • 训练过程: 研究人员给 Fugu 管理者提供了数千个问题。他们观察了不同的专家(即“工人”)在每个问题上的表现。
  • 学习过程: Fugu 学习到了其中的规律。例如,它学到了“Gemini 在科学问题上表现卓越”,而“GPT 是复杂的数学高手”,以及“Claude Opus 最擅长发现安全漏洞”。
  • 结果: Fugu 并没有死记硬背答案,而是学会了**路由(分发)**问题。它观察你的问题,思考:“啊,这需要一位数学专家,”然后立即将其发送给正确的模型。

3. 它的能力:“瑞士军刀”效应

报告显示,通过使用这种“团队协作”的方法,Fugu 在许多领域都超越了各个独立的专家。这就像拥有一把瑞士军刀,每一件工具都是该领域的顶尖版本,而且手柄知道何时该抽出哪件工具。

以下是论文中的一些具体案例:

  • 编程与软件: 在 AI 需要修复真实软件漏洞的测试中,Fugu-Ultra 表现最为出色。它会让一个“构建型”模型编写代码,然后切换到“调试型”模型寻找错误,最后再切换回来进行修复。这种往复循环的效果优于任何尝试独自完成任务的单一模型。
  • 科学与数学: 在高难度科学考试(如“人类最后考试/Humanity's Last Exam”)中,Fugu-Ultra 的得分高于各个独立的模型。它知道在物理问题中使用侧重数学的模型,而在生物问题中使用侧重科学的模型。
  • 创造性问题解决: 论文描述了一个测试,AI 需要找出散落在页面上的古老、杂乱的日语字符的阅读顺序。Fugu-Ultra 不仅仅是靠猜测;它编写了一个自定义程序来解决这个谜题,改进了程序,并比任何单一模型都能更好地解决问题。
  • 设计: 它甚至设计了一个可以正常移动的机械相机光圈(镜头中开合的部分),而其他模型设计的方案要么是损坏的,要么是无法运作的。

4. 为什么这很重要:“管弦乐团” vs. “独奏家”

这篇论文的核心观点是,我们并不一定需要构建一个单一的、规模巨大且极其昂贵的超级大脑来获得更强大的 AI。相反,我们可以构建一个懂得如何使用现有大脑的系统

  • 传统方式: 试图让一个模型变得如此庞大和聪明,以至于它能完美胜任所有工作。
  • Fugu 方式: 保留那些专业化的专家(数学家、程序员、科学家),并聘请一位聪明的管理者(Fugu)来协调他们。

论文声称,这种方法使他们能够实现“最先进(state-of-the-art)”的成果——这意味着在困难测试中取得了最高分——而无需从头开始训练一个新的大规模模型。它将一系列专门的工具转化为了一个单一且极其强大的系统。

简而言之: Sakana Fugu 是一个聪明的管理者,它清楚地知道在处理快速回答或复杂的步骤化谜题时,应该调用哪位 AI 专家,从而实现“整体大于部分之和”的智能水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →