← 最新论文
💬 NLP

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

NightFeats 是一个上下文优化的多智能体 RAG 系统,它通过采用检索、策展和组合这一原则性的三阶段流水线,通过架构透明度和可验证的证据落地而非狭隘的指标优化,在 NeurIPS 2025 中荣获最佳动态评估奖,并超越了专有基准模型。

原作者: Quentin Fever, Naziha Aslam

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Quentin Fever, Naziha Aslam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为一个复杂的主题撰写一份完美且值得信赖的报告,但你的团队是由三位专家协作完成,而不是由一个人独自承担所有工作。这本质上就是 NightFeats:一个智能的三人 AI 智能体团队,旨在准确回答问题、检查自身工作,并始终展示其“作业”(引用来源)。

该团队最近参加了一场名为 MMU-RAGent 的大型竞赛(在 NeurIPS 2025 举行)。虽然其他团队试图通过让答案看起来更符合计算机测试中的“正确”标准来取胜,但 NightFeats 赢得了名为 “最佳动态评估”(Best Dynamic Evaluation) 的特别奖。这意味着人类更青睐他们的答案,因为这些答案更可靠、更容易让人信任,即便计算机的自动评分并没有给他们打出最高分。

以下是 NightFeats 团队的工作方式,分为简单的步骤:

1. 三位专家(智能体)

NightFeats 并没有让一个 AI 同时尝试做所有事情,而是将工作拆分为三个不同的角色,就像一个新闻编辑室:

  • 研究员 (ResearchAgent): 这是侦探。当你提出问题时,研究员不会只是抓取它找到的第一条信息。它会去两个不同的地方搜寻信息:

    • “新鲜”图书馆: 对于新闻或近期事件,它会查看最新的网络结果。
    • “历史”图书馆: 对于古老的、基础性的事实,它会挖掘庞大的档案库。
    • 窍门: 它使用一种特殊的公式来平衡相关性(答案有多好)与新鲜度(信息有多新)。这就像一位知道对于历史而言一本十年前的书可能很完美,但对于今天的股市而言,一篇十分钟前发布的博客文章更好的图书管理员。
  • 编辑 (GeneratorAgent): 这是事实核查员。研究员将一堆文档发送给编辑。编辑阅读这些文档,提取关键事实,并寻找冲突。

    • “矛盾”检查: 如果一个来源说“天空是蓝色的”,而另一个来源说“天空是绿色的”,编辑不会仅仅靠猜测。它会将此标记为一个问题。如果冲突很严重,编辑会命令研究员再次外出寻找更多证据以解决争端。它只会这样做几次,以避免陷入无休止的循环。
  • 作家 (WriterAgent): 这是讲述故事的人。一旦编辑拥有了一份干净、经过验证的清单,作家就会将其转化为流畅、易读的答案。

    • 黄金法则: 作家生成的每一句话都必须附带一份“收据”(引用)。你不能只是陈述某事,你必须证明你从哪里听到的。这使得最终的答案具有完全的可追溯性。

2. 为什么他们赢了(“动态评估”奖)

在竞赛中,有两种主要的评判系统:

  1. 机器人裁判: 一个检查答案是否使用了与“完美答案”相同词汇的计算机程序。
  2. 人类裁判: 阅读答案并挑选出他们最喜欢的答案的真实人类。

机器人裁判的问题:
NightFeats 在机器人裁判的测试中得分实际上更低(具体是在一个名为 ROUGE-L 的指标上)。为什么?因为 NightFeats 包含了大量的引用和参考(如“来源 A,来源 B”)。机器人裁判认为:“这个答案包含了太多额外的词汇和数字,它与完美答案并不完全匹配!”

人类裁判的胜利:
然而,真实的人类非常喜欢 NightFeats。相比于像 “Claude-SonnetV2” 和 “Nova-Pro” 这样昂贵且高科技的系统,人类更倾向于选择它。人类意识到,一个带有清晰来源和经过验证的事实的答案,比一个听起来很好听但可能是编造出来的答案要值得信赖得多。

3. 核心理念

该论文认为,构建 AI 不应该仅仅是关于如何欺骗计算机以获得高分。它应该致力于构建一个这样的系统:

  • 检查自己的工作(像一个事实核查员一样)。
  • 了解事物何时过时(时间感知能力)。
  • 展示其来源(引用可追溯性)。

权衡

论文诚实地提到了一个缺点:由于 NightFeats 必须派遣研究员外出核实事实,并由编辑检查矛盾,因此它获得答案的时间会稍长一些(大约 10–15 秒),相比之下,更快速、更简单的系统仅需 6–8 秒。

总结:
NightFeats 就像一个高端新闻编辑室,在三个人核实事实、验证日期并将收据附在每一项主张上之前,拒绝发布任何报道。虽然这需要多花一点时间,并且在计算机扫描器看来可能显得有些“杂乱”,但真实的人们更信任它,因为它诚实、准确且透明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →