NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track
NightFeatsは、検索、キュレーション、および構成という原則に基づいた3段階のパイプラインを採用することで、狭い指標の最適化ではなく、アーキテクチャの透明性と検証可能なエビデンスへの根拠付けを通じてプロプライエタリなベースラインを凌駕し、NeurIPS 2025においてBest Dynamic Evaluationを受賞した、コンテキスト最適化されたマルチエージェントRAGシステムである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
完璧で信頼できるレポートを書こうとしている自分を想像してみてください。ただし、一人ですべてを行うのではなく、3人の専門家チームが協力して作業している状態です。それが、NightFeatsの本質です。これは、質問に対して正確に答え、自らの仕事を検証し、常に「宿題(引用)」を提示するように設計された、スマートな3人組のAIエージェントチームです。
このチームは最近、NeurIPS 2025で開催されたMMU-RAGentという大きなコンペティションに参加しました。他のチームが、コンピュータのテスト上で「正解」に見える回答を作ることで勝利を狙った一方で、NightFeatsは**「Best Dynamic Evaluation(最優秀ダイナミック評価)」**という特別な賞を獲得しました。これは、コンピュータによる自動スコアリングでは最高点を取れなかったとしても、実在の人間が彼らの回答をより信頼性が高く、使いやすいと感じたことを意味しています。
NightFeatsチームの仕組みを、簡単なステップに分けて説明します:
1. 3人のスペシャリスト(エージェント)
一つのAIがすべてを一度に行うのではなく、NightFeatsはニュースルームのように、仕事を3つの明確な役割に分割しています。
リサーチャー(ResearchAgent): これは探偵です。質問を受けると、リサーチャーは単に最初に見つけた情報を拾い上げるだけではありません。2つの異なる場所から情報を探しに行きます。
- 「最新」ライブラリ: ニュースや最近の出来事については、最新のウェブ検索結果を探します。
- 「歴史」ライブラリ: 古く、基礎となる事実については、膨大なアーカイブを掘り下げます。
- テクニック: リサーチャーは、関連性(回答がいかに優れているか)と鮮度(いかに新しいか)のバランスを取るための特別な数式を使用します。これは、「歴史には10年前の本が最適だが、今日の株価については10分前のブログ記事の方が適している」と知っている司書のようなものです。
エディター(GeneratorAgent): これはファクトチェッカーです。リサーチャーはエディターに大量の文書を送ります。エディターはそれらを読み、主要な事実を抽出し、矛盾がないかを確認します。
- 「矛盾」チェック: もし一つのソースが「空は青い」と言い、別のソースが「空は緑だ」と言っていた場合、エディターはただ推測するのではなく、これを問題としてフラグを立てます。もしその矛盾が深刻なものであれば、エディターは議論を解決するためのさらなる証拠を見つけるよう、リサーチャーを再び外へ送り出します。ループに陥って動けなくなるのを避けるため、このプロセスは数回に限定されます。
ライター(WriterAgent): これはストーリーテラーです。エディターがクリーンで検証済みの事実リストを作成した後、ライターはそれをスムーズで読みやすい回答へと変えます。
- 黄金律: ライターが作成するすべての文章には、「レシート(引用)」が付着していなければなりません。何かを単に述べるだけでなく、どこでそれを聞いたのかを証明しなければなりません。これにより、最終的な回答は完全に追跡可能になります。
2. なぜ彼らが勝ったのか(「ダイナミック評価」賞)
コンペティションでは、システムを判定する方法が主に2つありました:
- ロボット・ジャッジ: 回答が「完璧な回答」と同じ言葉を使っているかをチェックするコンピュータプログラム。
- ヒューマン・ジャッジ: 回答を読み、最も好ましいものを選んだ実在の人間。
ロボット・ジャッジの問題点:
NightFeatsは、実はロボット・ジャッジのテスト(具体的にはROUGE-Lと呼ばれる指標)では低いスコアを記録しました。なぜでしょうか?それは、NightFeatsが多くの引用や参照(例:「ソースA、ソースB」)を含んでいるからです。ロボット・ジャッジは、「この回答には余計な言葉や数字が多すぎる。完璧な回答と一致していない!」と判断したのです。
ヒューマン・ジャッジでの勝利:
しかし、実在の人間はNightFeatsを愛しました。彼らは、高価でハイテクな「Claude-SonnetV2」や「Nova-Pro」といったシステムよりも、NightFeatsを好みました。人間は、単に聞こえの良いだけの回答よりも、明確なソースと検証された事実を含む回答の方が、はるかに信頼できることに気づいたのです。
3. 核となる哲学
この論文は、AIを構築することは、単にコンピュータを騙して高いスコアを出させることではなく、以下のようなシステムを構築することであると主張しています:
- 自らの仕事をチェックする(ファクトチェッカーのように)。
- 物事がいつのものかを知っている(時間的認識)。
- 出典を示す(引用の追跡可能性)。
トレードオフ
論文は、一つの欠点についても正直に述べています。NightFeatsは、事実確認のためにリサーチャーを送り出し、矛盾を確認するためにエディターを通さなければならないため、より速くて単純なシステム(6〜8秒)に比べると、回答を得るのに少し時間がかかります(約10〜15秒)。
まとめ:
NightFeatsは、3人が事実を確認し、日付を検証し、あらゆる主張にレシートを添付するまで、記事の公開を拒む高級ニュースルームのようなものです。これには少し時間がかかり、コンピュータのスキャナーには「乱雑」に見えるかもしれませんが、実在の人間は、それが誠実で正確であり、透明性があるため、より信頼しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。