← 最新の論文
💬 NLP

RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation

RaguTeam の SemEval-2026 タスク 8 における優勝システムは、GPT-4o-mini によるジャッジが最良の回答を選択するよう調整された 7 つの LLM の異種アンサンブルを採用し、最も強力なベースラインを大幅に上回ることで第 1 位を獲得するとともに、費用対効果の高い Meno-Lite-0.1 モデルを導入し、タスクのアノテーションの限界を批判しました。

原著者: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov

公開日 2026-05-07
📖 1 分で読めます☕ さくっと読める

原著者: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、この論文の説明を日常的な言葉で、いくつかの創造的な比喩を交えて翻訳したものです。

全体像:AI のための「タレントショー」

難しい質問に対する最良の答えを見つけるために、あなたがタレントショーを開催している状況を想像してください。あなたの手元には、それぞれ独自のスタイル、強み、弱みを持つ 7 人の審査員(AI モデル)がいます。中には巨大で超賢明な巨人もいれば、小さく専門的なエキスパートもいます。

ノボシビルスク州立大学のチーム、RaguTeamは、単に「最も賢い」審査員を選ぶだけではありませんでした。代わりに、7 人の審査員全員に答えを書かせ、その後、ヘッド審査員(GPT-4o-mini という軽量な AI)が 7 つの答えをすべて読み、その特定の質問に対して最も優れた 1 つを選び出すシステムを構築しました。

彼らはこのシステムを、AI が提供された文書のみに基づいて、長い会話の最中でもいかに質問に答えられるかをテストするSemEval-2026 Task 8(具体的には Task B)という大会に出場させました。彼らのシステムは、26 チーム中1 位を獲得しました。

問題点:「幻覚」の罠

現実世界では、AI はしばしばあまりにも親切すぎようとします。答えがわからない場合でも、自信ありげに聞こえるように何かを捏造(幻覚)してしまうのです。これは AI が事実確認役を務めるべき場合、危険です。

この大会の課題は、以下の点で難解でした。

  1. 多ターン会話: AI はチャットの前半で何と言われたかを記憶する必要があります。
  2. 厳格なルール: AI は提供された「参照パッセージ」のみを使用しなければなりません(閉じた本での試験のようなものです)。
  3. 「知らない」テスト: 文書に答えが含まれていない場合もあります。その際、AI は推測するのではなく、「知らない」と言うべきです。

彼らが勝った方法:「スイスアーミーナイフ」戦略

1. 多様なチーム(アンサンブル)

彼らは単一のスーパーコンピュータに頼るのではなく、7 つの異なる AI モデルからなるチームを使用しました。

  • 巨人たち: GLM-4.6(3570 億のパラメータ)のような巨大モデルを含めました。これらは百科事典のようです。
  • 専門家たち: Meno-Lite-0.1という、カスタム構築された小型モデルを含めました。これは 70 億パラメータのモデルですが、「クリエイティブな作家」ではなく「事実確認役」として特別にトレーニングされたものです。情報不足を見抜くのが非常に得意な、小回りの利く探偵のようなものです。
  • ミックス: Google、Meta、Microsoft などの異なる企業や、異なるサイズのモデルを使用しました。一つのモデルが間違っても、別のモデルが正解するかもしれないという考えです。

2. 2 つのプロンプトスタイル

彼らはモデルに同じように質問しただけではありませんでした。2 つの異なる「指示スタイル」を使用しました。

  • スタイル A(ルールブック): AI に提供されたテキストのみに厳密に従うよう指示する、厳格なルールセットです。
  • スタイル B(例題): 文書がない場合や会話履歴が空の場合など、厄介な状況への対処法を示すいくつかの例を AI に与えました。これは、本番前に学生に模擬試験を見せるようなものです。

3. ヘッド審査員(選別)

これが秘密の武器です。すべての質問について、7 つのモデルがすべて答えを生成しました。その後、ヘッド審査員(GPT-4o-mini)がそれらすべてを読み、「これらの答えの中で、どのものが文書に最も忠実か?」と問いました。

  • 文書が空の場合、システムは自動的に「知らない」と答えました(安全で完璧な手です)。
  • 文書に答えがある場合、ヘッド審査員は事実を捏造していないものを選びました。

主要な発見(「アハ!」の瞬間)

  • 多様性 > サイズ: 優勝チームは、最も大きく高価なモデルを持つことよりも、異なるモデルの組み合わせを持つ方が優れていることを証明しました。「チーム」は、単一の最優秀な巨人モデル(GLM-4.6)を大幅な差で破りました。これは、より広い範囲をカバーするリレーチームが、一人のランナーを破るようなものです。
  • 例題はルールに勝る: 「知らない」という状況への対処法を具体的な例(ファウショット・プロンプティング)として AI に与えた場合、抽象的なルールを与える場合よりもはるかに良いパフォーマンスを発揮しました。これは、子供に「優しくしなさい」と言うだけでなく、誰かが分け与える様子を動画で見せて教えるようなものです。
  • 小型モデルの役割: カスタム 7B モデル(Meno-Lite-0.1)は最も多くの票を獲得したわけではありませんが、選ばれた際には、それが完璧な答えであることがよくありました。それはニッチな状況で劇的な活躍をする「専門家」であり、すべての仕事に巨大な頭脳が必要ではないことを証明しました。

批判:ゲームは少し不正だった

著者たちは、大会自体の欠陥も指摘しました。

  • 「空の箱」の抜け道: テストでは、質問が「回答不能」である場合、提供された文書は完全に空でした。これにより、AI にとって勝利が容易すぎました。「空の箱」を検知して「知らない」と言うだけでよかったのです。
  • 現実世界はもっと難しい: 現実世界では、回答不能な質問には通常、無関係な文書(ディストラクター)が伴います。著者たちは、将来のテストにはこれらの「ディストラクター」を含めるべきだと主張しています。そうすれば AI はより苦労して、単に空白を検知するのではなく、実際にテキストを理解していることを証明する必要があるからです。

まとめ

RaguTeam は、AI の生成をタレントショーのように扱うことで勝利しました。彼らは多様なキャラクター(異なる AI モデル)を集め、異なる準備方法(プロンプト)を与え、すべてのラウンドの勝者を選ぶ賢い審判(ヘッド審査員)を雇いました。彼らは、よく連携した多様な AI のチームが、単独で働くどの AI よりも賢く、信頼性が高いことを示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →