← 最新の論文
🤖 AI

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

本論文は、ブラジルの司法試験から派生した新たなベンチマーク Magis-Bench を紹介し、23 の最先端大規模言語モデルを裁判官レベルの法的推論および作成タスクで評価した結果、最高性能のモデルでさえ、論理的な司法判断を導き出す際に高いスコアを達成することに苦戦していることを明らかにする。

原著者: Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

高リスクの料理コンペティションを想像してください。通常、AI をテストする際、私たちは AI に料理(法的な主張や契約書の作成)を「作らせます」。しかし、実際の法制度において最も重要な役割は、単に料理を作ることではなく、その料理を「味見」し、良し悪しを判断し、合格または不合格の理由を説明する「裁判官」になることです。

本論文「Magis-Bench」は、AI をその「裁判官」としての役割でテストするものです。

課題:AI は裁判官になれるか?

法分野におけるほとんどの AI テストは、コンピュータに弁護士になってもらうことを求めます。「このクライアントのために弁護状を作成せよ」といった具合です。しかし、実際の裁判官はそれよりも難しいことを行わなければなりません。双方の主張を聞き、自らの感情を排し、厳格な規則を適用し、厳しく検証に耐えうる最終判断を下すのです。

著者たちは、以下のことを知りたがっていました:現在の AI モデルは、実際の裁判官のように振る舞うことができるでしょうか?

テスト:「治安判事」試験

これをテストするために、研究者たちは架空の質問を作成したわけではありません。2023 年から 2025 年にかけて、実際の裁判官を雇用するために使用された、非常に競争の激しいブラジルの試験から、74 の実在する問題を抽出しました。

これらの試験を、裁判官のための「司法試験」と考えてください。これらには以下のようなものがあります:

  • 論述問題:「ここに複雑な法的状況があります。法を説明してください。」
  • 作成課題:「ここに事実があります。完全な公式の裁判所判決(最終判決)を作成してください。」

重要なのは、すべての問題に**公式の解答用紙(評価基準)**が付属していたことです。これは、特定の法律に言及したり、特定の構造に従ったりした場合に、何点もらえるかを正確に示す教師の採点表のようなものです。

手法:AI 対 AI

23 人の人間裁判官に、23 種類の異なる AI モデルによる 74 本の論述を採点させることは、極めて費用がかかり、時間がかかるため、研究者たちは巧妙なトリックを用いました:AI に AI を採点させました。

  1. 出場者:Google、OpenAI、Anthropic などの企業から、利用可能な最も賢い AI モデル 23 種を選定しました。
  2. 裁判官:採点役として、4 つの非常に強力な別の AI モデルを使用しました。
  3. ルール:「裁判官 AI」は、誰が回答を作成したかを知りませんでした。彼らは、問題、公式の解答用紙、そして AI の回答だけを見て、0 から 10 までのスコアを与えました。

結果:AI「裁判官」は一致した

以下が起きたことです:

  • 裁判官たちは合意した:4 人の AI 裁判官は、ほぼ完璧に一致しました(合意率 98.4%)。これは、どのレストランが最高かを完全に一致して評価する 4 人の食通のようなものです。これにより、研究者はスコアが公平であり、単なる偶然ではないという確信を得ました。
  • 勝者:最上位の成績を収めたのは、Google の Gemini-3-Pro-Preview(スコア:10 点中 6.97 点)で、次いでGemini-3-FlashClaude-4.5-Opusが続きました。
  • 現実的なチェック:たとえ「勝者」であっても、獲得できたのは10 点中 6.97 点に過ぎませんでした。それは 70% 未満です。

意味するところ

本論文は、AI が法的タスクにおいて向上している一方で、裁判官のように振る舞うことは依然として非常に困難であると結論付けています。

  • 格差:現在の AI モデルは、教科書を暗記できる学生に似ていますが、人間の裁判官のようなニュアンスと権威を持って、複雑で現実的な状況に規則を適用することには苦労しています。
  • ベンチマーク:研究者たちは、すべての問題、解答、および採点コードを公開しました。これにより、他の科学者たちがこれらのモデルを継続的にテストし、改善することができます。

要約すると:私たちは AI に実際の裁判官の試験を受けさせました。最も賢いものでも「C」または「B」で合格し、彼らがより賢くなっている一方で、現時点では法廷で人間裁判官を代替する準備が整っていないことを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →