← 最新の論文
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

本論文は、実ユーザーによる多ターン会話を対象とした初のブラジル・ポルトガル語チャットベンチマーク「Prosa」を導入し、従来のホリスティックな LLM によるジャッジ手法と比較して、バイナリ・ルブリック・スコアリングに多ジャッジフィルタリングを適用することが評価の安定性と識別力を大幅に向上させることを示しています。

原著者: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

都市で最高のシェフをランク付けしようとしていると想像してください。過去には、料理評論家に一品を味わわせて1から10の単一のスコアを付けてもらうことがありました。これは、現在のほとんどのAIモデルの評価方法と似ています。「審査員」AIが回答を読み、包括的なスコアを1つ与えるのです。

この論文が説明する問題点は、評論家によって好みが異なることです。ある人は辛い料理が大好きで、別の人は嫌悪するかもしれません。3人の異なる評論家に同じ16人のシェフをランク付けさせると、最悪のシェフについては全員が同意するかもしれませんが、最高のシェフについては完全に意見が分かれる可能性があります。これではランク付けの信頼性が損なわれます。

論文の解決策:「チェックリスト」方式

Prosa(ブラジルポルトガル語のAIチャットに関する新しいベンチマーク)の研究者たちは、ゲームのルールを変えることにしました。審査員に「この料理は全体的にどのくらい優れていますか?」と尋ねる代わりに、バイナリ(はい/いいえ)の質問からなる具体的なチェックリストを与えました。

  • 旧方式(包括的):「この会話を1から10で評価してください。」(主観的であり、バイアスを受けやすい)。
  • 新方式(ルーブリックに基づく):「AIは質問に答えましたか?はい/いいえ。丁寧でしたか?はい/いいえ。事実を捏造しませんでしたか?はい/いいえ。」

運転免許の試験のように考えてください。インストラクターが「まあまあ上手に運転できましたね、8点をつけましょう」と言う代わりに、特定の項目をチェックします。「方向指示器を使いましたか?はい/いいえ。赤信号で停止しましたか?はい/いいえ。」

「フィルタリング」の魔法

研究者たちは、チェックリストの項目自体が欠陥を持っている場合があることに気づきました。ある質問が非常に簡単で、すべてのシェフが合格してしまうか、逆に非常に難しく、全員が不合格になってしまうかもしれません。こうした「欠陥のある質問」はランク付けを混乱させます。

そこで、彼らはフィルタリング工程を追加しました。スコアを確定する前に、チェックリストを「品質管理」チームに通しました。難しすぎる、簡単すぎる、あるいは曖昧な質問を除外しました。これにより、良いシェフと素晴らしいシェフを実際に区別できる、鋭く高品質な質問セットが残されました。

大きな発見

ここが彼らの発見の中で最も驚くべき部分です:

  1. 審査員よりも方法が重要である: 従来の「1から10」方式を使用した場合、3社異なるAI審査員はトップシェフのランク付けにおいて完全に異なる結果を出しました。しかし、「チェックリスト+フィルタリング」方式に切り替えると、3人の審査員全員が16人のシェフすべてについて、全く同じランク付けで合意しました。
  2. コストが低い: チェックリストはタスクを単純なはい/いいえの質問に分解するため、審査を行うために超高額で「超賢明」なAIは必要ありません。安価で高速なAI(Gemini 3 Flash など)を使用しても、同じ完璧なランク付けが得られます。この方式で新しいモデルを評価するコストは約2.10ドルであり、他の方式に比べてはるかに低く抑えられています。

Prosaとは何か?

Prosaは、ブラジルポルトガル語における初のベンチマークです。

  • 実生活: 学校試験のような架空のテスト問題ではなく、ブラジルで実在の人々がAIと行った1,000の実際の会話を使用しました。これにより、人々が実際にどのように話し、どのような俗語を使用し、どのような実在の問題を解決しようとしているかが捉えられています。
  • 結果: 彼らは16種類の異なるAIモデルをランク付けしました。1位はOpenAIのGPT-5.2となり、GoogleとAlibabaのモデルがそれに続きました。興味深いことに、オープンソースモデル(Qwen3-235B)は非常に優れたパフォーマンスを発揮し、いくつかの高価なプロプライエタリモデルを凌駕しました。

まとめ

この論文は、AIモデルを公平にランク付けするためには、審査員に曖昧な「質の感覚」を求めるのをやめ、単純な事実に基づく厳格でフィルタリングされたチェックリストを使用すべきだと主張しています。この方法は特定の審査員のバイアスを排除し、ランク付けをより安定させ、コストを削減します。すべては、ブラジルからの実世界の会話をテストの場として用いて実現されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →