CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks
CoEvalは、ラベル付きデータを必要とせず、また公開されているベンチマークを信頼することなく、カスタムタスクに対して言語モデルを確実にランク付けするために、汚染のない属性制御されたベンチマークを生成し、多様なアンサンブル・ジャッジモデルを採用するオープンソースのフレームワークです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に特殊な仕事(例:「混沌とした倉庫の整理」や「ガーデニングに関する面白いジョークを書くこと」)のために、最高の従業員を選ぼうとしている採用マネージャーだと想像してください。あなたには問題があります。過去の実績レビュー(ラベル付きデータ)がなく、他の誰もが使っている標準的なテスト(公開ベンチマーク)は、候補者が事前に答えを暗記してしまっているため役に立たないということです。
これこそが、CoEvalが解決するまさにその問題です。これは、人間の専門家に採点させる必要も、カンニングを心配する必要もない、あなたの特定のニーズに合わせてAIモデルをランク付けするための新しいオープンソースツールです。
その仕組みを、簡単な比喩を用いて分解して説明します。
1. 「新鮮なテスト」生成器(カンニング禁止)
通常、AIモデルは、何年も前から存在する古いテスト(SATやGREのようなもの)を受けます。これらのテストは非常に人気があるため、AIモデルはトレーニング中に質問を見て、答えを暗答してしまっている可能性が高いのです。これは、数学を学ぶ代わりに解答集を丸暗記している学生のようなものです。
CoEvalはゲームのルールを変えます。古い質問を使う代わりに、「教師AI」を使用して、あなたのタスクの説明に基づいた、全く新しい質問をその場で発明します。
- 比喩: 数学のテストを、生徒が教室にいる間に作成する教師を想像してください。質問はその瞬間に存在しなかったため、生徒は答えを暗記することはできません。
- 結果: この論文は、これらの新しい質問が100%新鮮であることを証明しています。主要な公開テストバンクと13語のフレーズすら共有していないため、AIが古いデータを呼び出してカンニングすることは不可能です。
2. 「陪審員」による判定(数よりも多様性)
AIモデルがこれらの新鮮な質問に回答した後、誰かがそれらを採点しなければなりません。超スマートなAIに一つだけ採点を頼むこともできますが、それはリスクがあります。その単一の判定者は、短い優れた回答よりも長い回答を好むといった、奇妙なバイアスを持っている可能性があります。
CoEvalは「陪審員」方式を採用しています。異なる企業(例:OpenAI、Anthropic、Googleからそれぞれ一人ずつ)から集まった小さな判定グループを集めます。
- 比喩: 法廷を考えてみてください。もし不機嫌で知られている一人の裁判官がいれば、判決は不公平になるかもしれません。しかし、異なる背景を持つ3人の陪審員がいれば、彼ら個人の癖は互いに打ち消し合います。ある判定者が長い回答を好み、別の判定者がそれを嫌う場合、平均スコアは公平になります。
- 大きな発見: 論文では、陪審員に「誰が」いるかは、「何人」いるかよりも重要であることが判明しました。同じ会社の判定員を増やしても、彼らが共有するバイアスが増幅されるだけです。実際、単一の判定者は時として「逆相関」(間違った答えを出す)を示すことがありますが、多様な陪層員による判定がそうなることはほとんどありません。
3. 「人間不在」の工場
通常、優れたテストを構築するには、人間が質問を作成し、回答を採点する必要があります。これは遅く、かつ高価です。
- 比喩: CoEvalは、完全に自動化された工場のようです。あなたに設計図(タスクの説明)を与えれば、自動的に以下を行います:
- テストの質問を設計する。
- AI候補者にテストを受けさせる。
- 多様な陪審員を集めて回答を採点させる。
- 最終的なランキングを吐き出す。
- コスト: 著者らは、約8,000回の評価を含む大規模な研究を、コーヒー一杯の価格(5.89ドル)で実施しました。新しいAIモデルが登場するたびに新しいテストを実行できるほど安価です。
4. なぜこれが重要なのか
論文では、Co「正解」が存在しない3つの現実世界のシナリオにおいて、CoEvalをテストしました。
- 薬物相互作用: 二つの薬が衝突するかどうかを判断する。
- 臨床推論: 患者の症状を診断する。
- 法的分析: 法律を解釈する。
これらの分野には、標準的な「ゴールドスタンダード(黄金律)」となるテストが存在しません。CoEvalは、どのモデルがこれらの特定の仕事に最適であるかを示し、モデルをランク付けすることに成功しました。また、より小規模で安価なモデルが、実はより大規模なモデルよりも劣っていることさえも、単一のバイアスを持った判定者が見逃してしまう中で、正確に捉えました。
結論
CoEvalは次のように言っています。「古い、暗記されたテストを信じてはいけません。バイアスを持つ可能性のある単一の判定者に頼ってはいけません。代わりに、あなたの特定の仕事のために新鮮なテストを生成し、多様な小さなチームにそれを採点させてください。」
これは、AIのテストという複雑で高価なプロセスを、あらゆるチームが自分のニーズに合ったAIを見つけるために使える、安価で再現可能かつ公平なプロセスへと変えるものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。